DBT – Digital Box Technologies ·
Au niveau du calcul, étudiez une architecture de cluster adaptée aux objectifs de disponibilité, avec une capacité de secours suffisante et un comportement de quorum validé. Le redémarrage des machines virtuelles dépend de la configuration et des ressources encore disponibles.
Au niveau du stockage et du réseau, doublez les chemins : contrôleurs redondants, liens agrégés, commutateurs empilés ou en paire. Un seul câble ne doit jamais pouvoir arrêter la production.
Côté environnement, l'alimentation secourue, le refroidissement et la surveillance de la salle sont souvent négligés alors qu'ils sont à l'origine de nombreux incidents.
Enfin, testez. Une architecture résiliente est une architecture dont on a vérifié le comportement en simulant les pannes, et dont les procédures sont écrites.
Partir d’un service, pas d’une liste de matériels
Dessinez le parcours d’une application critique : poste utilisateur, réseau, pare-feu, annuaire, hyperviseur, stockage et alimentation. Pour chaque dépendance, demandez ce qui se passe si elle s’arrête. Deux serveurs raccordés au même équipement défaillant ne constituent pas deux chaînes indépendantes. Cette cartographie permet d’investir d’abord là où une panne bloquerait réellement le métier.
Prévoir le fonctionnement en mode dégradé
La capacité utile ne se calcule pas seulement lorsque tout fonctionne. Vérifiez que les ressources restantes peuvent supporter les charges prioritaires pendant une panne ou une maintenance. Les mécanismes de cluster, de quorum et de stockage doivent être étudiés ensemble. Le nombre de nœuds ne garantit pas, à lui seul, une haute disponibilité : configuration, ressources de secours et tests restent nécessaires.
Tester sans improviser un incident
Chaque exercice doit préciser le périmètre, les autorisations, les personnes présentes et le moyen d’interrompre le test. On peut commencer par une maintenance planifiée, puis vérifier un scénario de perte de lien ou de composant dans un cadre maîtrisé. Relevez les alertes, le temps de rétablissement, les actions manuelles et l’impact vu par un utilisateur. Un écran de supervision vert n’est pas une preuve de continuité métier.
Garder une stratégie de reprise distincte
La redondance améliore la disponibilité face à certaines pannes ; elle ne remplace pas les sauvegardes ni un PRA. Une corruption ou une erreur peut se propager à des composants redondants. Conservez donc des copies protégées et une procédure de restauration. Pour un site à Rabat ou ailleurs au Maroc, ajoutez au dossier les contraintes réelles d’alimentation, de liaison intersite et d’accès physique, sans présumer qu’elles sont identiques partout.