Leçon 2/4
40 min Exploitation de Data Center

Scénarios de défaillance à rejouer

Construire un plan de scénarios de panne représentatifs pour valider la résilience réelle du site en test intégré.

À retenir

  • Les scénarios de panne doivent découler de l'analyse de risque et du Basis of Design du site.
  • Les combinaisons de pannes (défaut + maintenance en cours) sont les scénarios les plus révélateurs.
  • Chaque scénario a besoin d'un critère de succès mesurable et d'un instrument de mesure dédié.
  • Les tests critiques doivent être reproductibles et tracés, idéalement filmés.

Tester la panne, pas seulement le fonctionnement normal

Un site data center n'est jamais réellement mis à l'épreuve tant qu'on n'a pas simulé les défaillances qu'il est censé absorber. Le test intégré en charge (L5, IST) doit rejouer les scénarios de perte identifiés dans le Basis of Design, sous charge représentative apportée par des bancs de charge résistifs ou réactifs.

Catégories de scénarios à couvrir

  • Perte d'une source électrique amont : coupure simulée d'une des deux arrivées HTA/BT, avec mesure du temps de bascule sur groupe électrogène et de la tenue en autonomie batterie/onduleur.
  • Défaillance d'un onduleur (UPS) : mise en défaut volontaire d'un module en configuration N+1 pour vérifier le report de charge sans coupure côté informatique.
  • Perte d'une chaîne de froid : arrêt d'un groupe frigorifique ou d'une CRAC pour observer la montée en température et le déclenchement des unités de secours.
  • Perte réseau/fibre : coupure d'un chemin de câblage redondant pour valider le failover réseau.
  • Combinaison de pannes : par exemple perte électrique amont pendant une maintenance programmée sur une unité de froid — souvent le scénario le plus révélateur, et le plus souvent oublié.

Point clé

le scénario le plus instructif n'est presque jamais la panne simple, mais la panne combinée avec une intervention de maintenance en cours, car c'est la situation réelle la plus fréquente en exploitation.

Construire le plan de test

  1. Lister les modes de défaillance issus de l'analyse de risque du site (souvent alignée sur les Tier Topology d'Uptime Institute).
  2. Définir pour chaque scénario : le déclencheur, le critère de succès mesurable (ex. « aucune coupure > 0 ms côté charge IT »), et les instruments de mesure.
  3. Séquencer les scénarios du moins au plus perturbateur, en terminant par les combinaisons de pannes.
  4. Prévoir un plan de repli si un test dégrade dangereusement la redondance du site en cours d'essai.
ScénarioCritère de succès typiqueInstrument de mesure
Perte source amontBascule groupe < 15 s, pas de coupure charge ITEnregistreur de tension
Défaut UPS moduleReport de charge sans coupureAnalyseur de puissance
Perte unité de froidTenue < seuil ASHRAE avant secours actifSondes température/humidité

Attention

un test de perte électrique mal préparé peut endommager des charges sensibles si les bancs de charge ne sont pas correctement dimensionnés et isolés du réseau de production ; toujours valider le schéma d'isolement avant le jour J.

Rejeu et preuve

Chaque scénario doit être rejouable et chaque résultat tracé (horodatage, valeurs mesurées, écarts au critère). Un scénario réussi une fois ne suffit pas si le résultat n'est pas reproductible : les meilleures pratiques recommandent au moins deux occurrences réussies pour les scénarios critiques.

Sur le terrain

sur un site Tier IV, l'équipe Cx a découvert lors d'un scénario combiné que deux générateurs redondants partageaient le même circuit de refroidissement moteur — invisible sur les schémas mais fatal en cas de panne simultanée du refroidissement commun.

Astuce

filmez les tests critiques (bascules électriques, montée groupe) ; la vidéo horodatée est une preuve de réception plus incontestable qu'un simple relevé manuscrit et facilite la formation des équipes d'exploitation.

Leçon précédente