Densité, alimentation et refroidissement associés
Calculer les besoins en puissance et refroidissement des racks GPU haute densité et choisir la technologie adaptée.
À retenir
- Au-delà de 20 kW/baie, un changement de technologie de refroidissement (DLC ou immersion) devient nécessaire.
- Le calcul de puissance doit intégrer overhead serveur et PUE, pas seulement la consommation GPU nominale.
- Les onduleurs doivent être dimensionnés pour les transitoires de charge, pas seulement la moyenne.
- Un PUE partiel par zone donne une vision plus fidèle qu'un PUE global sur un site mixte.
Des densités hors normes
Un rack de GPU dédié à l'entraînement (ex. 8 accélérateurs par serveur, plusieurs serveurs par baie) peut atteindre 30 à 100+ kW par baie, contre 5 à 10 kW pour un rack de calcul classique. À ce niveau, le refroidissement par air en allées chaudes/froides atteint ses limites physiques : le débit d'air nécessaire devient impraticable en bruit, en vitesse d'air et en volume de plancher technique.
Les paliers de refroidissement
| Densité | Technologie adaptée | Commentaire |
|---|---|---|
| < 10 kW/baie | Air, confinement simple | Salles standards |
| 10-20 kW/baie | Air + confinement renforcé, in-row cooling | Limite haute de l'air |
| 20-50 kW/baie | Refroidissement liquide direct (DLC) sur puces | Plaques froides sur GPU/CPU |
| 50-100+ kW/baie | Immersion ou DLC complet + boucle secondaire dédiée | Nécessite redesign de la distribution hydraulique |
Point clé
au-delà de 20 kW/baie, il ne s'agit plus d'un ajustement du système de refroidissement existant mais d'un choix d'architecture différent (liquid-to-chip ou immersion), avec des impacts sur la plomberie, la plateforme serveur et les contrats de maintenance.
Calcul d'un besoin électrique réel
Pour un cluster de 64 GPU consommant chacun 700 W en pleine charge, répartis sur 8 serveurs de 8 GPU :
- Puissance GPU seule : 64 × 700 W = 44,8 kW
- Overhead serveur (CPU, mémoire, ventilation, alimentation) : environ +30 % → 58,2 kW
- PUE du site (ex. 1,3) appliqué à la puissance IT totale : 58,2 × 1,3 ≈ 75,7 kW de puissance totale consommée au compteur pour ce cluster
Attention
le PUE d'un site classique (souvent calculé sur une charge mixte) ne reflète pas nécessairement l'efficacité réelle sur la zone dédiée à l'IA ; il est recommandé de suivre un PUE partiel par zone lorsque la densité varie fortement d'une salle à l'autre.
Redondance électrique en contexte GPU
La redondance N+1 classique sur les onduleurs reste pertinente, mais le courant d'appel élevé au démarrage d'un cluster GPU (inrush) et les variations rapides de charge liées aux cycles de calcul demandent des onduleurs dimensionnés pour absorber ces transitoires, pas seulement la puissance moyenne.
Sur le terrain
un centre ayant migré une salle de calcul classique vers des racks GPU sans revoir le dimensionnement des chemins de câbles électriques a dû doubler les circuits d'alimentation existants faute de capacité en ampérage, alors que la puissance nominale de l'onduleur semblait suffisante sur le papier.
Boucle de refroidissement liquide
Le refroidissement liquide direct nécessite une boucle secondaire (CDU — Coolant Distribution Unit) isolant le circuit interne de la baie du circuit de production de froid du site, avec surveillance de la conductivité, du pH et du débit du liquide de refroidissement.
Astuce
avant tout déploiement DLC, vérifiez la compatibilité du fluide de refroidissement fourni avec les matériaux des plaques froides du constructeur — un mélange non homologué peut provoquer corrosion et fuites en quelques mois.