Ecoutez ici la version Podcast

LE CONTEXTE & LES ENJEUX
Evidemment on peut partir de l’évidence selon laquelle une baie qui héberge de la densité à d’autant plus de chaleur à dissiper et que, à environnement aéraulique équivalent, elle chauffera donc plus que ses voisines moins chargées.
Cependant pas mal de facteurs aggravants peuvent occasionner des points chauds même sur des baies à faible densité :
- Mauvaise disposition par rapport au soufflage
- Exposition de la face avant à la dissipation de chaleurs d’autres équipements
- Impossibilité physique de l’inclure dans un confinement (trop haute pour le confinement déja installé, ..)
- Dimensionnement et taux de perforation des dalles perforées
- Perte de charge (obstacle) sous le plancher
- Effet aéraulique indésirable sous le plancher (vortex)
- Bypass d’air chaud sous la baie et retour en face avant (effet venturi)
- Etouffement par la densité de câblage en face arrière
- Empoussierrement des fans arrières, …
Quand d’ailleurs plusieurs de ces situations ne se cumulent pas !
Pourtant, la première réaction à laquelle j’assiste encore trop souvent consiste à augmenter la consigne des CRAC/CRAH, à augmenter leur débit ou à ajouter de la puissance frigorifique.
Or, dans de nombreux cas, le problème n’est pas un manque global de froid, mais un mauvais acheminement du froid disponible.
Avec l’augmentation des densités, notamment liée aux GPU, à l’IA et aux architectures haute performance, cette problématique devient encore plus critique. L’ASHRAE recommande aujourd’hui de considérer la gestion des flux d’air, le confinement, la limitation du bypass et le suivi des températures au niveau des baies comme des fondamentaux de la performance thermique.
!!! Si le problème est localisé, la réponse doit l’être aussi !!!
Ne pas traiter le problème localement peut conduire à :
- Une augmentation des températures d’entrée des serveurs et des alarmes thermiques ;
- Une réduction des marges de fonctionnement et potentiellement de la disponibilité (résilience);
- Une augmentation inutile des débits et de la consommation énergétique des équipements de refroidissement ;
- Un refroidissement excessif du reste de la salle pour protéger une seule baie ;
- Une limitation de la capacité d’accueil de nouvelles charges informatiques.
Le véritable enjeu est donc moins de produire davantage de froid que de faire parvenir le froid existant exactement là où il est nécessaire.
LES BONNES PRATIQUES & NOS CONSEILS
La bonne pratique consiste à ne pas intervenir immédiatement sur le système de production frigorifique, mais à rechercher d’abord où se situe la rupture de la chaîne aéraulique.
La méthodologie type
1. Mesurer avant d’agir.
Relever les températures en entrée de baie, idéalement en plusieurs points de hauteur, ainsi que les températures ambiantes et, lorsque cela est pertinent, les débits ou vitesses d’air. Bien repérer les emplacement précis des mesures.
2. Identifier la nature du problème.
S’agit-il d’un manque de débit d’air froid ? (Mesure a l’anémomètre / débitmètre / ballomètre) D’une mauvaise distribution ? D’une recirculation d’air chaud ? D’un bypass ? D’une densité excessive de la baie ? D’un mauvais positionnement (trop proche du soufflage = effet venturi)
3. Vérifier la dalle située devant la baie.
Sa position, son taux de perforation et son débit doivent être cohérents avec le besoin réel de la baie. Une dalle trop éloignée ou mal dimensionnée peut devenir le maillon faible du refroidissement.
4. Contrôler le plénum sous plancher.
Câbles, traversées, ouvertures inutilisées et défauts d’étanchéité peuvent détourner une partie importante de l’air avant qu’il n’atteigne la baie. Un toron de câble oublié, un gros boitier électrique, un obstacle sont autant de freins à l’arrivée de l’air froid au droit de la dalle perforée.
5. Vérifier la séparation chaud/froid.
Une recirculation d’air chaud vers la face avant de la baie peut provoquer un hot spot même lorsque la capacité frigorifique globale est suffisante. Bien penser qu’une recirculation d’air chaud peut se produire dans le rack lui même (switch pas assez profonds pour rejoindre la face arrière, espaces latéraux non obturés de chaque côté des rails de rackage, …)
6. Traiter les fuites.
Obturation des U libres, passages de câbles, espaces sous les baies et autres chemins préférentiels de l’air, déflecteurs ou obturateurs sur mesure pour les cas spécifiques
7. Agir localement.
Lorsque le problème concerne une ou quelques baies, un dispositif de confinement ou de guidage local peut être beaucoup plus pertinent qu’une modification de l’ensemble de l’installation.
8. Mesurer après intervention.
La température d’entrée, la distribution du flux et éventuellement la consommation des équipements de refroidissement doivent être comparées avant/après. Replacer les mêmes instruments de mesure (CF. 1) et les replacer exactement au même endroits qu’avant les actions.
9. Vérifier la stabilité dans le temps.
Une baie peut être correcte aujourd’hui et devenir critique demain après l’ajout de serveurs, de GPU ou la modification de son urbanisation.
10. Intégrer le traitement au plan d’exploitation.
Le refroidissement doit devenir un sujet de maintenance et d’exploitation, au même titre que l’énergie, la disponibilité ou la sécurité.
L’ASHRAE va d’ailleurs clairement dans cette direction : Air management, confinement, limitation du bypass/recirculation et mesure granulaire au niveau des racks constituent les premières briques à optimiser avant d’ajouter des technologies de refroidissement plus complexes.
QUOI FAIRE ET POURQUOI ?
Je vous suggère 4 niveaux de prise en charge :
Niveau 1 — Optimiser l’aéraulique existante
C’est généralement la première étape :
- Repositionnement ou adaptation des dalles perforées ;
- Amélioration du débit d’air par la détection et la suppression des obstacles sous plancher ;
- Obturation des trous passe-câbles, des U libres ; gainage des switchs, occultations latérale sur baies de 800,
- Traitement des fuites sous les baies ;
- Réduction des vitesses et rééquilibrage des pressions
L’objectif est simple : ne pas produire plus de froid que nécessaire, mais mieux utiliser celui qui existe.
Niveau 2 — Identifier et simuler
Si les traitements du niveau 1 ne suffisent pas ; remettez-vous en à l’expertise de la CFD (Computational Fluid Dynamic). Ainsi vous identifierez rapidement et avec une grande précision les effets invisibles et insoupçonnables de défauts d’aéraulique en amont (soufflage) ou en aval (reprise). Vous porrez aussi et surtout simuler l’efficacité d’investissements plus lourds.
Parfois un simple caillebotis peut remplacer la dalle perforée mais attention car si votre salle n’est pas confinée, il peut aussi avoir pour effet de faire chuter la pression en plénum, ce qui pourrait avoir des effets pervers sur le reste de la salle et le refroidissement des autres racks
La CFD peut aussi simuler l’effet qu’aurait une dalle active (directement munie de son propre soufflage actif auto-régulé avec la baie à protéger) : Un équipement plus onéreux mais qui peut aussi s’avérer suffisant
Niveau 3 — Confiner localement la baie
Lorsque la baie est particulièrement sensible ou mal située, un confinement individuel peut constituer une réponse beaucoup plus rapide qu’un retrofit complet de l’allée.
Le Hot Spot Killer® est conçu dans cette logique : canaliser l’air froid sur la hauteur d’une baie et isoler thermiquement cette baie du reste de la salle, sans modifier lourdement l’urbanisation existante.
Niveau 4 — Passer au refroidissement rack-level ou liquide
Enfin, lorsque la densité devient réellement élevée (> 20 Kw), notamment avec certains environnements GPU/IA, le refroidissement par air peut atteindre ses limites.
Le refroidissement liquide, les portes arrière échangeuses de chaleur ou les solutions rack-level peuvent alors prendre le relais. Mais il est important de ne pas considérer le liquide comme une réponse automatique : même dans les architectures liquid cooling, une partie de la chaleur reste à gérer par l’air et la qualité de l’aéraulique demeure importante.
Si vous devez vraiment vous orientez vers la création d’une boucle de refroidissement liquide dans une salle existante, qui plus est en continuité de service, c’est possible mais dans ce cas pensez aux solutions à base de polymères : Des matériaux désormais largement éprouvé pour ces usages qui présentent l’avantage de travaux beaucoup moins intrusifs car plus rapide et sans aucun risque pour la contunuité de service
LES RÉFÉRENTIELS ET RESSOURCES UTILES
Référentiels techniques
- ASHRAE – AI Data Center Energy Performance Framework : Energy & Thermal Efficiency — recommandations actuelles sur l’air management, le confinement, le bypass, le réglage des débits et le monitoring au niveau rack.
- ASHRAE – Data Center Resource Page / TC 9.9 — portail de référence regroupant les ressources de l’ASHRAE sur les data centers.
- ASHRAE – Handbook, Chapter 20 : Data Centers and Telecommunication Facilities — architecture, refroidissement, efficacité énergétique et exploitation.
- ASHRAE – Thermal Guidelines for Data Processing Environments, 5e édition — référence pour les conditions thermiques des équipements IT.
Articles et retours d’expérience
- DCD – From air to liquid: Why the transition zone matters — particulièrement intéressant pour comprendre la transition entre refroidissement par air et refroidissement liquide.
- DCD – A “hot spot” you want to avoid: How to use data center containment — retour d’expérience sur le confinement et les hot spots.
- DCD – Controlling airflow in the data center — principes de gestion des flux.
- DCD – Cooling choices for rooms, rows and racks — excellente synthèse de l’évolution room → row → rack.
- DCD – Retrofitting for density — livre blanc 2026 consacré au retrofit pour les environnements haute densité.