
Refroidissement de racks GPU : garder les setups multi-GPU au frais pour les LLMs locaux et le calcul intensif
Vous faites tourner plusieurs GPU pour l'inférence LLM locale, l'entraînement IA ou le calcul intensif ? Découvrez les stratégies de refroidissement de rack éprouvées des datacenters — gestion du flux d'air, allées chaudes/froides, refroidissement liquide et conseils pratiques pour les racks GPU domestiques et petite échelle.
Le problème de la densité GPU
Faire tourner un GPU, c'est simple. En faire tourner quatre, huit ou seize dans un rack, c'est un défi d'ingénierie thermique. Chaque GPU haut de gamme rejette 300–700W de chaleur dans un espace confiné. Empilez-en quelques-uns et vous gérez des kilowatts de puissance thermique dans un volume plus petit qu'un réfrigérateur.
C'est plus pertinent que jamais. Inférence LLM locale, Stable Diffusion, fine-tuning IA, simulation scientifique — les raisons de monter des setups multi-GPU à domicile ou au bureau se sont multipliées. Mais les stratégies de refroidissement qui fonctionnent pour un PC gaming unique échouent complètement à l'échelle du rack.
Ce guide couvre ce qui fonctionne réellement, emprunté aux pratiques des datacenters et adapté à la communauté grandissante qui fait tourner du calcul GPU sérieux en dehors des installations hyperscale.
Comprendre la charge thermique
De combien de chaleur parle-t-on ?
| GPU | TDP | Charge typique (inférence LLM) | Charge max (entraînement) |
|---|---|---|---|
| RTX 4090 | 450W | 300–350W | 450W |
| RTX 5090 | 575W | 400–450W | 575W |
| A100 (SXM) | 400W | 300–350W | 400W |
| H100 (SXM) | 700W | 500–550W | 700W |
| L40S | 350W | 250–300W | 350W |
Un setup 4 GPU avec des RTX 4090 produit 1 200–1 800W de chaleur pour des workloads LLM typiques. Un nœud 8 GPU H100 atteint 4 000–5 600W. Ce n'est pas un problème de refroidissement — c'est un système de chauffage.
Pourquoi les workloads LLM sont thermiquement différents
L'inférence et l'entraînement LLM créent un profil thermique spécifique :
- Utilisation soutenue élevée. Contrairement au gaming (qui fluctue), l'inférence LLM maintient les GPU à 80–100% pendant des heures ou des jours.
- Les charges intensives en mémoire chauffent la VRAM. Les grands modèles remplissent entièrement la VRAM, ajoutant une charge thermique au-delà du die GPU.
- Le traitement par lots signifie que tous les GPU sont sollicités simultanément. Pas de charges décalées — chaque GPU atteint son pic en même temps.
Cette dissipation thermique soutenue et simultanée est ce qui rend le refroidissement de rack fondamentalement différent du refroidissement desktop.
Refroidissement par air à l'échelle du rack
Le principe allée chaude / allée froide
Les datacenters ont résolu cela il y a des décennies : séparez votre air d'admission de votre air d'échappement.
Dans un rack domestique ou de petit bureau :
- Tout l'équipement fait face à la même direction. L'air froid entre par l'avant, l'air chaud sort par l'arrière.
- Ne laissez pas l'air chaud recirculer vers l'avant. C'est l'erreur la plus courante dans les racks domestiques.
- Des panneaux obturateurs remplissent chaque emplacement vide. Sans eux, l'air chaud reboucle par les espaces vers le côté froid.
Même un rack ouvert simple bénéficie énormément d'une direction de flux d'air cohérente. Un jeu de panneaux obturateurs à 20 € peut réduire les températures GPU de 5–10°C en empêchant la recirculation.
Exigences de débit d'air
Le calcul est simple. Pour évacuer 1kW de chaleur avec une élévation de température de 10°C, il faut environ 280 CFM de débit d'air. Pour un setup 4× RTX 4090 sous charge :
- ~1 500W de production de chaleur
- ~420 CFM minimum requis
- Soit environ 4–6 ventilateurs 120mm haute pression statique à plein régime, rien que pour les GPU
Pour 8× H100 à 5 000W, il faut 1 400+ CFM — à ce stade, il faut des plateaux de ventilateurs rack ou des systèmes de soufflage.
Stratégies de placement des ventilateurs
Ventilateurs d'admission (avant du rack) :
- Montage à la hauteur d'admission des GPU — pas en haut ou en bas du rack
- Ventilateurs haute pression statique (3+ mmH₂O) car ils poussent l'air à travers des composants denses
- Noctua NF-A12x25 ou Phanteks T30-120 à 2000+ RPM pour les setups domestiques
- Ventilateurs industriels de 40mm d'épaisseur pour la haute densité
Ventilateurs d'extraction (arrière du rack) :
- Moins critiques si la pression frontale est adéquate — l'air chaud veut naturellement sortir
- Utiles pour éviter les points chauds dans les racks fermés
- L'extraction par le haut est efficace car l'air chaud monte
La réalité du bruit : Le refroidissement par air efficace pour les racks multi-GPU est bruyant. Un setup 4 GPU domestique sous charge produira 50–65 dBA. Un rack 8 GPU avec ventilateurs serveur atteint facilement 75 dBA+. Planifiez en conséquence — sous-sols, garages ou salles serveur dédiées sont des solutions courantes.
Refroidissement liquide pour racks GPU
Quand l'air ne suffit plus
Le refroidissement par air atteint ses limites pratiques à environ 2–4kW par rack dans la plupart des environnements domestiques/bureau. Au-delà, soit le bruit est extrême, soit le refroidissement est insuffisant. Le liquide devient la solution pratique.
Option 1 : AIO / CLC par GPU
L'approche la plus simple — un refroidisseur en boucle fermée par GPU.
Avantages :
- Pas de plomberie spéciale
- Chaque GPU est refroidie indépendamment
- Facile de remplacer un GPU individuel
- Compatible garantie pour les GPU grand public
Inconvénients :
- L'espace radiateur devient le goulot d'étranglement — 4 GPU × radiateur 240mm ≈ presque 1 mètre de radiateur
- Le routage des tuyaux dans un rack est compliqué
- Il faut toujours évacuer la chaleur du radiateur hors du rack
Idéal pour : Setups 2–4 GPU en rack standard ou châssis open-frame.
Option 2 : Boucle custom avec radiateur externe
Un seul circuit de refroidissement à travers tous les GPU, avec le radiateur monté entièrement à l'extérieur du rack.
Avantages :
- Élimine complètement la chaleur du rack
- Plus silencieux — les ventilateurs du radiateur externe peuvent être plus grands et plus lents
- Extensible de 4 à 8 GPU sur une boucle
Inconvénients :
- Plomberie complexe avec plusieurs waterblocks GPU
- Point de défaillance unique — une panne de pompe affecte tous les GPU
- Maintenance (changement de liquide, vérification de fuites)
Idéal pour : Setups 4–8 GPU où le bruit ou la température ambiante est un problème.
Option 3 : Échangeurs de chaleur en porte arrière
Un échangeur de chaleur monté sur la porte arrière du rack capture la chaleur à l'aide d'eau réfrigérée.
Avantages :
- Fonctionne avec des GPU refroidis par air — aucune modification nécessaire
- Peut gérer 20–40kW par rack
- Approche standard des datacenters
Inconvénients :
- Nécessite une infrastructure d'eau réfrigérée
- Coûteux (2 000–10 000€+ pour l'unité seule)
- Surdimensionné pour la plupart des utilisateurs domestiques
Idéal pour : Déploiements petit datacenter, racks 8+ GPU.
Option 4 : Refroidissement par immersion
Immerger entièrement le GPU dans un fluide diélectrique.
Avantages :
- Gère une densité extrême — 100kW+ par rack
- Fonctionnement quasi silencieux
- Pas de ventilateurs, pas de poussière, maintenance minimale
Inconvénients :
- Très coûteux (10 000€+ pour démarrer)
- Matériel et fluides spécialisés
- La maintenance signifie sortir le matériel d'un bac
Idéal pour : Laboratoires de recherche, opérations de minage, ou quiconque a épuisé les autres options.
Bonnes pratiques de disposition du rack
Espacement des GPU
N'empilez jamais les GPU dans des slots adjacents sans espace. Les GPU grand public avec refroidisseurs open-air ont besoin d'au moins un slot vide entre les cartes. Dans un rack :
- Châssis serveur 1U : Les serveurs GPU dédiés gèrent l'espacement en interne
- Châssis serveur 4U : Accueille typiquement 4–8 GPU avec canaux d'air intégrés
- Rack ouvert avec GPU type tour : Au moins 40–60mm entre les cartes, avec flux d'air dirigé
Placement de l'alimentation
Vos alimentations génèrent aussi de la chaleur. Dans un rack :
- Montez les alimentations pour que leur échappement n'alimente pas l'admission des GPU
- Circuits séparés pour l'alimentation GPU — un setup 4× RTX 4090 tire 15–20A sous 230V en pleine charge
- Alimentations serveur (80+ Titanium) — meilleure efficacité = moins de chaleur perdue
La gestion des câbles compte thermiquement
Ce n'est pas une question d'esthétique. Les câbles bloquant le flux d'air dans un rack GPU dense créent des points chauds :
- Routez les câbles d'alimentation le long des côtés du rack, pas dans le chemin d'air
- Utilisez des câbles courts — l'excès de longueur s'accumule et bloque l'air
- Velcro, pas de colliers de serrage — vous ajusterez le routage en ajoutant du matériel
Monitoring à grande échelle
Quoi surveiller
Le monitoring d'un seul GPU est facile. Le multi-GPU nécessite un système :
- Température par GPU :
nvidia-smiou HWiNFO64 pour les relevés en temps réel - Température d'admission : Un capteur USB (~15 €) à l'avant du rack
- Température d'échappement : Même capteur à l'arrière — le delta indique si le refroidissement est adéquat
- Puissance par GPU :
nvidia-smi --query-gpu=power.drawpour vérifier les charges
Objectifs de température pour le fonctionnement continu
| Composant | Objectif | Attention |
|---|---|---|
| Die GPU | Sous 80°C | Throttling typiquement à 83–90°C |
| VRAM (GDDR6X/HBM) | Sous 95°C | GDDR6X throttle à 110°C, mais se dégrade au-delà de 95°C |
| Air d'admission | Sous 30°C | Plus chaud = GPU plus chaud, ratio 1:1 |
| Air d'échappement | Sous 50°C | Au-dessus : débit d'air insuffisant |
| Delta (échappement - admission) | Sous 20°C | Plus haut = chaleur pas évacuée assez vite |
Alertes automatisées
Pour l'inférence LLM ou l'entraînement 24/7, configurez des alertes :
# Vérification simple de température nvidia-smi (Linux)
gpu_temp=$(nvidia-smi --query-gpu=temperature.gpu --format=csv,noheader,nounits | sort -rn | head -1)
if [ "$gpu_temp" -gt 85 ]; then
echo "Alerte température GPU : ${gpu_temp}°C" | mail -s "GPU Thermal Alert" [email protected]
fi
Ou utilisez Prometheus + Grafana avec le nvidia_gpu_exporter pour les tableaux de bord et l'historique.
Considérations au niveau de la pièce
Votre rack n'existe pas dans le vide
Un rack GPU dissipant 3kW dans une chambre augmente la température de la pièce de 5–10°C en une heure. La chaîne de refroidissement s'étend au-delà du rack :
- GPU → Airflow rack retire la chaleur du GPU
- Rack → Pièce pousse cette chaleur dans l'espace ambiant
- Pièce → Extérieur nécessite climatisation ou ventilation
Si l'étape 3 échoue, la température de la pièce monte jusqu'à ce que l'air d'admission soit trop chaud. Cet emballement thermique est le mode de défaillance le plus courant des racks GPU domestiques.
Refroidissement pratique de la pièce
- Climatisation dédiée : Un rack GPU de 3kW nécessite environ un climatiseur de 12 000 BTU (3,5kW). Budget : 300–1 500 €.
- Conduit d'échappement : Un conduit de l'échappement du rack vers une fenêtre. Option la moins chère, étonnamment efficace.
- Installation en sous-sol : Températures ambiantes naturellement plus basses = marge thermique gratuite.
- Garage ou local technique : Isole le bruit et la chaleur des espaces de vie.
L'humidité compte
Les GPU ne sont pas sensibles à l'humidité dans les plages normales (30–70% HR). Mais la condensation oui :
- Si l'échappement du rack donne sur l'air froid extérieur, de la condensation peut se former
- Une climatisation trop froide dans une pièce humide cause le même problème
- Maintenez la température au-dessus du point de rosée — généralement 18°C+ en humidité normale
De l'amateur au petit datacenter
1–4 GPU : le niveau passionné
- Tour standard ou montage rack open-frame
- Refroidissement par air généralement suffisant avec de bons ventilateurs
- Un circuit 20A gère la puissance
- Climatisation ou conduit d'échappement pour la chaleur
- Budget : 100–500 € pour l'infrastructure de refroidissement
4–8 GPU : le niveau sérieux
- Châssis serveur GPU dédié ou rack ouvert custom
- L'air fonctionne mais devient bruyant — envisager AIO par GPU ou boucle custom
- Circuit dédié 30–40A ou circuits multiples
- Pièce dédiée avec plan de refroidissement
- Budget : 500–3 000 € pour l'infrastructure de refroidissement
8–32 GPU : le petit datacenter
- Rack professionnel avec gestion allée chaude/froide
- Refroidissement liquide fortement recommandé
- Alimentation triphasée ou circuits dédiés multiples
- Infrastructure de refroidissement au niveau de la pièce
- Monitoring distant et alertes indispensables
- Budget : 3 000–20 000€+ pour l'infrastructure de refroidissement
32+ GPU : il vous faut un datacenter
À cette échelle, consultez des professionnels du refroidissement de datacenter. Les exigences dépassent le bricolage.
Erreurs courantes
1. « J'ajouterai plus de ventilateurs. » Les ventilateurs déplacent l'air, mais si l'air n'a nulle part de frais où aller, vous recirculez de l'air chaud. L'étape un est toujours la séparation admission/échappement.
2. Ignorer les températures VRAM. La température du die GPU attire toute l'attention, mais la VRAM GDDR6X sur les cartes comme la 4090 tourne 15–25°C plus chaud. Vérifiez avec nvidia-smi -q -d TEMPERATURE ou HWiNFO64.
3. Pas de panneaux obturateurs. Le changement le moins cher et le plus impactant. Remplissez chaque slot vide.
4. Fonctionner sans monitoring de température d'admission. Si votre pièce est à 35°C, vos GPU ne peuvent pas être frais.
5. Refroidissement de pièce sous-dimensionné. Chaque watt consommé par les GPU devient un watt de chaleur dans votre pièce.
6. Mélanger les directions de flux d'air. Chaque appareil du rack doit aspirer l'air de la même direction. Un appareil inversé crée des turbulences qui dégradent le refroidissement de tout le reste.
L'essentiel
Le refroidissement de rack GPU est un problème résolu — les datacenters le font depuis des décennies. Les principes de base sont simples :
- Séparer l'air chaud de l'air froid (allée chaude/froide, panneaux obturateurs)
- Déplacer assez d'air (calcul CFM basé sur la puissance)
- Évacuer la chaleur de la pièce (climatisation, conduits, ou les deux)
- Tout surveiller (temps GPU, temps ambiants, puissance)
- Dimensionner le refroidissement avec la densité (air → liquide → immersion en évoluant)
Faites-le bien et vous pouvez faire tourner de l'inférence et de l'entraînement multi-GPU 24/7 sans throttling, dégradation matérielle ou arrêts inattendus.
Test de stress GPU ? Essayez le test de stress ThermalStats pour mesurer vos températures GPU avant et après les améliorations.
Guides associés :
- Températures sûres CPU & GPU — Connaître vos objectifs thermiques
- Guide airflow du boîtier PC — Fondamentaux applicables aux racks
- Au-delà du CPU et GPU : refroidissement holistique — N'oubliez pas VRMs, RAM et SSDs
- Refroidissement air vs AIO — Compromis entre types de refroidissement
- Guide undervolting — Réduire la chaleur à la source
Soyez les premiers informés
Nous lançons bientôt la newsletter ThermalStats — conseils thermiques, guides de refroidissement et analyses de données directement dans votre boîte mail. Inscrivez-vous maintenant pour être en première ligne.
Pas de spam, jamais. Désabonnement à tout moment.