
Стратегии охлаждения GPU-стоек: как держать мульти-GPU сетапы холодными для локальных LLM и тяжёлых вычислений
Запускаете несколько GPU для локального инференса LLM, обучения ИИ или тяжёлых вычислений? Изучите проверенные стратегии охлаждения серверных стоек из дата-центров — управление воздушным потоком, горячие/холодные коридоры, жидкостное охлаждение и практические советы для домашних и малых GPU-стоек.
Проблема плотности GPU
Запустить одну GPU — просто. Запустить четыре, восемь или шестнадцать в стойке — это задача тепловой инженерии. Каждая топовая GPU сбрасывает 300–700 Вт тепла в ограниченное пространство. Поставьте несколько рядом, и вы управляете киловаттами тепловой мощности в объёме меньше холодильника.
Сейчас это актуальнее, чем когда-либо. Локальный инференс LLM, Stable Diffusion, файн-тюнинг ИИ, научные симуляции — причины для мульти-GPU сетапов дома или в небольшом офисе резко выросли. Но стратегии охлаждения, которые работают для одного игрового ПК, полностью ломаются на масштабе стойки.
Этот гайд рассказывает, что реально работает — заимствовано из практики дата-центров и адаптировано для растущего сообщества людей, запускающих серьёзные GPU-вычисления вне гиперскейл-площадок.
Понимание тепловой нагрузки
О каком количестве тепла речь?
| GPU | TDP | Типичная нагрузка (инференс LLM) | Пиковая нагрузка (обучение) |
|---|---|---|---|
| RTX 4090 | 450 Вт | 300–350 Вт | 450 Вт |
| RTX 5090 | 575 Вт | 400–450 Вт | 575 Вт |
| A100 (SXM) | 400 Вт | 300–350 Вт | 400 Вт |
| H100 (SXM) | 700 Вт | 500–550 Вт | 700 Вт |
| L40S | 350 Вт | 250–300 Вт | 350 Вт |
Сетап из 4 GPU RTX 4090 производит 1 200–1 800 Вт тепла при типичных LLM-нагрузках. 8-GPU узел H100 — 4 000–5 600 Вт. Это не проблема охлаждения — это отопительная система.
Почему LLM-нагрузки термически отличаются
Инференс и обучение LLM создают специфический тепловой профиль:
- Устойчивая высокая нагрузка. В отличие от гейминга (с колебаниями), инференс LLM держит GPU на 80–100% часами или днями.
- Нагрузки на память греют VRAM. Большие модели полностью заполняют VRAM, добавляя тепловую нагрузку помимо самого чипа GPU.
- Пакетная обработка означает одновременную нагрузку на все GPU. Никакого поэтапного — каждая GPU выходит на пик одновременно.
Эта устойчивая, одновременная тепловая отдача — причина, по которой охлаждение стойки принципиально отличается от охлаждения десктопа.
Воздушное охлаждение в масштабе стойки
Принцип горячего/холодного коридора
Дата-центры решили это десятилетия назад: отделите входящий воздух от выходящего.
В домашней или офисной стойке это означает:
- Всё оборудование смотрит в одну сторону. Холодный воздух входит спереди, горячий выходит сзади.
- Не позволяйте горячему выхлопу рециркулировать к передней части. Это самая распространённая ошибка в домашних стойках.
- Заглушки закрывают каждый свободный слот. Без них горячий воздух проходит через щели обратно на холодную сторону.
Даже простой открытый рэк значительно выигрывает от постоянного направления воздушного потока. Комплект заглушек за 1 500 ₽ может снизить температуры GPU на 5–10°C, предотвращая рециркуляцию.
Требования к объёму воздуха
Расчёт прост. Чтобы отвести 1 кВт тепла при подъёме температуры на 10°C, нужно примерно 280 CFM воздушного потока. Для сетапа 4× RTX 4090 под нагрузкой:
- ~1 500 Вт тепловой отдачи
- ~420 CFM минимум
- Это примерно 4–6 вентиляторов 120 мм высокого статического давления на полной скорости, только для GPU
Для 8× H100 при 5 000 Вт нужно 1 400+ CFM — здесь уже нужны стоечные вентиляторные лотки или продувные системы.
Стратегии размещения вентиляторов
Входные вентиляторы (передняя часть стойки):
- Установка на высоте забора воздуха GPU — не сверху и не снизу стойки
- Вентиляторы высокого статического давления (3+ mmH₂O)
- Noctua NF-A12x25 или Phanteks T30-120 на 2000+ RPM для домашних сетапов
- Промышленные вентиляторы 40 мм толщиной для серьёзной плотности
Вытяжные вентиляторы (задняя часть стойки):
- Менее критичны, если фронтальное давление достаточное
- Полезны для предотвращения горячих точек в закрытых стойках
- Верхняя вытяжка эффективна, так как тепло поднимается
Реальность шума: Эффективное воздушное охлаждение для мульти-GPU стоек — громкое. Домашний сетап на 4 GPU под нагрузкой выдаёт 50–65 дБА. 8-GPU стойка с серверными вентиляторами легко достигает 75 дБА+. Планируйте соответственно — подвалы, гаражи или выделенные серверные комнаты.
Жидкостное охлаждение для GPU-стоек
Когда воздуха недостаточно
Воздушное охлаждение упирается в практические пределы примерно на 2–4 кВт на стойку. Дальше — либо экстремальный шум, либо недостаточное охлаждение. Жидкость становится практическим решением.
Вариант 1: AIO / CLC на каждую GPU
Простейший подход — по одному замкнутому водяному кулеру на GPU.
Плюсы:
- Нет кастомной разводки
- Каждая GPU охлаждается независимо
- Легко менять отдельные GPU
- Безопасно для гарантии потребительских GPU
Минусы:
- Радиаторное пространство — узкое место (4 GPU × 240 мм ≈ почти 1 метр)
- Разводка шлангов в стойке — бардак
- Тепло от радиаторов всё равно нужно выводить из стойки
Лучше всего для: Сетапов на 2–4 GPU в стандартной стойке или open-frame корпусе.
Вариант 2: Кастомный контур с внешним радиатором
Один контур через все GPU, радиатор полностью снаружи стойки.
Плюсы:
- Полностью убирает тепло из стойки
- Тише — вентиляторы внешнего радиатора могут быть больше и медленнее
- Масштабируется на 4–8 GPU
Минусы:
- Сложная разводка с несколькими водоблоками
- Единая точка отказа — поломка помпы затрагивает все GPU
- Обслуживание (замена жидкости, проверки на утечки)
Лучше всего для: Сетапов на 4–8 GPU, где шум или температура — проблема.
Вариант 3: Теплообменники задней двери
Стоечный теплообменник на задней двери захватывает тепло выхлопа охлаждённой водой.
Плюсы:
- Работает с GPU на воздушном охлаждении — без модификаций
- Справляется с 20–40 кВт на стойку
- Стандартный подход дата-центров
Минусы:
- Требует инфраструктуры охлаждённой воды
- Дорого (150 000–750 000 ₽+ только за устройство)
- Избыточно для большинства домашних пользователей
Лучше всего для: Небольших дата-центров, стоек на 8+ GPU.
Вариант 4: Иммерсионное охлаждение
Полное погружение GPU в диэлектрическую жидкость.
Плюсы:
- Справляется с экстремальной плотностью — 100 кВт+ на стойку
- Почти бесшумная работа
- Нет вентиляторов, нет пыли, минимум обслуживания
Минусы:
- Очень дорого (750 000 ₽+ на старт)
- Специализированное оборудование и жидкости
- Обслуживание = доставать из бака
Лучше всего для: Исследовательских лабораторий, майнинга или тех, кто исчерпал другие варианты.
Лучшие практики компоновки стойки
Расстояние между GPU
Никогда не ставьте GPU в соседние слоты без воздушного зазора. Потребительские GPU с открытыми кулерами требуют минимум один пустой слот между картами. В стойке:
- 1U серверный корпус: Специализированные GPU-серверы управляют зазорами внутри
- 4U серверный корпус: Обычно 4–8 GPU с интегрированными воздушными каналами
- Открытая стойка с tower-GPU: Минимум 40–60 мм между картами, с направленным потоком
Размещение блоков питания
БП тоже выделяют тепло. В стойке:
- Размещайте БП так, чтобы их выхлоп не попадал на вход GPU
- Отдельные линии для питания GPU — сетап 4× RTX 4090 потребляет 15–20 А при 230 В
- Серверные БП (80+ Titanium) — выше КПД = меньше тепла
Кабель-менеджмент термически важен
Это не про эстетику. Кабели, блокирующие поток, создают горячие точки:
- Силовые кабели — вдоль стенок стойки, не через путь воздуха
- Короткие кабели — избыток собирается и блокирует поток
- Велкро, а не стяжки — вы будете менять разводку при добавлении оборудования
Мониторинг в масштабе
Что отслеживать
Мониторинг одной GPU — просто. Мульти-GPU требует системы:
- Температура каждой GPU:
nvidia-smiили HWiNFO64 - Температура входящего воздуха: USB-датчик (~1 000 ₽) спереди стойки
- Температура выходящего воздуха: Такой же сзади — дельта показывает, достаточно ли охлаждения
- Потребление каждой GPU:
nvidia-smi --query-gpu=power.draw
Температурные цели для непрерывной работы
| Компонент | Цель | Внимание |
|---|---|---|
| Die GPU | Ниже 80°C | Тротлинг обычно с 83–90°C |
| VRAM (GDDR6X/HBM) | Ниже 95°C | GDDR6X тротлит при 110°C, но деградирует выше 95°C |
| Входящий воздух | Ниже 30°C | Теплее вход = теплее GPU, 1:1 |
| Выходящий воздух | Ниже 50°C | Выше — недостаточный объём воздуха |
| Дельта (выход - вход) | Ниже 20°C | Большая дельта = тепло не отводится быстро |
Автоматические оповещения
Для 24/7 инференса или обучения настройте алерты:
# Простая проверка температуры nvidia-smi (Linux)
gpu_temp=$(nvidia-smi --query-gpu=temperature.gpu --format=csv,noheader,nounits | sort -rn | head -1)
if [ "$gpu_temp" -gt 85 ]; then
echo "Алерт температуры GPU: ${gpu_temp}°C" | mail -s "GPU Thermal Alert" [email protected]
fi
Или используйте Prometheus + Grafana с nvidia_gpu_exporter для дашбордов.
Уровень помещения
Ваша стойка не в вакууме
GPU-стойка, сбрасывающая 3 кВт в спальню, поднимет температуру комнаты на 5–10°C за час. Цепочка охлаждения выходит за пределы стойки:
- GPU → Воздушный поток стойки — отводит тепло от GPU
- Стойка → Комната — выбрасывает тепло в помещение
- Комната → Улица — требует кондиционер или вентиляцию
Если шаг 3 не работает, температура растёт, пока входящий воздух не станет слишком тёплым. Этот тепловой разгон — самый частый сценарий отказа домашних GPU-стоек.
Практическое охлаждение помещения
- Выделенный кондиционер: 3 кВт стойке нужен примерно кондиционер на 12 000 BTU (3,5 кВт). Бюджет: 25 000–100 000 ₽.
- Вытяжной канал: Канал от выхлопа стойки к окну. Самый дешёвый вариант, удивительно эффективный.
- Подвал: Естественно более низкие температуры = бесплатный запас.
- Гараж или техническое помещение: Изолирует шум и тепло от жилых помещений.
Влажность имеет значение
GPU нечувствительны к влажности в нормальных пределах (30–70% RH). Но конденсат:
- Если выхлоп стойки выходит на холодный уличный воздух, может образоваться конденсат
- Слишком холодный кондиционер во влажном помещении — та же проблема
- Держите температуру выше точки росы — обычно 18°C+ при нормальной влажности
Масштабирование от хобби до малого дата-центра
1–4 GPU: уровень энтузиаста
- Стандартный тауэр или open-frame стоечное крепление
- Воздушное охлаждение обычно достаточно с хорошими вентиляторами
- Одна линия 20 А справляется с мощностью
- Кондиционер или вытяжной канал для тепла
- Бюджет: 7 000–35 000 ₽ на инфраструктуру охлаждения
4–8 GPU: серьёзный уровень
- Специальный GPU-серверный корпус или кастомная открытая стойка
- Воздух работает, но шумно — рассмотрите AIO на GPU или кастомный контур
- Выделенная линия 30–40 А или несколько линий
- Выделенное помещение с планом охлаждения
- Бюджет: 35 000–200 000 ₽ на инфраструктуру охлаждения
8–32 GPU: уровень малого дата-центра
- Профессиональная стойка с управлением горячим/холодным коридором
- Жидкостное охлаждение настоятельно рекомендуется
- Трёхфазное питание или несколько выделенных линий
- Охлаждение уровня помещения
- Удалённый мониторинг и алертинг обязательны
- Бюджет: 200 000–1 500 000 ₽+ на инфраструктуру охлаждения
32+ GPU: вам нужен дата-центр
На этом масштабе обратитесь к профессионалам. Требования по питанию, охлаждению, пожаротушению и резервированию выходят за рамки DIY.
Типичные ошибки
1. «Просто добавлю больше вентиляторов.» Вентиляторы двигают воздух, но если воздуху некуда деваться — вы рециркулируете горячий. Шаг первый — всегда разделение входа и выхода.
2. Игнорирование температур VRAM. Температура чипа GPU привлекает всё внимание, но GDDR6X VRAM на картах вроде 4090 работает на 15–25°C горячее.
3. Без заглушек. Самое дешёвое изменение с наибольшим эффектом. Закройте каждый пустой слот.
4. Работа без мониторинга входящей температуры. Если в комнате 35°C, GPU не могут быть холодными.
5. Недостаточное охлаждение помещения. Каждый ватт, потреблённый GPU, превращается в ватт тепла.
6. Смешение направлений воздушного потока. Каждое устройство в стойке должно забирать воздух с одной стороны.
Итог
Охлаждение GPU-стоек — решённая задача. Дата-центры занимаются этим десятилетия. Базовые принципы просты:
- Отделяйте горячий воздух от холодного (горячий/холодный коридор, заглушки)
- Двигайте достаточно воздуха (CFM по ваттам)
- Убирайте тепло из комнаты (кондиционер, вытяжка, или оба)
- Мониторьте всё (температуры GPU, окружающая среда, потребление)
- Масштабируйте охлаждение с плотностью (воздух → жидкость → иммерсия при росте)
Сделайте это правильно, и вы сможете запускать мульти-GPU инференс и обучение 24/7 без тротлинга, деградации и неожиданных выключений.
Запускаете стресс-тест GPU? Попробуйте стресс-тест ThermalStats для замера температур до и после улучшений.
Связанные гайды:
- Безопасные температуры CPU и GPU — Целевые диапазоны
- Гайд по воздушному потоку в корпусе — Основы, масштабируемые на стойки
- За пределами CPU и GPU: целостное охлаждение — Не забывайте VRM, RAM и SSD
- Воздушное охлаждение vs AIO — Компромиссы типов охлаждения
- Гайд по андервольтингу — Снижение тепла у источника
Будьте в курсе первыми
Скоро мы запускаем рассылку ThermalStats — советы по температурам, руководства по охлаждению и аналитические данные прямо на вашу почту. Подпишитесь сейчас, чтобы быть в первых рядах.
Никакого спама. Отписаться можно в любое время.