Какой GPU NVIDIA выбрать под ИИ и инференс
Коротко: Ускорители NVIDIA — фундамент современной инфраструктуры машинного обучения. Разница между моделями и форматами определяет, поместится ли ваша модель в память, как быстро пойдёт обучение и сколько карт удастся связать в один узел. Разберём поколения, форматы SXM/PCIe, роль памяти HBM и межкарточных связей, и как под ускоритель подобрать сервер и питание.
Зачем для ИИ отдельные ускорители
Обучение и инференс нейросетей — это массово-параллельные матричные вычисления, для которых GPU на порядки эффективнее CPU. Ключевые для ИИ характеристики ускорителя: производительность в форматах пониженной точности (FP16/BF16/FP8), объём и полоса памяти HBM, наличие тензорных ядер и скорость связи между картами. Именно память и межкарточные связи чаще всего ограничивают, какую модель вы сможете обучать.
Поколения NVIDIA для дата-центра
- Ampere (A100) — предыдущее поколение, HBM2e 40/80 ГБ. Всё ещё массово используется, хорошее соотношение цена/возможности.
- Hopper (H100, H200) — текущий стандарт для обучения больших языковых моделей. Transformer Engine, поддержка FP8, HBM3/HBM3e.
- Ada Lovelace (L40S, L4) — универсальные PCIe-карты под инференс, графику, видео и лёгкое обучение.
- Blackwell (B200, B100, GB200) — новейшее поколение под крупнейшие модели: резкий рост производительности и памяти, системы уровня стойки (GB200 NVL72).
Модели детально: A100, H100, H200, L40S, B200
A100 — 40 или 80 ГБ HBM2e, форматы SXM4 и PCIe; рабочая лошадка предыдущего цикла. H100 — 80 ГБ HBM3, Transformer Engine и FP8 кратно ускоряют обучение LLM; форматы SXM5 и PCIe. H200 — тот же вычислитель Hopper, но 141 ГБ HBM3e с большей полосой: заметно выгоднее для инференса крупных моделей, где всё упирается в память. L40S — 48 ГБ GDDR6, PCIe, отличный универсал для инференса и медиаобработки. B200 (Blackwell) — новое поколение с существенно большими памятью и пропускной способностью под фронтир-модели.
Формат SXM или PCIe
Это определяет мощность и связность:
- SXM — модули устанавливаются на плату-носитель (baseboard) в платформах HGX/DGX. Максимальный теплопакет (до 700 Вт), полноскоростной NVLink между всеми GPU узла через NVSwitch. Это выбор для многокарточного обучения, где карты активно обмениваются данными.
- PCIe — обычные карты в слот сервера, ниже теплопакет, NVLink опционально мостом между парой. Проще интегрировать и охлаждать; оптимальны для инференса и смешанных нагрузок.
Для тренинга больших моделей берут SXM-системы; для инференса и универсальных задач часто достаточно PCIe (H100 PCIe, L40S).
NVLink, NVSwitch и почему это важно
При обучении на многих GPU узким местом становится обмен данными между картами (all-reduce градиентов). Обычная PCIe для этого медленная. NVLink даёт прямые высокоскоростные линии между GPU, а NVSwitch связывает все карты узла на полной скорости «каждый с каждым». В SXM-платформах это встроено, что и делает их предпочтительными для масштабного тренинга. Для инференса одной-двух карт межкарточная связь менее критична.
Память HBM: сколько нужно
Модель (веса + активации + KV-кэш) должна помещаться в память GPU, иначе её приходится разбивать между картами с потерей скорости. Ориентиры по объёму: A100 — 40/80 ГБ, H100 — 80 ГБ, H200 — 141 ГБ, L40S — 48 ГБ. Для инференса LLM правило простое: больше HBM и выше её полоса — крупнее модель на одну карту и выше скорость генерации токенов. Поэтому H200 при том же чипе Hopper часто выгоднее H100 именно на инференсе.
Сервер, питание и охлаждение под GPU
Ускорители дата-центра требуют соответствующей платформы: HGX-плата под SXM или сервер с достаточным числом двойных PCIe-слотов и мощными БП (одна H100 SXM — до 700 Вт, узел из 8 карт — несколько кВт). Нужны продуманное охлаждение (воздух высокой плотности или жидкость), запас по питанию и стойка с соответствующим теплоотводом. Мы подбираем GPU, совместимые серверы (Supermicro, Dell, HPE), блоки питания и охлаждение комплектом и проверяем перед отгрузкой.
Как выбрать: коротко
- Обучение больших LLM, много карт → H100/H200 SXM в HGX/DGX.
- Инференс крупных моделей, память решает → H200 или несколько L40S.
- Универсальный инференс, графика, видео → L40S (PCIe).
- Бюджетное обучение/инференс → A100.
- Фронтир-модели, максимум → Blackwell B200 / GB200.
Купить GPU-ускорители NVIDIA: цены и наличие → Весь каталог →