ITequipment.ruсетевое и серверное оборудование · МоскваПерейти в каталог →
Подбор оборудования

Какой сервер нужен под LLM: считаем память и выбираем платформу

Сервер под LLM подбирают в три шага: сколько памяти займёт модель в выбранной точности, сколько добавят KV-кэш и одновременные пользователи, и какая платформа даёт эту память с нужной скоростью. Ниже — методика, калькулятор и типовые конфигурации.

Параметры × байтыобъём весов
+20–50 %KV-кэш и запас
1 → 8 GPUот станции до HGX
NVLinkбыстрая связь GPU

Шаг 1. Память под веса

Объём весов ≈ число параметров × байты на параметр. В 16 битах (FP16/BF16) — 2 байта, в 8 битах — 1 байт, в 4 битах — 0,5 байта. Модель на 70 млрд параметров займёт около 140 ГБ в FP16, 70 ГБ в FP8 и 35 ГБ в INT4.

Шаг 2. KV-кэш и пользователи

При генерации модель хранит промежуточные результаты для каждого токена контекста — KV-кэш. Он растёт с длиной контекста и числом одновременных диалогов. Для чата с короткими запросами закладывают около 20 % сверху, для длинных документов и десятков пользователей — 50 % и больше. Серверы инференса (vLLM и аналоги) эффективно распределяют кэш, но физическая память всё равно нужна.

Сколько видеопамяти нужно под модель

Грубая оценка: веса = параметры × байты на параметр, плюс запас на KV-кэш и активации. Точный расчёт зависит от длины контекста, числа одновременных пользователей и движка (vLLM, TensorRT-LLM, llama.cpp).

Шаг 3. Выбор платформы

ЗадачаПлатформаПочему
Разработчик, пилот, модели до ~70 млрд в 4 битахНастольная AI-станция с единой памятью или рабочая станция с одной картой на 48–96 ГБНедорого, тихо, не нужен ЦОД
Отдел, 10–50 пользователей, модели 30–70 млрдСервер 2U/4U на 2–4 PCIe-ускорителяЗапас памяти под KV-кэш и одновременные запросы
Компания, сотни пользователей, модели 70–400 млрдСервер HGX на 8 ускорителей с NVLinkМодель делится между GPU с минимальными задержками
Обучение и дообучение больших моделейНесколько узлов HGX/DGX + InfiniBand или Ethernet 400GНужна быстрая сеть между узлами

Скорость: что кроме памяти

Скорость генерации ограничена пропускной способностью памяти ускорителя, поэтому HBM-память серверных GPU даёт больше токенов в секунду, чем обычная. При разбиении модели на несколько GPU важна связь между ними: NVLink в HGX-платформах быстрее PCIe в разы. Для многих пользователей решает пакетная обработка в движке инференса.

Питание, охлаждение и стойка

Одна карта рабочей станции — сотни ватт; сервер на 8 ускорителей потребляет порядка 10 кВт и больше. Проверьте мощность вводов, PDU, ИБП и охлаждение до покупки. Мы считаем энергопотребление и тепловыделение под конкретную конфигурацию.

Оборудование в каталоге

Читайте дальше

Купить сервер под LLMGPU-серверыКонфигуратор

Вопросы и ответы

Вопросы по теме

Какой сервер нужен для модели на 70 млрд параметров?
В 4 битах — около 40 ГБ плюс кэш: одна карта на 48–96 ГБ. В 8 битах — около 70 ГБ плюс кэш: карта на 96–141 ГБ или две карты. В 16 битах — 140+ ГБ: 2–4 ускорителя.
А под модель на 400+ млрд?
Даже в 8 битах это сотни гигабайт — сервер на 8 ускорителей с большой памятью (HGX H200 / B200 класса) или несколько узлов.
Можно ли смешивать разные видеокарты?
Технически возможно, но производительность ограничит самая слабая, а настройка усложнится. Для продакшена берут одинаковые ускорители.
Что лучше: две карты поменьше или одна большая?
Одна большая проще и быстрее для одной модели; две карты дают резерв и параллельную работу нескольких моделей. Решаем по задаче.
Подберёте конфигурацию?
Да: пришлите модель, точность, длину контекста и число пользователей — посчитаем память, скорость, потребление и пришлём КП.