13.08.2026 · 9 мин

Как собрать сервер для локального запуска нейросетей с нуля

Как собрать сервер для локального запуска нейросетей с нуля

Сервер для локального запуска нейросетей строится вокруг связки из видеокарты с достаточным объёмом VRAM, процессора с нужным числом линий PCIe, оперативной памяти не меньше объёма видеопамяти, быстрого NVMe-накопителя и блока питания с запасом мощности. Главный компонент здесь один: GPU. Именно объём его памяти определяет, какую модель вы вообще сможете запустить, а не частота процессора или количество ядер.

Дальше разберём по шагам, что и зачем выбирать, и с чего вообще начинается расчёт конфигурации.

С чего начать: определите задачу, а не бюджет

Прежде чем смотреть на комплектующие, ответьте на два вопроса. Первый: что вы будете делать, инференс (запуск готовой модели) или обучение и дообучение (fine-tuning)? Второй: с моделями какого размера вы будете работать?

Это принципиально разные нагрузки:

  • Инференс: модель уже обучена, вы просто получаете от неё ответы. Требования к VRAM ниже, к вычислительной мощности тоже. Один GPU часто закрывает задачу полностью.
  • Обучение и дообучение: здесь помимо весов модели в память нужно поместить градиенты, состояния оптимизатора и активации. VRAM требуется в 3-4 раза больше, чем для инференса той же модели, и часто нужно несколько GPU.

Бюджет сборки является следствием задачи, а не отправной точкой. Одна и та же цель («запускать нейросеть локально») может стоить как один б/у GPU на 12 ГБ, так и сервер с четырьмя картами по 80 ГБ: разница в том, какую модель и с какой скоростью вы хотите получать. Дальше в статье будет несколько конфигураций под разные задачи, ориентируйтесь по ним, а не по абстрактной цифре бюджета.

Видеокарта: главный компонент сборки

Сколько VRAM нужно под конкретную модель

Есть рабочее правило для оценки объёма видеопамяти под инференс LLM: вес модели в памяти примерно равен количеству параметров, умноженному на размер типа данных.

ТочностьБайт на параметрМодель 7BМодель 13BМодель 34BМодель 70B
FP162 байта~14 ГБ~26 ГБ~68 ГБ~140 ГБ
INT81 байт~7 ГБ~13 ГБ~34 ГБ~70 ГБ
INT4 (квантизация)0,5 байта~4 ГБ~7 ГБ~17 ГБ~35 ГБ

К этим цифрам нужно добавить память под контекст (KV-кеш) и служебные накладные расходы. Закладывайте запас 15-25% сверху. Для обучения и дообучения объём умножайте минимум на 3-4.

Вывод из таблицы простой: если вы собираетесь работать с 7B-13B моделями в квантизации, хватит одной карты на 16-24 ГБ VRAM. Для 70B в приличном качестве нужны уже десятки гигабайт видеопамяти: одна серверная карта уровня A100 либо несколько карт поменьше, объединённых через NVLink или разделение слоёв модели. Весь ассортимент серверных и потребительских видеокарт для ИИ-задач смотрите в каталоге видеокарт.

Домашние игровые или серверные GPU

  • Consumer-карты, например GeForce RTX 4090: хорошее соотношение цена/производительность на инференсе, доступны на вторичном рынке, но не рассчитаны на круглосуточную нагрузку в стойке и обычно не поддерживают NVLink.
  • Серверные карты, например Tesla V100 или NVIDIA A100: спроектированы для нагрузки 24/7, лучше охлаждаются в серверном шасси, поддерживают объединение памяти между картами, но стоят дороже и требуют серверной инфраструктуры (питание, охлаждение, иногда райзеры и специфичные материнские платы).

Если планируете объединять несколько карт Tesla V100 в одну систему с общей памятью, понадобится NVLink-мост для Tesla V100 SXM2.

Что выбрать между конкретными моделями (Tesla V100, A100 и RTX 4090) разбираем отдельно в статье «Tesla V100 vs A100 vs RTX 4090: что выбрать для инференса». Тут вопрос упирается в объём VRAM, пропускную способность памяти и то, инференс у вас или обучение.

Процессор: не гонитесь за частотой, смотрите на линии PCIe

Для нейросетевых нагрузок CPU почти не участвует в вычислениях: всю работу делает GPU. Процессор нужен для того, чтобы:

  • обеспечить каждой видеокарте достаточно линий PCIe (в идеале x16 на карту, минимум x8 без сильной потери скорости обмена данными);
  • не создавать узкое место при подготовке данных и загрузке модели в память.

Для сборки с одной-двумя картами хватит среднего серверного или десктопного процессора с 8-16 ядрами. Для конфигураций на 4-8 GPU нужна платформа с большим количеством линий PCIe: это, как правило, серверные процессоры вроде AMD EPYC, у которых 64-128 линий PCIe против 20-24 у десктопных чипов.

Оперативная память: не меньше объёма VRAM

Простое рабочее правило: объём RAM должен быть не меньше суммарного объёма VRAM всех установленных видеокарт, а лучше с запасом в 1,5-2 раза.

Зачем это нужно, если модель и так грузится в видеопамять:

  • при офлоаде части слоёв модели на CPU (когда VRAM не хватает) недостающие слои считаются с использованием оперативной памяти;
  • при подготовке датасетов и промежуточных операциях система активно использует RAM;
  • на сервере с несколькими GPU операционная система и драйверы сами по себе съедают заметный объём.

Для сборки с одной картой на 24 ГБ комфортно иметь 32-64 ГБ RAM. Для многокарточного сервера с суммарным объёмом VRAM в 100+ ГБ нужно от 128 ГБ и выше. Подбирайте модули под конкретную материнскую плату и процессор: количество каналов и максимальный поддерживаемый объём у серверных и десктопных платформ отличаются.

Накопитель: NVMe, а не SATA SSD

Веса современных моделей исчисляются десятками и сотнями гигабайт. Загрузка модели с диска в память происходит не один раз: она повторяется при каждом перезапуске, обновлении или переключении между моделями. Разница в скорости между SATA SSD (~550 МБ/с) и NVMe (2000-7000 МБ/с) выливается в минуты ожидания на каждой загрузке.

Рекомендация по объёму: от 1 ТБ NVMe, если планируете держать локально больше одной-двух моделей. Веса, чекпоинты и датасеты для дообучения занимают место быстро. Для подключения нескольких NVMe-накопителей на одну плату или через внешний интерфейс пригодятся платы расширения PCIe-NVMe и переходники из раздела серверных комплектующих.

Материнская плата и корпус: считайте слоты и зазоры

Здесь чаще всего ошибаются новички, которые собирают сервер по аналогии с игровым ПК:

  • количество слотов PCIe x16 должно совпадать с количеством GPU, которые вы планируете установить: не только сейчас, но и с запасом на апгрейд;
  • физический зазор между слотами важен: двух- и трёхслотовые карты перекрывают соседние слоты, если между ними нет достаточного расстояния;
  • для 3+ карт в потребительском корпусе почти всегда нужны райзеры и вертикальное крепление либо сразу серверное шасси с продуманной вентиляцией;
  • серверные пассивные карты (без собственных вентиляторов) в принципе не будут охлаждаться в обычном ATX-корпусе: им нужен направленный поток воздуха от серверных вентиляторов шасси.

Для сборок на 1-2 видеокарты компактные корпуса можно выбрать на странице корпусов. Под 3+ карт с полноценным серверным охлаждением нужна уже отдельная платформа, для подбора оставляйте заявку на сайте.

Блок питания: считаем с запасом, а не впритык

Мощность блока питания должна перекрывать суммарное потребление всех GPU под пиковой нагрузкой плюс CPU, накопители и материнскую плату, с запасом 20-30% на пиковые скачки. Если у вас 2-4 GPU в одном сервере, экономить на этом расчёте не стоит: недостаточный запас мощности приводит к нестабильности и внезапным перезагрузкам под нагрузкой.

Охлаждение

Видеокарты для ИИ-задач под длительной нагрузкой греются сильнее, чем в играх: инференс и тем более обучение загружают GPU на 90-100% часами или сутками напролёт. Для стабильной работы важны:

  • достаточный воздухообмен в корпусе (положительное давление, направленный поток от передней панели к задней);
  • отдельное внимание температуре VRAM и силовых элементов, а не только температуре ядра GPU;
  • для серверных пассивных карт обязателен принудительный обдув от корпусных вентиляторов: без него карта уйдёт в троттлинг за минуты.

Для пассивных серверных карт вроде Tesla V100 есть отдельное решение: кожух с медным радиатором и турбиной, который превращает пассивную карту в активно охлаждаемую вне серверного шасси. Такие кожухи и другие комплектующие для видеокарт можно найти в каталоге нашего сайта.

Программная часть: без неё железо бесполезно

Сборка железа только половина дела. Дальше нужно:

  • Операционная система. Для серверных задач подавляющее большинство берёт Linux (Ubuntu Server, Debian): лучше поддержка драйверов NVIDIA, стабильнее под длительной нагрузкой, проще автоматизировать.
  • Драйверы и CUDA. Нужна актуальная версия драйвера NVIDIA и совместимая с ней версия CUDA Toolkit под используемый фреймворк.
  • Фреймворк или инференс-движок. Выбор зависит от задачи: llama.cpp и Ollama для локального запуска LLM на потребительском железе, vLLM для высоконагруженного инференса, PyTorch с Transformers, если планируете дообучение.

Чаще всего фраза «всё железо на месте, а нейросеть не запускается» означает несовместимость версий драйвера, CUDA и фреймворка. Проверяйте таблицы совместимости версий заранее, до покупки железа.

Примеры конфигураций под разные задачи

Точная стоимость зависит от того, берёте вы новое оборудование или б/у, и от текущих цен в каталоге. Ориентиры ниже касаются железа, а не рублей.

ЗадачаGPURAMНакопительОсобенности
Инференс небольших LLM (7B-13B) для личных задач1 карта, 16-24 ГБ VRAM32-64 ГБ1 ТБ NVMeХватает потребительской видеокарты, обычный десктопный корпус
Инференс средних моделей (34B) / генерация изображений1 карта, 24-48 ГБ VRAM, либо 2 карты меньшего объёма64-128 ГБ1-2 ТБ NVMeУже стоит смотреть на серверную платформу с достаточным числом линий PCIe
Инференс крупных моделей (70B+) и лёгкое дообучение2-4 карты, суммарно 80-160+ ГБ VRAM128-256 ГБ2-4 ТБ NVMeСерверное шасси, продуманное охлаждение и питание, серверный CPU
Полноценное обучение/дообучение под бизнес-задачи4-8 серверных карт уровня A100/H100256+ ГБ4+ ТБ NVMeСерверная платформа целиком, NVLink между картами, отдельный расчёт БП и охлаждения

Если не готовы разбираться в подборе совместимых компонентов самостоятельно, эту часть можно отдать на аутсорс. Подробнее об этом читайте в последнем разделе статьи.

Новое или б/у оборудование

Для GPU-серверов вторичный рынок не компромисс, а рабочий вариант: серверные карты вроде Tesla V100 после списания из дата-центров по факту наработали часы, но сохраняют характеристики и вполне подходят под инференс и обучение. В каталоге G.Race видеокарты продаются и новые, и б/у, статус указан в карточке товара. Разбор того, что выбрать по трём критериям (бюджет, скорость получения оборудования и критичность задачи), читайте в отдельной статье «Новое или Б/У серверное оборудование: что выбрать».

Итог и сборка под ключ от G.Race

Порядок сборки сервера для локального запуска нейросетей такой: сначала определяете задачу и размер моделей, с которыми будете работать, из этого считаете нужный объём VRAM. Дальше подбираете GPU, а под него уже процессор с достаточным числом линий PCIe, RAM не меньше объёма видеопамяти, NVMe-накопитель, корпус с нужным числом слотов и блок питания с запасом. И только в конце устанавливаются драйверы, CUDA и фреймворк: без них даже идеально подобранное железо не запустит ни одну модель.

Если разбираться во всём этом самостоятельно и подбирать совместимые компоненты нет времени или желания, этим занимаемся мы - компания G.Race: подбираем конфигурацию под задачу и бюджет, комплектуем железом (новым или б/у, видеокарты, процессоры и комплектующие поставляются напрямую из Китая), тестируем перед отправкой и присылаем готовый к работе сервер. Доставка в РФ занимает 21-28 дней, гарантия предоставляется, сделка оформляется официально: договор, счёт, акт или накладная. Мы работаем и с физлицами, и с юрлицами, оборудование можно посмотреть вживую в шоуруме, а цены на 20-45% ниже среднерыночных по РФ за счёт прямых поставок.

Готовые серверные сборки на Tesla V100 с NVLink и жидкостным охлаждением уже есть в каталоге: готовые сборки серверов для ИИ. Там же можно обсудить индивидуальную конфигурацию под вашу задачу.

FAQ

Сколько VRAM нужно для запуска LLM на 7B, 13B и 70B параметрах?+

В FP16 это примерно 14 ГБ, 26 ГБ и 140 ГБ соответственно. В квантизации INT4 около 4 ГБ, 7 ГБ и 35 ГБ. Для комфортной работы с контекстом добавляйте к этим цифрам запас 15-25%.

Можно ли использовать домашний ПК вместо сервера?+

Для инференса небольших и средних моделей на одной видеокарте домашнего ПК вполне достаточно. Разница с сервером в основном в стабильности под долгой нагрузкой и возможности расширения до нескольких GPU. Для многокарточных конфигураций и обучения нужна уже серверная платформа с достаточным числом линий PCIe и продуманным охлаждением.

Сколько времени занимает сборка сервера под заказ?+

Срок зависит от комплектации и наличия компонентов, уточняйте под конкретную конфигурацию.

Обязательно ли использовать Linux?+

Нет, но подавляющее большинство инференс-движков и фреймворков лучше и стабильнее работают на Linux, особенно в многокарточных конфигурациях и при длительной нагрузке.

Можно ли собрать сервер полностью на б/у комплектующих?+

Да, это распространённая практика для GPU-серверов: вторичный рынок серверных видеокарт вроде Tesla V100 или A100 позволяет получить нужный объём VRAM заметно дешевле нового оборудования.

Нужен ли интернет для работы уже запущенной нейросети?+

Нет, после загрузки модели в память локальный инференс не требует подключения к сети. Интернет нужен только на этапе скачивания весов модели или обновления ПО.

Что выгоднее: один мощный GPU или несколько послабее?+

Зависит от модели, которую нужно запускать. Если модель целиком помещается в VRAM одной карты, один GPU обычно проще и быстрее. Если нужный объём памяти превышает возможности одной карты, распределение модели между несколькими GPU становится единственным вариантом, но добавляет накладные расходы на обмен данными между картами.

Автор:G.RaceG.Race
ПоделитьсяTGVK