13.08.2026 · 9 мин
Как собрать сервер для локального запуска нейросетей с нуля

Сервер для локального запуска нейросетей строится вокруг связки из видеокарты с достаточным объёмом VRAM, процессора с нужным числом линий PCIe, оперативной памяти не меньше объёма видеопамяти, быстрого NVMe-накопителя и блока питания с запасом мощности. Главный компонент здесь один: GPU. Именно объём его памяти определяет, какую модель вы вообще сможете запустить, а не частота процессора или количество ядер.
Дальше разберём по шагам, что и зачем выбирать, и с чего вообще начинается расчёт конфигурации.
С чего начать: определите задачу, а не бюджет
Прежде чем смотреть на комплектующие, ответьте на два вопроса. Первый: что вы будете делать, инференс (запуск готовой модели) или обучение и дообучение (fine-tuning)? Второй: с моделями какого размера вы будете работать?
Это принципиально разные нагрузки:
- Инференс: модель уже обучена, вы просто получаете от неё ответы. Требования к VRAM ниже, к вычислительной мощности тоже. Один GPU часто закрывает задачу полностью.
- Обучение и дообучение: здесь помимо весов модели в память нужно поместить градиенты, состояния оптимизатора и активации. VRAM требуется в 3-4 раза больше, чем для инференса той же модели, и часто нужно несколько GPU.
Бюджет сборки является следствием задачи, а не отправной точкой. Одна и та же цель («запускать нейросеть локально») может стоить как один б/у GPU на 12 ГБ, так и сервер с четырьмя картами по 80 ГБ: разница в том, какую модель и с какой скоростью вы хотите получать. Дальше в статье будет несколько конфигураций под разные задачи, ориентируйтесь по ним, а не по абстрактной цифре бюджета.
Видеокарта: главный компонент сборки
Сколько VRAM нужно под конкретную модель
Есть рабочее правило для оценки объёма видеопамяти под инференс LLM: вес модели в памяти примерно равен количеству параметров, умноженному на размер типа данных.
| Точность | Байт на параметр | Модель 7B | Модель 13B | Модель 34B | Модель 70B |
|---|---|---|---|---|---|
| FP16 | 2 байта | ~14 ГБ | ~26 ГБ | ~68 ГБ | ~140 ГБ |
| INT8 | 1 байт | ~7 ГБ | ~13 ГБ | ~34 ГБ | ~70 ГБ |
| INT4 (квантизация) | 0,5 байта | ~4 ГБ | ~7 ГБ | ~17 ГБ | ~35 ГБ |
К этим цифрам нужно добавить память под контекст (KV-кеш) и служебные накладные расходы. Закладывайте запас 15-25% сверху. Для обучения и дообучения объём умножайте минимум на 3-4.
Вывод из таблицы простой: если вы собираетесь работать с 7B-13B моделями в квантизации, хватит одной карты на 16-24 ГБ VRAM. Для 70B в приличном качестве нужны уже десятки гигабайт видеопамяти: одна серверная карта уровня A100 либо несколько карт поменьше, объединённых через NVLink или разделение слоёв модели. Весь ассортимент серверных и потребительских видеокарт для ИИ-задач смотрите в каталоге видеокарт.
Домашние игровые или серверные GPU
- Consumer-карты, например GeForce RTX 4090: хорошее соотношение цена/производительность на инференсе, доступны на вторичном рынке, но не рассчитаны на круглосуточную нагрузку в стойке и обычно не поддерживают NVLink.
- Серверные карты, например Tesla V100 или NVIDIA A100: спроектированы для нагрузки 24/7, лучше охлаждаются в серверном шасси, поддерживают объединение памяти между картами, но стоят дороже и требуют серверной инфраструктуры (питание, охлаждение, иногда райзеры и специфичные материнские платы).
Если планируете объединять несколько карт Tesla V100 в одну систему с общей памятью, понадобится NVLink-мост для Tesla V100 SXM2.
Что выбрать между конкретными моделями (Tesla V100, A100 и RTX 4090) разбираем отдельно в статье «Tesla V100 vs A100 vs RTX 4090: что выбрать для инференса». Тут вопрос упирается в объём VRAM, пропускную способность памяти и то, инференс у вас или обучение.
Процессор: не гонитесь за частотой, смотрите на линии PCIe
Для нейросетевых нагрузок CPU почти не участвует в вычислениях: всю работу делает GPU. Процессор нужен для того, чтобы:
- обеспечить каждой видеокарте достаточно линий PCIe (в идеале x16 на карту, минимум x8 без сильной потери скорости обмена данными);
- не создавать узкое место при подготовке данных и загрузке модели в память.
Для сборки с одной-двумя картами хватит среднего серверного или десктопного процессора с 8-16 ядрами. Для конфигураций на 4-8 GPU нужна платформа с большим количеством линий PCIe: это, как правило, серверные процессоры вроде AMD EPYC, у которых 64-128 линий PCIe против 20-24 у десктопных чипов.
Оперативная память: не меньше объёма VRAM
Простое рабочее правило: объём RAM должен быть не меньше суммарного объёма VRAM всех установленных видеокарт, а лучше с запасом в 1,5-2 раза.
Зачем это нужно, если модель и так грузится в видеопамять:
- при офлоаде части слоёв модели на CPU (когда VRAM не хватает) недостающие слои считаются с использованием оперативной памяти;
- при подготовке датасетов и промежуточных операциях система активно использует RAM;
- на сервере с несколькими GPU операционная система и драйверы сами по себе съедают заметный объём.
Для сборки с одной картой на 24 ГБ комфортно иметь 32-64 ГБ RAM. Для многокарточного сервера с суммарным объёмом VRAM в 100+ ГБ нужно от 128 ГБ и выше. Подбирайте модули под конкретную материнскую плату и процессор: количество каналов и максимальный поддерживаемый объём у серверных и десктопных платформ отличаются.
Накопитель: NVMe, а не SATA SSD
Веса современных моделей исчисляются десятками и сотнями гигабайт. Загрузка модели с диска в память происходит не один раз: она повторяется при каждом перезапуске, обновлении или переключении между моделями. Разница в скорости между SATA SSD (~550 МБ/с) и NVMe (2000-7000 МБ/с) выливается в минуты ожидания на каждой загрузке.
Рекомендация по объёму: от 1 ТБ NVMe, если планируете держать локально больше одной-двух моделей. Веса, чекпоинты и датасеты для дообучения занимают место быстро. Для подключения нескольких NVMe-накопителей на одну плату или через внешний интерфейс пригодятся платы расширения PCIe-NVMe и переходники из раздела серверных комплектующих.
Материнская плата и корпус: считайте слоты и зазоры
Здесь чаще всего ошибаются новички, которые собирают сервер по аналогии с игровым ПК:
- количество слотов PCIe x16 должно совпадать с количеством GPU, которые вы планируете установить: не только сейчас, но и с запасом на апгрейд;
- физический зазор между слотами важен: двух- и трёхслотовые карты перекрывают соседние слоты, если между ними нет достаточного расстояния;
- для 3+ карт в потребительском корпусе почти всегда нужны райзеры и вертикальное крепление либо сразу серверное шасси с продуманной вентиляцией;
- серверные пассивные карты (без собственных вентиляторов) в принципе не будут охлаждаться в обычном ATX-корпусе: им нужен направленный поток воздуха от серверных вентиляторов шасси.
Для сборок на 1-2 видеокарты компактные корпуса можно выбрать на странице корпусов. Под 3+ карт с полноценным серверным охлаждением нужна уже отдельная платформа, для подбора оставляйте заявку на сайте.
Блок питания: считаем с запасом, а не впритык
Мощность блока питания должна перекрывать суммарное потребление всех GPU под пиковой нагрузкой плюс CPU, накопители и материнскую плату, с запасом 20-30% на пиковые скачки. Если у вас 2-4 GPU в одном сервере, экономить на этом расчёте не стоит: недостаточный запас мощности приводит к нестабильности и внезапным перезагрузкам под нагрузкой.
Охлаждение
Видеокарты для ИИ-задач под длительной нагрузкой греются сильнее, чем в играх: инференс и тем более обучение загружают GPU на 90-100% часами или сутками напролёт. Для стабильной работы важны:
- достаточный воздухообмен в корпусе (положительное давление, направленный поток от передней панели к задней);
- отдельное внимание температуре VRAM и силовых элементов, а не только температуре ядра GPU;
- для серверных пассивных карт обязателен принудительный обдув от корпусных вентиляторов: без него карта уйдёт в троттлинг за минуты.
Для пассивных серверных карт вроде Tesla V100 есть отдельное решение: кожух с медным радиатором и турбиной, который превращает пассивную карту в активно охлаждаемую вне серверного шасси. Такие кожухи и другие комплектующие для видеокарт можно найти в каталоге нашего сайта.
Программная часть: без неё железо бесполезно
Сборка железа только половина дела. Дальше нужно:
- Операционная система. Для серверных задач подавляющее большинство берёт Linux (Ubuntu Server, Debian): лучше поддержка драйверов NVIDIA, стабильнее под длительной нагрузкой, проще автоматизировать.
- Драйверы и CUDA. Нужна актуальная версия драйвера NVIDIA и совместимая с ней версия CUDA Toolkit под используемый фреймворк.
- Фреймворк или инференс-движок. Выбор зависит от задачи: llama.cpp и Ollama для локального запуска LLM на потребительском железе, vLLM для высоконагруженного инференса, PyTorch с Transformers, если планируете дообучение.
Чаще всего фраза «всё железо на месте, а нейросеть не запускается» означает несовместимость версий драйвера, CUDA и фреймворка. Проверяйте таблицы совместимости версий заранее, до покупки железа.
Примеры конфигураций под разные задачи
Точная стоимость зависит от того, берёте вы новое оборудование или б/у, и от текущих цен в каталоге. Ориентиры ниже касаются железа, а не рублей.
| Задача | GPU | RAM | Накопитель | Особенности |
|---|---|---|---|---|
| Инференс небольших LLM (7B-13B) для личных задач | 1 карта, 16-24 ГБ VRAM | 32-64 ГБ | 1 ТБ NVMe | Хватает потребительской видеокарты, обычный десктопный корпус |
| Инференс средних моделей (34B) / генерация изображений | 1 карта, 24-48 ГБ VRAM, либо 2 карты меньшего объёма | 64-128 ГБ | 1-2 ТБ NVMe | Уже стоит смотреть на серверную платформу с достаточным числом линий PCIe |
| Инференс крупных моделей (70B+) и лёгкое дообучение | 2-4 карты, суммарно 80-160+ ГБ VRAM | 128-256 ГБ | 2-4 ТБ NVMe | Серверное шасси, продуманное охлаждение и питание, серверный CPU |
| Полноценное обучение/дообучение под бизнес-задачи | 4-8 серверных карт уровня A100/H100 | 256+ ГБ | 4+ ТБ NVMe | Серверная платформа целиком, NVLink между картами, отдельный расчёт БП и охлаждения |
Если не готовы разбираться в подборе совместимых компонентов самостоятельно, эту часть можно отдать на аутсорс. Подробнее об этом читайте в последнем разделе статьи.
Новое или б/у оборудование
Для GPU-серверов вторичный рынок не компромисс, а рабочий вариант: серверные карты вроде Tesla V100 после списания из дата-центров по факту наработали часы, но сохраняют характеристики и вполне подходят под инференс и обучение. В каталоге G.Race видеокарты продаются и новые, и б/у, статус указан в карточке товара. Разбор того, что выбрать по трём критериям (бюджет, скорость получения оборудования и критичность задачи), читайте в отдельной статье «Новое или Б/У серверное оборудование: что выбрать».
Итог и сборка под ключ от G.Race
Порядок сборки сервера для локального запуска нейросетей такой: сначала определяете задачу и размер моделей, с которыми будете работать, из этого считаете нужный объём VRAM. Дальше подбираете GPU, а под него уже процессор с достаточным числом линий PCIe, RAM не меньше объёма видеопамяти, NVMe-накопитель, корпус с нужным числом слотов и блок питания с запасом. И только в конце устанавливаются драйверы, CUDA и фреймворк: без них даже идеально подобранное железо не запустит ни одну модель.
Если разбираться во всём этом самостоятельно и подбирать совместимые компоненты нет времени или желания, этим занимаемся мы - компания G.Race: подбираем конфигурацию под задачу и бюджет, комплектуем железом (новым или б/у, видеокарты, процессоры и комплектующие поставляются напрямую из Китая), тестируем перед отправкой и присылаем готовый к работе сервер. Доставка в РФ занимает 21-28 дней, гарантия предоставляется, сделка оформляется официально: договор, счёт, акт или накладная. Мы работаем и с физлицами, и с юрлицами, оборудование можно посмотреть вживую в шоуруме, а цены на 20-45% ниже среднерыночных по РФ за счёт прямых поставок.
Готовые серверные сборки на Tesla V100 с NVLink и жидкостным охлаждением уже есть в каталоге: готовые сборки серверов для ИИ. Там же можно обсудить индивидуальную конфигурацию под вашу задачу.
FAQ
Сколько VRAM нужно для запуска LLM на 7B, 13B и 70B параметрах?+
В FP16 это примерно 14 ГБ, 26 ГБ и 140 ГБ соответственно. В квантизации INT4 около 4 ГБ, 7 ГБ и 35 ГБ. Для комфортной работы с контекстом добавляйте к этим цифрам запас 15-25%.
Можно ли использовать домашний ПК вместо сервера?+
Для инференса небольших и средних моделей на одной видеокарте домашнего ПК вполне достаточно. Разница с сервером в основном в стабильности под долгой нагрузкой и возможности расширения до нескольких GPU. Для многокарточных конфигураций и обучения нужна уже серверная платформа с достаточным числом линий PCIe и продуманным охлаждением.
Сколько времени занимает сборка сервера под заказ?+
Срок зависит от комплектации и наличия компонентов, уточняйте под конкретную конфигурацию.
Обязательно ли использовать Linux?+
Нет, но подавляющее большинство инференс-движков и фреймворков лучше и стабильнее работают на Linux, особенно в многокарточных конфигурациях и при длительной нагрузке.
Можно ли собрать сервер полностью на б/у комплектующих?+
Да, это распространённая практика для GPU-серверов: вторичный рынок серверных видеокарт вроде Tesla V100 или A100 позволяет получить нужный объём VRAM заметно дешевле нового оборудования.
Нужен ли интернет для работы уже запущенной нейросети?+
Нет, после загрузки модели в память локальный инференс не требует подключения к сети. Интернет нужен только на этапе скачивания весов модели или обновления ПО.
Что выгоднее: один мощный GPU или несколько послабее?+
Зависит от модели, которую нужно запускать. Если модель целиком помещается в VRAM одной карты, один GPU обычно проще и быстрее. Если нужный объём памяти превышает возможности одной карты, распределение модели между несколькими GPU становится единственным вариантом, но добавляет накладные расходы на обмен данными между картами.
