02.10.2026 · 8 мин
Видеокарты с увеличенной памятью для локальных нейросетей: полный гид по выбору

Для локальных нейросетей объём видеопамяти определяет, какого размера модель вы вообще сможете запустить, а не только насколько быстро она будет работать. RTX 2080 Ti 22 ГБ, RTX 3080 20 ГБ, RTX 4080 32 ГБ и RTX 4090 48 ГБ закрывают диапазон от небольших моделей в квантизации до крупных 70B — каждая в своём сегменте.
Сколько VRAM нужно под размер модели
Память требуется не только для весов модели: нужен запас под контекст, KV-кэш, интерфейс и служебные операции. Поэтому таблица ниже — ориентир, а не причина выбирать карту впритык.
| Размер модели | FP16 | INT8 | INT4 |
|---|---|---|---|
| 7B | ~14 ГБ | ~7 ГБ | ~4 ГБ |
| 13B | ~26 ГБ | ~13 ГБ | ~7 ГБ |
| 34B | ~68 ГБ | ~34 ГБ | ~17 ГБ |
| 70B | ~140 ГБ | ~70 ГБ | ~35 ГБ |
Какая карта закрывает какую задачу
| Карта | Память | Что реально помещается |
|---|---|---|
| RTX 2080 Ti | 22 ГБ | 7B–13B в INT4/INT8, 34B в INT4 с урезанным контекстом |
| RTX 3080 | 20 ГБ | 7B–13B в INT4/INT8, 34B в INT4 впритык |
| RTX 3090 | 24 ГБ | 13B–34B в INT4/INT8, заводские 24 ГБ |
| RTX 4080 / 4080 Super | 32 ГБ | 34B в INT4 с комфортным контекстом |
| RTX 4090 / 4090D | 48 ГБ | 70B в INT4, 34B в FP16 |
| RTX 5090 | 32 ГБ | 34B с запасом, 70B в INT4 и более высокая скорость генерации |
Простой выбор: если вы запускаете 7B–13B, достаточно 20–24 ГБ. Для 34B нужен запас от 32 ГБ. Для 70B в INT4 комфортнее всего 48 ГБ либо несколько карт.
Скорость: память — не единственный параметр
Две карты с одинаковым объёмом VRAM могут генерировать текст с разной скоростью. На неё влияют архитектура GPU, пропускная способность памяти, вычислительные блоки и конкретный движок. Большой VRAM открывает модель, но не отменяет важность скорости её работы.
Инференс и обучение — разные требования
Для инференса обычно достаточно памяти под веса модели и контекст. Для обучения и LoRA/QLoRA требуются дополнительные тензоры, градиенты и состояния оптимизатора, поэтому одна и та же модель может поместиться для запуска, но не поместиться для дообучения.
Одна карта или несколько GPU
Если модель не помещается на одной карте, её можно распределить между несколькими GPU по PCIe. NVLink ускоряет обмен в части сценариев, но не обязателен для большинства локальных LLM. Практические ограничения и совместимость мостов подробно разобраны в статье «NVLink и видеокарты с увеличенной памятью».
Почему RTX 3090 остаётся отдельным вариантом
RTX 3090 имеет заводские 24 ГБ и аппаратный NVLink. Это не перепайка, а зрелый вариант для тех, кому нужен предсказуемый объём памяти и возможность собрать пару карт. Подробнее — в статье «RTX 3090 24GB для локальных нейросетей».
Новое или б/у оборудование
Для локального инференса подходят и новые, и проверенные б/у карты. В обоих случаях важнее тестирование под полной нагрузкой, состояние системы охлаждения и честно указанный объём памяти.
Итог: что брать под свою задачу
Начинайте не с самой дорогой карты, а с модели, которую нужно запускать, требуемой длины контекста и сценария — инференс либо обучение. Фильтр увеличенной памяти в каталоге помогает быстро оставить только подходящие варианты.
Подбор видеокарты от G.Race
Подберём одну карту или готовую многокарточную конфигурацию под конкретную модель, проверим питание и охлаждение. Готовые решения доступны в разделе серверов для AI.
FAQ
Хватит ли RTX 2080 Ti 22 ГБ для запуска модели 34B?+
В INT4 модель технически может поместиться, но с урезанным контекстом и без большого запаса. Для комфортной работы с 34B лучше смотреть на карты от 32 ГБ.
Обязательно ли использовать INT4 квантизацию?+
Нет. INT8 обычно требует вдвое больше памяти, но может дать более высокую точность. Выбор зависит от баланса качества и доступного VRAM.
Можно ли увеличить контекст модели, если памяти впритык?+
Можно уменьшить длину контекста или агрессивнее квантовать KV-кэш, но это влияет на качество и объём информации, которую модель удерживает.
Что выгоднее для 70B: RTX 4090 48 ГБ или две карты по 24 ГБ?+
Обе схемы рабочие. Выбор зависит от бюджета, свободных слотов, корпуса и того, нужна ли вам единая карта с большим запасом либо масштабируемая конфигурация.
Нужна ли именно перепаянная карта?+
Нет, если нужная модель помещается в заводской объём памяти. Увеличенная память оправдана, когда штатного VRAM реально не хватает.
Почему карты с одинаковым VRAM имеют разную скорость?+
Скорость зависит также от архитектуры GPU, пропускной способности памяти и оптимизации инференс-движка.
Можно ли протестировать карту под свою задачу?+
Мы тестируем карты под нагрузкой перед отправкой и можем помочь оценить совместимость с конкретной моделью до заказа.
