13.08.2026 · 5 мин
Tesla V100 vs A100 vs RTX 4090: что выбрать для инференса

Для инференса нейросетей на первом месте не количество ядер и не голые TFLOPS, а пропускная способность видеопамяти: генерация токенов происходит последовательно и упирается именно в скорость чтения весов модели из VRAM. По этому параметру NVIDIA A100 обходит и Tesla V100, и RTX 4090, но для локального инференса некрупных моделей разница на практике часто нивелируется. Дальше разберём, где каждая карта показывает себя лучше всего.
Характеристики трёх карт в сравнении
| Параметр | Tesla V100 | NVIDIA A100 | RTX 4090 |
|---|---|---|---|
| Архитектура | Volta (2017) | Ampere (2020) | Ada Lovelace (2022) |
| VRAM | 16 или 32 ГБ HBM2 | 40 или 80 ГБ HBM2e | 24 ГБ GDDR6X (у G.Race есть версия на 48 ГБ) |
| Пропускная способность памяти | около 900 ГБ/с | до 2000 ГБ/с (80 ГБ SXM) | около 1000 ГБ/с |
| FP16 Tensor производительность | около 125 TFLOPS | около 312 TFLOPS (без sparsity) | около 165 TFLOPS (без sparsity) |
| NVLink | есть на SXM2, ограниченно на PCIe | есть, пропускная способность выше V100 | не поддерживается вообще |
| TDP | 250-300 Вт | 250-400 Вт | 450 Вт |
| ECC-память | да | да | нет |
Tesla V100: точка входа в серверные GPU
Volta вышла в 2017 году, поэтому Tesla V100 уже не самая новая архитектура, но это по-прежнему полноценная серверная карта с ECC-памятью и поддержкой NVLink на версии SXM2. Для инференса 7B-13B моделей в FP16 или INT8 её ресурса хватает с запасом, а версия на 32 ГБ позволяет комфортно работать и с более крупными моделями в квантизации.
Главное ограничение V100 не в производительности, а в поддержке новых форматов: тензорные ядра первого поколения умеют только FP16, без BF16 и без нативного INT8/INT4 на уровне железа, которые есть у более новых архитектур. Для большинства инференс-движков это не критично, но при работе с самыми свежими библиотеками стоит заранее проверить совместимость.
Если нужно объединить несколько карт SXM2 в одну систему с общей памятью, для этого существует отдельный NVLink-мост.
NVIDIA A100: когда стоит переплатить
A100 оправдывает разницу в цене там, где важна пропускная способность и объём памяти: инференс моделей от 70B параметров на одной карте, обслуживание множества параллельных запросов в продакшене, где важна суммарная скорость обработки, а не только время ответа одному пользователю.
Версия на 80 ГБ закрывает большинство современных LLM без разбиения по нескольким картам, а более высокая пропускная способность памяти напрямую превращается в больше токенов в секунду при batched-инференсе, когда сервер одновременно обрабатывает запросы нескольких пользователей. Для одиночного пользователя с редкими запросами эта разница ощущается заметно меньше, поскольку генерация токенов и так упирается в последовательную природу декодирования, а не в объём параллельных вычислительных ресурсов.
RTX 4090: игровая карта на серверной задаче
RTX 4090 не создавалась для дата-центров, но по чистой вычислительной мощности на инференсе она сопоставима с картами куда более высокого класса, а версия на 48 ГБ, которая есть в каталоге G.Race, снимает главное ограничение стоковой карты, объём видеопамяти в 24 ГБ.
Три момента, которые стоит учитывать при выборе RTX 4090 для сервера:
- NVLink не поддерживается вообще, объединить несколько карт в общий пул памяти не получится, каждая карта работает независимо;
- нет ECC-памяти, для большинства задач инференса это не критично, но при длительных нагрузках стоит закладывать более внимательный мониторинг стабильности;
- драйверы для GeForce обновляются в первую очередь под игровые сценарии, для продакшен-нагрузки это менее предсказуемо, чем выделенная линейка драйверов для Tesla и A100.
Для инференса моделей, которые помещаются в 24 или 48 ГБ VRAM без разбиения на несколько карт, RTX 4090 обычно даёт лучшее соотношение производительности к цене среди всех трёх вариантов.
Что выбрать под конкретную задачу
| Задача | Рекомендация |
|---|---|
| Инференс 7B-13B моделей для личных задач или небольшой команды | RTX 4090, лучшее соотношение цена/производительность |
| Инференс 30-34B моделей на одной карте | RTX 4090 48 ГБ или Tesla V100 32 ГБ с квантизацией |
| Инференс 70B+ моделей на одной карте | NVIDIA A100 80 ГБ |
| Продакшен с высокой конкурентной нагрузкой (много пользователей одновременно) | NVIDIA A100, за счёт пропускной способности памяти |
| Ограниченный бюджет, тестирование, разработка | Tesla V100, самый доступный вход в серверные GPU с ECC |
Что в итоге выбрать
Короткая логика выбора такая: считаете, сколько VRAM нужно под вашу модель и формат данных, смотрите, работает ли сервер с одним пользователем или обслуживает параллельные запросы, и после этого выбираете карту. Tesla V100 закрывает вход в серверные GPU при ограниченном бюджете, RTX 4090 даёт максимум производительности на рубль для моделей, которые помещаются в её память, а A100 оправдан там, где нужен запас VRAM под крупные модели или высокая параллельная нагрузка. Смешивать все три сценария не нужно: правильный выбор всегда завязан на конкретную модель и на то, сколько пользователей будет обращаться к серверу одновременно.
Подбор от G.Race
Если сравнивать характеристики и считать VRAM под конкретную модель самостоятельно нет времени или желания, этим занимаемся мы, компания G.Race: подбираем конфигурацию под задачу и бюджет, комплектуем железом, новым или б/у, видеокарты и комплектующие поставляются напрямую из Китая, тестируем перед отправкой и присылаем готовый к работе сервер. Доставка в РФ занимает 21-28 дней, гарантия предоставляется на любое оборудование независимо от статуса, сделка оформляется официально: договор, счёт, акт или накладная. Мы работаем и с физлицами, и с юрлицами, оборудование можно посмотреть вживую в шоуруме, а цены на 20-45% ниже среднерыночных по РФ за счёт прямых поставок.
Все три карты, Tesla V100, A100 и RTX 4090, есть в каталоге видеокарт, новые и б/у, статус указан в карточке товара. Если нужен не отдельный GPU, а готовый сервер под задачу, посмотрите готовые сборки на Tesla V100 с NVLink в разделе готовых серверов для ИИ.
FAQ
Какая карта быстрее для инференса LLM: A100 или RTX 4090?+
При работе с одним пользователем и небольшой моделью разница в скорости часто небольшая, поскольку декодирование токенов ограничено последовательной природой генерации. При множестве параллельных запросов A100 выигрывает за счёт более высокой пропускной способности памяти.
Можно ли использовать несколько RTX 4090 как одну карту с общей памятью?+
Нет, RTX 4090 не поддерживает NVLink, поэтому объединить память нескольких карт в единый пул не получится. Каждая карта работает независимо, модель нужно либо делить между картами программно, либо запускать в пределах памяти одной карты.
Стоит ли переплачивать за A100, если модель помещается в 24 ГБ?+
Обычно нет. Если модель и контекст умещаются в память RTX 4090 или Tesla V100, разница в скорости для локального инференса не оправдывает существенную разницу в цене. Переплата за A100 имеет смысл при нехватке VRAM или высокой конкурентной нагрузке.
Подходит ли Tesla V100 для новых моделей и библиотек?+
В большинстве случаев да, но тензорные ядра первого поколения на V100 не поддерживают BF16 и аппаратный INT8/INT4, которые есть у более новых архитектур. Перед покупкой стоит свериться с требованиями конкретного инференс-движка.
В чём разница между версией RTX 4090 на 24 ГБ и на 48 ГБ?+
Версия на 48 ГБ это карта с изменённой конфигурацией видеопамяти, вычислительная мощность и пропускная способность памяти остаются теми же, что и у стоковой карты, но объём VRAM удваивается, что позволяет запускать более крупные модели без разбиения на несколько карт.
Нужна ли ECC-память для локального инференса?+
Для большинства задач инференса отсутствие ECC не критично. Она важнее для длительных тренировочных нагрузок и сценариев, где любая ошибка в вычислениях должна быть исключена, например в финансовых или научных расчётах.
Можно ли смешивать Tesla V100, A100 и RTX 4090 в одном сервере?+
Технически можно, если карты видны системе и совместимы по драйверам, но объединить их в единый пул памяти через NVLink не получится, а распределение модели между разнородными картами на практике сложнее в настройке и менее предсказуемо по производительности.
