Как выбрать видеокарту для локальных LLM в 2026 году: VRAM, шина, Tensor Cores

hardware
← Back to Blog

Как выбрать видеокарту для локальных LLM в 2026 году: VRAM, шина, Tensor Cores

Введение

Локальный запуск больших языковых моделей перестал быть уделом энтузиастов и стал рядовой инженерной задачей. В 2026 году видеокарта для LLM — это не просто ускоритель графики, а специализированный вычислительный модуль с собственными требованиями. Если при выборе GPU для игр ключевыми были частота и количество шейдеров, то для инференса и тонкой настройки LLM приоритеты смещаются.

В этой статье я разберу три фундаментальных параметра: объём видеопамяти (VRAM), пропускную способность шины памяти и наличие тензорных ядер (Tensor Cores). Также мы рассмотрим конкретные модели NVIDIA, AMD и Intel, актуальные в 2026 году, и я дам практические рекомендации для разных сценариев использования.

VRAM — самый важный параметр

Почему VRAM правит всем

Большая языковая модель — это, по сути, набор весов (чисел с плавающей точкой), которые должны одновременно находиться в памяти видеокарты. Когда модель не помещается целиком, начинается подгрузка с диска или через системную RAM, что замедляет инференс в десятки и сотни раз.

Формула оценки проста:

  • Модель на 7 миллиардов параметров в формате float16 (2 байта на параметр) занимает примерно 14 GB VRAM.
  • Модель на 13B параметров — около 26 GB.
  • Модель на 34B параметров — около 68 GB.
  • Модель на 70B параметров — около 140 GB.

С учётом накладных расходов на KV-кэш (который растёт с длиной контекста) и системные нужды к этим цифрам нужно добавить 10-20 процентов.

Реальная вместимость разных карт

Объём VRAM Какие модели помещаются целиком
8 GB Qwen2.5 3B (int8), Llama 3.2 3B (bf16), Mistral 7B (int4)
12 GB Llama 3.1 8B (int8), Gemma 2 9B (bf16)
16 GB Llama 3.1 8B (bf16), Qwen2.5 14B (int4), DeepSeek Coder 16B (int8)
24 GB Llama 3.1 70B (int4), Mixtral 8x7B (int8), Qwen2.5 32B (bf16)
32-48 GB Llama 3.1 70B (int8), DeepSeek V3 (4-бит), Command R 104B (4-бит)
80 GB+ Llama 3.1 405B (4-бит с несколькими картами), Grok-1 (полноценно)

Квантование как способ экономии

В 2026 году квантование стало обязательным этапом работы с LLM. Форматы GGUF (через llama.cpp), GPTQ и AWKA позволяют хранить веса в 4-битном или даже 2-битном представлении с минимальной потерей качества для большинства задач.

Практическое правило: 4-битная модель занимает примерно 0.5 GB на миллиард параметров. Таким образом, Llama 70B в 4 битах требует около 35 GB VRAM.

Вывод по VRAM

Покупайте карту с максимальным объёмом памяти, который позволяет бюджет. Для комфортной работы с моделями 7B-14B достаточно 16 GB. Для моделей 32B-70B нужно 24 GB и более. Для самых больших моделей (100B+) неизбежно использование двух и более карт или облачных решений.

Шина памяти и пропускная способность

Почему скорость памяти имеет значение

После того как модель загружена в VRAM, каждый токен генерируется последовательным проходом через все слои сети. Для этого процессору (тензорным ядрам) нужно постоянно читать веса из памяти. Вычислительные блоки на современных GPU способны обрабатывать данные быстрее, чем шина памяти может их подать.

Пропускная способность памяти измеряется в GB/s. Чем она выше, тем быстрее генерируются токены.

Сравнение пропускной способности популярных чипов

GPU Шина (бит) Тип памяти Пропускная способность (GB/s)
RTX 4060 Ti 128 GDDR6 288
RTX 4070 Ti 192 GDDR6X 504
RTX 4080 256 GDDR6X 717
RTX 4090 384 GDDR6X 1008
RTX 5090 (2025) 512 GDDR7 1792
RTX 6000 Ada 384 GDDR6 960
A100 80GB 5120 (HBM) HBM2e 2039
H100 80GB 5120 (HBM) HBM3 3350
B200 (2025) 8192 (HBM) HBM3e 8000+
Radeon RX 7900 XTX 384 GDDR6 960

Как скорость шины влияет на скорость генерации

Для LLM в режиме автогрессии (последовательной генерации) важна не пиковая вычислительная мощность (TFLOPS), а именно пропускная способность памяти. Эмпирическая формула для оценки скорости генерации (токенов в секунду) выглядит так:

Tokens/s ≈ (Пропускная способность в GB/s) / (Размер модели в GB) × 0.8

Например, для Llama 7B в 16 битах (14 GB) на RTX 4090 (1008 GB/s) получим примерно 57 токенов в секунду. На RTX 4060 Ti (288 GB/s) — около 16 токенов в секунду. Разница ощутима.

Ширина шины и многокарточные конфигурации

Если вы планируете использовать две карты, помните, что NVLink ушёл из потребительского сегмента после RTX 30 серии. Теперь карты общаются через PCIe. Для инференса это не критично, но для тонкой настройки с градиентами (например, FSDP или DeepSpeed) пропускная способность PCIe становится узким местом.

Рекомендация: для двух карт используйте PCIe 4.0 x16 или PCIe 5.0 x16. Избегайте подключения второй карты через слот с x4.

Вывод по шине памяти

Чем шире шина и выше частота памяти, тем быстрее будет работать LLM. Для комфортной генерации (20+ токенов/с) на модели 7B-13B нужна пропускная способность от 400 GB/s. Для больших моделей в 4-битном формате желательно от 800 GB/s.

Tensor Cores и специализированные блоки

Что такое тензорные ядра

Tensor Cores — это специализированные блоки в GPU NVIDIA, начиная с архитектуры Volta (2017). Они выполняют операции матричного умножения (GEMM) за один такт вместо десятков тактов на обычных шейдерах. Для LLM это критически важно, потому что каждый слой трансформера содержит умножение матриц внимания и FFN-слоёв.

В 2026 году тензорные ядра есть во всех современных GPU, но их версии различаются:

Архитектура Поколение Tensor Cores Особенности
Ampere (RTX 30) 3-е поколение Поддержка разрежённых матриц
Ada Lovelace (RTX 40) 4-е поколение FP8, трансформер-движок
Blackwell (RTX 50) 5-е поколение FP4, поддержка 4-битных весов
Hopper (H100) 4-е поколение Трансформер-движок, FP8

Важность форматов с низкой точностью

Современные LLM обучаются в формате bfloat16 или float16, но для инференса можно опускаться ниже:

  • FP8 — практический стандарт для инференса в 2025-2026 годах. Нужен на Ada Lovelace и новее.
  • FP4 — новинка Blackwell, позволяет запускать 70B модели на 24 GB картах с качеством, близким к FP16.
  • INT4 — классический формат через квантование, работает на любых Tensor Cores, но медленнее FP8 из-за дополнительных конвертаций.

Поддержка разных вендоров

NVIDIA остаётся безусловным лидером по экосистеме CUDA и оптимизациям под LLM. Все популярные движки (llama.cpp, vLLM, TensorRT-LLM, ExLlamaV2) заточены под CUDA.

AMD с ROCm 6.x и MI300X достигли паритета по голому железу, но софтверная поддержка всё ещё отстаёт. Например, vLLM работает, но с ограничениями, а ExLlamaV2 официально не поддерживает Radeon.

Intel с Arc и Flex сериями имеет неплохие тензорные блоки (XMX), но экосистема через OpenVINO и IPEX находится в стадии активного развития. Для production я бы пока не рекомендовал.

Практическая рекомендация по Tensor Cores

Если вы планируете серьёзно работать с LLM локально, берите NVIDIA. Лучшее соотношение цена / производительность для инференса — RTX 3090 (24 GB, 1000 GB/s) или RTX 4090. Если бюджет позволяет — RTX 5090 с поддержкой FP4 и шиной 512 бит.

Для задач тонкой настройки (fine-tuning) нужны карты с быстрыми Tensor Cores и большим объёмом памяти: A6000 Ada (48 GB), H100 (80 GB), или кластер из двух RTX 4090.

Практические конфигурации для разных бюджетов

Бюджетный уровень (до 500 долларов)

Цель: запуск моделей 7B-9B в 4-битном формате с приличной скоростью.

  • RTX 3060 12GB — лучший выбор. 12 GB VRAM, шина 192 бит (360 GB/s). Позволяет запустить Llama 3.1 8B в 4 битах (около 5 GB) + длинный контекст.
  • Intel Arc A770 16GB — альтернатива для тех, кто готов мириться с софтом. 16 GB VRAM за 300 долларов, но через OpenVINO.
  • RTX 4060 Ti 16GB — дороже, но с лучшей поддержкой CUDA и тензорными ядрами четвёртого поколения.

Средний уровень (1000-2000 долларов)

Цель: модели 13B-32B в 8 битах или 70B в 4 битах, быстрый инференс.

  • RTX 3090 24GB (б/у) — король по цене / объёму памяти. 1000 GB/s, 24 GB VRAM, Tensor Cores Ampere.
  • RTX 4070 Ti Super 16GB — новее, быстрее на FP8, но памяти меньше.
  • Две RTX 3060 12GB — 24 GB суммарной памяти, но медленный PCIe-обмен.

Профессиональный уровень (3000+ долларов)

Цель: модели 70B+ в 8 битах, тонкая настройка, длинный контекст.

  • RTX 4090 24GB — 1008 GB/s, Ada Lovelace, FP8, трансформер-движок.
  • RTX 5090 32GB (2025) — 1792 GB/s, Blackwell, FP4, 32 GB VRAM.
  • A6000 Ada 48GB — профессиональная карта, пассивное охлаждение, 48 GB.
  • Две RTX 4090 — 48 GB общей памяти, требует мощного блока питания и материнской платы с двумя x8/x8.

Энтузиастский уровень (10000+ долларов)

Цель: самые большие модели, многокарточные кластеры.

  • H100 NVL 94GB — 2 карты в связке, 94 GB общей памяти, 3350 GB/s.
  • Mac Studio с M2 Ultra — 192 GB унифицированной памяти, но медленная шина (800 GB/s) и отсутствие Tensor Cores.

Типичные ошибки и заблуждения

Ошибка 1: Погоня за TFLOPS

Многие смотрят на терафлопсы в спецификациях и думают, что это главный показатель для LLM. Это не так. При последовательной генерации почти всё время уходит на чтение весов из памяти, а не на вычисления. Карта с 5000 TFLOPS, но узкой памятью будет работать медленно.

Ошибка 2: Игнорирование шины PCIe

При сборке двухкарточной системы ставят карты в слоты x16 и x4 (через чипсет). Скорость обмена падает в 4-16 раз. Всегда проверяйте спецификации материнской платы. Используйте слоты, которые идут напрямую от процессора.

Ошибка 3: Покупка карт AMD для llama.cpp

Да, ROCm работает и llama.cpp поддерживает HIP. Но бенчмарки показывают, что при одинаковой сырой пропускной способности NVIDIA оказывается на 20-40 процентов быстрее из-за оптимизаций. Если ваш основной движок — llama.cpp, берите NVIDIA.

Ошибка 4: Недооценка энергопотребления

RTX 4090 потребляет до 450 Вт. Две такие карты — 900 Вт. Плюс процессор и остальная система — 1100-1200 Вт в пике. Это требует блока питания на 1500 Вт и хорошего охлаждения корпуса. RTX 3090 в пике тоже потребляет около 350-400 Вт.

Заблуждение: Для LLM нужна только память

VRAM важна, но не единственный параметр. На карте с 24 GB, но узкой шиной (как RTX 4060 Ti 16GB — 288 GB/s) большая модель будет генерировать токены со скоростью 2-4 токена в секунду, что неприемлемо для интерактивной работы.

Заключение

В 2026 году выбор видеокарты для локальных LLM сводится к трём параметрам в порядке приоритета:

  1. Объём VRAM — определяет, какие модели вы можете запустить целиком.
  2. Пропускная способность памяти (шина + тип памяти) — определяет скорость генерации.
  3. Наличие и поколение Tensor Cores — определяет поддержку эффективных форматов (FP8, FP4) и экосистему.

Для большинства пользователей оптимальным выбором остаётся NVIDIA RTX 3090 с 24 GB VRAM (б/у рынок) как лучшее соотношение цены, объёма памяти и пропускной способности. Если бюджет позволяет — RTX 4090, особенно если нужна работа с FP8.

Не гонитесь за максимальными TFLOPS. Не экономьте на блоке питания. И помните, что даже 500-долларовая RTX 3060 12GB способна комфортно запускать современные модели 7B-8B — для многих задач этого достаточно.

Выбирайте осознанно, и ваша локальная LLM будет работать быстро, дёшево и без облачных провайдеров.