Выбор LLM модели в 2026: руководство по сравнению моделей

opensourceaillmcomparisonit
← Back to Blog

Введение

Как выбрать LLM модель для вашего проекта? Есть десятки моделей — от 1B до 400B параметров. Разбираемся.


Категории LLM моделей

Small Language Models (1B-7B)

Модель            | Параметры | Языки | Специализация
Qwen2.5-1.5B     | 1.5B     | 29+   | General
Phi-3.5-mini      | 3.8B     | EN    | General
Gemma-2-2B       | 2.6B     | EN    | General
SmolLM2-1.7B     | 1.7B     | EN, FR, DE | General

Когда использовать:

  • Edge devices (телефоны, Raspberry Pi)
  • Low-latency applications
  • Cost-sensitive deployments
  • Simple tasks (classification, extraction)

Medium Models (7B-20B)

Модель            | Параметры | Языки | Специализация
Llama 3.2 8B     | 8B       | 100+  | General
Qwen2.5-7B       | 7B       | 29+   | General
Mistral Small 24B| 24B      | EN, FR, DE, ES | Multilingual
Gemma-2-9B       | 9.2B     | EN    | General

Когда использовать:

  • Local deployment (1× GPU)
  • Development and testing
  • Production with moderate load
  • Multi-task applications

Large Models (20B-70B)

Модель            | Параметры | Языки | Специализация
Llama 3.1 70B    | 70B      | 100+  | General
Qwen2.5-32B      | 32B      | 29+   | General
Mixtral 8x7B     | 47B*     | EN    | General (MoE)
DeepSeek V3      | 671B*    | EN, ZH, EN | Coding, Math

Когда использовать:

  • Production serving (multi-GPU)
  • Complex reasoning tasks
  • Research and analysis
  • High-quality generation

Massive Models (100B+)

Модель            | Параметры | Специализация
GPT-4o            | ~1.8T*   | Multi-modal
Claude 3.5 Sonnet | ~200B*   | General
Gemini Ultra      | ~1.8T*   | Multi-modal
DeepSeek-R1       | 671B     | Reasoning

Сравнение открытых моделей

Llama 3.1/3.2 (Meta)

Модель          | Params  | Context | Training Data
Llama 3.1 8B    | 8B      | 128K    | 15T tokens
Llama 3.1 70B   | 70B     | 128K    | 15T tokens
Llama 3.1 405B  | 405B    | 128K    | 15T tokens
Llama 3.2 1B    | 1B      | 128K    | 2T tokens
Llama 3.2 3B    | 3B      | 128K    | 2T tokens

Плюсы:
✅ Лучшая экосистема (GGUF, LoRA, инструменты)
✅ Отличная документация
✅ Коммерческое использование
✅ Многоязычность (100+ языков)

Минусы:
❌ Требует approval для использования
❌ 405B только через API (Groq, Replicate)

Qwen 2.5 (Alibaba)

Модель          | Params  | Context | Языки
Qwen2.5-0.5B    | 0.5B    | 32K     | 29+
Qwen2.5-1.5B    | 1.5B    | 32K     | 29+
Qwen2.5-7B      | 7B      | 32K     | 29+
Qwen2.5-14B     | 14B     | 32K     | 29+
Qwen2.5-32B     | 32B     | 128K    | 29+
Qwen2.5-72B     | 72B     | 128K    | 29+
Qwen2.5-110B    | 110B    | 128K    | 29+

Плюсы:
✅ Лучший Chinese + English
✅ Отличное код-генерирование
✅ Open weights, коммерческое использование
✅ MoE варианты (очень быстрые)

Минусы:
❌ Меньше экосистема чем Llama
❌ Меньше fine-tuned моделей

Mistral (Mistral AI)

Модель          | Params  | Type    | Context
Mistral Small 3 | 24B     | Dense   | 128K
Mistral Large 2 | 123B*   | MoE     | 128K
Mixtral 8x7B    | 47B     | MoE     | 32K
Mixtral 8x22B   | 141B    | MoE     | 65K

Плюсы:
✅ Хороший European focus
✅ MoE архитектура (быстро)
✅ Open weights
✅ Хороший French

Минусы:
❌ Меньше multilingual чем Qwen
❌ Меньше community

Phi-3.5 (Microsoft)

Модель          | Params  | Context | Training
Phi-3.5-mini    | 3.8B    | 128K    | Synthetic
Phi-3.5-mini-instruct | 3.8B | 128K | Multi-task
Phi-3.5-MoE     | 4.2B    | 128K    | Active params

Плюсы:
✅ Отличное качество для размера
✅ Synthetic training data
✅ Dense (не MoE) — простой деплой
✅ Microsoft экосистема

Минусы:
❌ Меньше языков
❌ Меньше community

Gemma 2 (Google)

Модель          | Params  | Context | Фичи
Gemma-2-2B      | 2.6B    | 8K      | Lightweight
Gemma-2-9B      | 9.2B    | 8K      | GQA
Gemma-2-27B     | 27B     | 8K      | GQA, MoE

Плюсы:
✅ Google quality
✅ GQA для быстрого inference
✅ Open weights

Минусы:
❌ Короткий context (8K)
❌ Меньше экосистема

Специализированные модели

Код-генерирование

Модель            | Params  | MMLU  | HumanEval
Codestral Mamba   | 7B      | -     | 82.3%
Codellama         | 34B     | -     | 71.8%
DeepSeek-Coder-V2 | 236B    | 66.5  | 85.7%
Qwen2.5-Coder     | 32B     | 72.1  | 87.2%
StarCoder2        | 15B     | -     | 73.5%

Codestral Mamba:
  - SSM архитектура (быстрая)
  - 256K context
  - 80+ языков программирования

Qwen2.5-Coder-32B:
  - Лучший open code model 2026
  - 32B параметры
  - 87.2% HumanEval

Математика и reasoning

Модель            | Params  | GSM8K  | MATH
DeepSeek-R1       | 671B    | 96.8%  | 71.9%
Qwen2.5-72B       | 72B     | 82.2%  | 51.2%
Llama 3.1 70B     | 70B     | 80.5%  | 48.3%
Gemini 1.5 Pro    | ~175B   | 94.0%  | 66.0%

DeepSeek-R1:
  - Reinforcement learning для reasoning
  - Chain-of-thought генерация
  - State-of-the-art для математики

Мультимодальные модели

Модель            | Params  | Vision | Audio | Text
GPT-4o            | ~1.8T*  | ✅     | ✅    | ✅
Gemini 1.5 Pro    | ~175B   | ✅     | ✅    | ✅
Qwen2-VL          | 72B     | ✅     | ✅    | ✅
LLaVA-1.6         | 13-34B  | ✅     | ❌    | ✅

Qwen2-VL-72B:
  - Open weights
  - Video understanding
  - OCR quality
  - 360K context

Benchmarks сравнение

MMLU (Massive Multitask Language Understanding)

Модель            | MMLU Score
GPT-4o            | 88.7%
Claude 3.5 Sonnet | 89.0%
Gemini 1.5 Pro    | 83.9%
DeepSeek-R1       | 91.6%
Qwen2.5-72B       | 82.2%
Llama 3.1 70B     | 80.5%
Llama 3.1 8B      | 72.0%
Qwen2.5-7B        | 71.4%
Phi-3.5-mini      | 75.6%
Gemma-2-27B       | 78.6%

HumanEval (Python code generation)

Модель            | HumanEval
DeepSeek-R1       | 96.0%
GPT-4o            | 87.8%
Claude 3.5 Sonnet | 85.7%
Qwen2.5-Coder-32B | 87.2%
Codestral Mamba   | 82.3%
DeepSeek-Coder-V2 | 85.7%
Llama 3.1 70B     | 68.9%
Qwen2.5-72B       | 81.5%

MATH (Mathematical reasoning)

Модель            | MATH
DeepSeek-R1       | 71.9%
GPT-4o            | 58.4%
Claude 3.5 Sonnet | 61.1%
Qwen2.5-72B       | 51.2%
Llama 3.1 70B     | 48.3%

Выбор по GPU

8GB GPU (RTX 3060, 4060)

Рекомендуемые модели (GGUF Q4_K_M):
  ✅ Qwen2.5-7B     (4.4GB)
  ✅ Llama 3.2 8B   (5.5GB)
  ✅ Phi-3.5-mini   (2.2GB)
  ✅ Gemma-2-2B     (1.6GB)

Оптимизация:
  - Используйте GGUF формат
  - Q4_K_M баланс качество/размер
  - Batch size = 1-4

12GB GPU (RTX 3070 Ti, 4070)

Рекомендуемые модели:
  ✅ Qwen2.5-14B    (7.5GB Q4)
  ✅ Llama 3.1 8B   (5.5GB Q4)
  ✅ Qwen2.5-7B     (4.4GB Q4)

Оптимизация:
  - Q4_K_M для 14B
  - Q6_K для 7B
  - Batch size = 4-8

16GB GPU (RTX 4080)

Рекомендуемые модели:
  ✅ Qwen2.5-14B    (7.5GB Q4)
  ✅ Llama 3.1 70B  (40GB Q4 - нет)
  ✅ Mistral Small  | (нужно 2× GPU)

Оптимизация:
  - Q4_K_M для 14B
  - Q6_K для 14B (9GB)
  - Batch size = 8-16

24GB GPU (RTX 3090, 4090)

Рекомендуемые модели:
  ✅ Qwen2.5-32B    (18GB Q4)
  ✅ Llama 3.1 70B  (40GB Q4 - нет)
  ✅ Qwen2.5-14B    (7.5GB Q4)

Оптимизация:
  - Q4_K_M для 32B
  - Q6_K для 32B (22GB)
  - Batch size = 8-32

48GB GPU (RTX 6000)

Рекомендуемые модели:
  ✅ Llama 3.1 70B  (40GB Q4)
  ✅ Qwen2.5-72B    (42GB Q4)
  ✅ Qwen2.5-32B    (18GB Q4)

Оптимизация:
  - Q4_K_M для 70B
  - Q6_K для 70B (55GB - нет)
  - Batch size = 1-4

80GB GPU (A100)

Рекомендуемые модели:
  ✅ Llama 3.1 70B  (140GB FP16 - нет)
  ✅ Llama 3.1 70B  (40GB Q4)
  ✅ Qwen2.5-72B    (42GB Q4)
  ✅ Llama 3.1 70B  (75GB Q8)

Оптимизация:
  - Q8_0 для 70B (75GB)
  - FP16 требует 2× A100
  - Batch size = 1-16

Быстрый выбор

Вопрос                    | Ответ
--------------------------|------------------
Нужна для телефона        | Qwen2.5-1.5B, Phi-3.5
Нужна для локального ПК   | Llama 3.2 8B, Qwen2.5-7B
Нужен хороший код         | Qwen2.5-Coder-32B
Нужен русский язык        | Qwen2.5-72B, Llama 3.2
Нужна лучшая качество     | DeepSeek-R1, GPT-4o
Нужен бесплатный API      | Qwen2.5, Llama 3.2
Нужна мультимодальная     | Qwen2-VL, LLaVA
Нужна для RAG             | Llama 3.2 8B
Нужна для классификации   | Qwen2.5-3B

Итоги

Модель Размер Лучшее для GPU
Qwen2.5-72B 72B General, RU 2× A100
Llama 3.1 70B 70B General, EN 2× A100
Qwen2.5-Coder-32B 32B Coding 1× 4090
Llama 3.2 8B 8B Local, General 1× 8GB
Qwen2.5-7B 7B Edge, General 1× 6GB
Phi-3.5-mini 3.8B Mobile, Edge 1× 4GB
DeepSeek-R1 671B Reasoning API only

Ссылки