Выбор LLM модели в 2026: руководство по сравнению моделей
opensourceaillmcomparisonit
Введение
Как выбрать LLM модель для вашего проекта? Есть десятки моделей — от 1B до 400B параметров. Разбираемся.
Категории LLM моделей
Small Language Models (1B-7B)
Модель | Параметры | Языки | Специализация
Qwen2.5-1.5B | 1.5B | 29+ | General
Phi-3.5-mini | 3.8B | EN | General
Gemma-2-2B | 2.6B | EN | General
SmolLM2-1.7B | 1.7B | EN, FR, DE | General
Когда использовать:
- Edge devices (телефоны, Raspberry Pi)
- Low-latency applications
- Cost-sensitive deployments
- Simple tasks (classification, extraction)
Medium Models (7B-20B)
Модель | Параметры | Языки | Специализация
Llama 3.2 8B | 8B | 100+ | General
Qwen2.5-7B | 7B | 29+ | General
Mistral Small 24B| 24B | EN, FR, DE, ES | Multilingual
Gemma-2-9B | 9.2B | EN | General
Когда использовать:
- Local deployment (1× GPU)
- Development and testing
- Production with moderate load
- Multi-task applications
Large Models (20B-70B)
Модель | Параметры | Языки | Специализация
Llama 3.1 70B | 70B | 100+ | General
Qwen2.5-32B | 32B | 29+ | General
Mixtral 8x7B | 47B* | EN | General (MoE)
DeepSeek V3 | 671B* | EN, ZH, EN | Coding, Math
Когда использовать:
- Production serving (multi-GPU)
- Complex reasoning tasks
- Research and analysis
- High-quality generation
Massive Models (100B+)
Модель | Параметры | Специализация
GPT-4o | ~1.8T* | Multi-modal
Claude 3.5 Sonnet | ~200B* | General
Gemini Ultra | ~1.8T* | Multi-modal
DeepSeek-R1 | 671B | Reasoning
Сравнение открытых моделей
Llama 3.1/3.2 (Meta)
Модель | Params | Context | Training Data
Llama 3.1 8B | 8B | 128K | 15T tokens
Llama 3.1 70B | 70B | 128K | 15T tokens
Llama 3.1 405B | 405B | 128K | 15T tokens
Llama 3.2 1B | 1B | 128K | 2T tokens
Llama 3.2 3B | 3B | 128K | 2T tokens
Плюсы:
✅ Лучшая экосистема (GGUF, LoRA, инструменты)
✅ Отличная документация
✅ Коммерческое использование
✅ Многоязычность (100+ языков)
Минусы:
❌ Требует approval для использования
❌ 405B только через API (Groq, Replicate)
Qwen 2.5 (Alibaba)
Модель | Params | Context | Языки
Qwen2.5-0.5B | 0.5B | 32K | 29+
Qwen2.5-1.5B | 1.5B | 32K | 29+
Qwen2.5-7B | 7B | 32K | 29+
Qwen2.5-14B | 14B | 32K | 29+
Qwen2.5-32B | 32B | 128K | 29+
Qwen2.5-72B | 72B | 128K | 29+
Qwen2.5-110B | 110B | 128K | 29+
Плюсы:
✅ Лучший Chinese + English
✅ Отличное код-генерирование
✅ Open weights, коммерческое использование
✅ MoE варианты (очень быстрые)
Минусы:
❌ Меньше экосистема чем Llama
❌ Меньше fine-tuned моделей
Mistral (Mistral AI)
Модель | Params | Type | Context
Mistral Small 3 | 24B | Dense | 128K
Mistral Large 2 | 123B* | MoE | 128K
Mixtral 8x7B | 47B | MoE | 32K
Mixtral 8x22B | 141B | MoE | 65K
Плюсы:
✅ Хороший European focus
✅ MoE архитектура (быстро)
✅ Open weights
✅ Хороший French
Минусы:
❌ Меньше multilingual чем Qwen
❌ Меньше community
Phi-3.5 (Microsoft)
Модель | Params | Context | Training
Phi-3.5-mini | 3.8B | 128K | Synthetic
Phi-3.5-mini-instruct | 3.8B | 128K | Multi-task
Phi-3.5-MoE | 4.2B | 128K | Active params
Плюсы:
✅ Отличное качество для размера
✅ Synthetic training data
✅ Dense (не MoE) — простой деплой
✅ Microsoft экосистема
Минусы:
❌ Меньше языков
❌ Меньше community
Gemma 2 (Google)
Модель | Params | Context | Фичи
Gemma-2-2B | 2.6B | 8K | Lightweight
Gemma-2-9B | 9.2B | 8K | GQA
Gemma-2-27B | 27B | 8K | GQA, MoE
Плюсы:
✅ Google quality
✅ GQA для быстрого inference
✅ Open weights
Минусы:
❌ Короткий context (8K)
❌ Меньше экосистема
Специализированные модели
Код-генерирование
Модель | Params | MMLU | HumanEval
Codestral Mamba | 7B | - | 82.3%
Codellama | 34B | - | 71.8%
DeepSeek-Coder-V2 | 236B | 66.5 | 85.7%
Qwen2.5-Coder | 32B | 72.1 | 87.2%
StarCoder2 | 15B | - | 73.5%
Codestral Mamba:
- SSM архитектура (быстрая)
- 256K context
- 80+ языков программирования
Qwen2.5-Coder-32B:
- Лучший open code model 2026
- 32B параметры
- 87.2% HumanEval
Математика и reasoning
Модель | Params | GSM8K | MATH
DeepSeek-R1 | 671B | 96.8% | 71.9%
Qwen2.5-72B | 72B | 82.2% | 51.2%
Llama 3.1 70B | 70B | 80.5% | 48.3%
Gemini 1.5 Pro | ~175B | 94.0% | 66.0%
DeepSeek-R1:
- Reinforcement learning для reasoning
- Chain-of-thought генерация
- State-of-the-art для математики
Мультимодальные модели
Модель | Params | Vision | Audio | Text
GPT-4o | ~1.8T* | ✅ | ✅ | ✅
Gemini 1.5 Pro | ~175B | ✅ | ✅ | ✅
Qwen2-VL | 72B | ✅ | ✅ | ✅
LLaVA-1.6 | 13-34B | ✅ | ❌ | ✅
Qwen2-VL-72B:
- Open weights
- Video understanding
- OCR quality
- 360K context
Benchmarks сравнение
MMLU (Massive Multitask Language Understanding)
Модель | MMLU Score
GPT-4o | 88.7%
Claude 3.5 Sonnet | 89.0%
Gemini 1.5 Pro | 83.9%
DeepSeek-R1 | 91.6%
Qwen2.5-72B | 82.2%
Llama 3.1 70B | 80.5%
Llama 3.1 8B | 72.0%
Qwen2.5-7B | 71.4%
Phi-3.5-mini | 75.6%
Gemma-2-27B | 78.6%
HumanEval (Python code generation)
Модель | HumanEval
DeepSeek-R1 | 96.0%
GPT-4o | 87.8%
Claude 3.5 Sonnet | 85.7%
Qwen2.5-Coder-32B | 87.2%
Codestral Mamba | 82.3%
DeepSeek-Coder-V2 | 85.7%
Llama 3.1 70B | 68.9%
Qwen2.5-72B | 81.5%
MATH (Mathematical reasoning)
Модель | MATH
DeepSeek-R1 | 71.9%
GPT-4o | 58.4%
Claude 3.5 Sonnet | 61.1%
Qwen2.5-72B | 51.2%
Llama 3.1 70B | 48.3%
Выбор по GPU
8GB GPU (RTX 3060, 4060)
Рекомендуемые модели (GGUF Q4_K_M):
✅ Qwen2.5-7B (4.4GB)
✅ Llama 3.2 8B (5.5GB)
✅ Phi-3.5-mini (2.2GB)
✅ Gemma-2-2B (1.6GB)
Оптимизация:
- Используйте GGUF формат
- Q4_K_M баланс качество/размер
- Batch size = 1-4
12GB GPU (RTX 3070 Ti, 4070)
Рекомендуемые модели:
✅ Qwen2.5-14B (7.5GB Q4)
✅ Llama 3.1 8B (5.5GB Q4)
✅ Qwen2.5-7B (4.4GB Q4)
Оптимизация:
- Q4_K_M для 14B
- Q6_K для 7B
- Batch size = 4-8
16GB GPU (RTX 4080)
Рекомендуемые модели:
✅ Qwen2.5-14B (7.5GB Q4)
✅ Llama 3.1 70B (40GB Q4 - нет)
✅ Mistral Small | (нужно 2× GPU)
Оптимизация:
- Q4_K_M для 14B
- Q6_K для 14B (9GB)
- Batch size = 8-16
24GB GPU (RTX 3090, 4090)
Рекомендуемые модели:
✅ Qwen2.5-32B (18GB Q4)
✅ Llama 3.1 70B (40GB Q4 - нет)
✅ Qwen2.5-14B (7.5GB Q4)
Оптимизация:
- Q4_K_M для 32B
- Q6_K для 32B (22GB)
- Batch size = 8-32
48GB GPU (RTX 6000)
Рекомендуемые модели:
✅ Llama 3.1 70B (40GB Q4)
✅ Qwen2.5-72B (42GB Q4)
✅ Qwen2.5-32B (18GB Q4)
Оптимизация:
- Q4_K_M для 70B
- Q6_K для 70B (55GB - нет)
- Batch size = 1-4
80GB GPU (A100)
Рекомендуемые модели:
✅ Llama 3.1 70B (140GB FP16 - нет)
✅ Llama 3.1 70B (40GB Q4)
✅ Qwen2.5-72B (42GB Q4)
✅ Llama 3.1 70B (75GB Q8)
Оптимизация:
- Q8_0 для 70B (75GB)
- FP16 требует 2× A100
- Batch size = 1-16
Быстрый выбор
Вопрос | Ответ
--------------------------|------------------
Нужна для телефона | Qwen2.5-1.5B, Phi-3.5
Нужна для локального ПК | Llama 3.2 8B, Qwen2.5-7B
Нужен хороший код | Qwen2.5-Coder-32B
Нужен русский язык | Qwen2.5-72B, Llama 3.2
Нужна лучшая качество | DeepSeek-R1, GPT-4o
Нужен бесплатный API | Qwen2.5, Llama 3.2
Нужна мультимодальная | Qwen2-VL, LLaVA
Нужна для RAG | Llama 3.2 8B
Нужна для классификации | Qwen2.5-3B
Итоги
| Модель | Размер | Лучшее для | GPU |
|---|---|---|---|
| Qwen2.5-72B | 72B | General, RU | 2× A100 |
| Llama 3.1 70B | 70B | General, EN | 2× A100 |
| Qwen2.5-Coder-32B | 32B | Coding | 1× 4090 |
| Llama 3.2 8B | 8B | Local, General | 1× 8GB |
| Qwen2.5-7B | 7B | Edge, General | 1× 6GB |
| Phi-3.5-mini | 3.8B | Mobile, Edge | 1× 4GB |
| DeepSeek-R1 | 671B | Reasoning | API only |