Обзор Llama, Mistral и Qwen
Три крупнейших семейства моделей с открытыми весами: лицензии, размеры и задачи, для которых каждая модель подходит лучше всего.
«Обзор Llama, Mistral и Qwen» — бесплатный урок AI Agents на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
Зачем открытый исходный код
Модели с открытыми весами дают вам:
- Отсутствие платы API за каждый токен
- Конфиденциальность данных — модель работает на вашем оборудовании
- Настройку под свои задачи с помощью дообучения в любом масштабе
- Отсутствие зависимости от поставщика
Цена: часы работы инженеров, расходы на GPU и обычно более низкое качество по сравнению с передовыми моделями.
Семейство Llama (Meta)
- Выпускалось в 2023–2025 годах в размерах от 1B до 405B
- Llama 3.x обладает широкими возможностями; модель 8B конкурирует с закрытыми моделями среднего уровня
- Лицензия сообщества разрешает коммерческое использование при определённых условиях
- Огромная экосистема; большинство дообученных моделей создано на основе Llama
Семейство Mistral (Mistral AI)
- Mistral 7B Instruct — мощная небольшая модель
- Mixtral 8x7B — архитектура смеси экспертов, быстрая и эффективная модель
- Mistral Large / Medium — модели с закрытыми весами, доступные через API
- Лицензия Apache 2.0 для открытых вариантов
Семейство Qwen (Alibaba)
- Qwen 2.5 — одна из лучших открытых моделей для рассуждений (2024)
- Отличная поддержка многих языков, особенно китайского
- Размеры от 0.5B до 72B
- Apache 2.0
Другие заметные модели
- Gemma (Google) — небольшая и хорошо доработанная
- Phi (Microsoft) — крошечная, но эффективная
- DeepSeek — сильные способности к рассуждению при меньшей стоимости
- Yi — сильная поддержка многих языков
Выбор размера
| Размер | Сценарий использования |
|---|---|
| 1-3B | Периферийные устройства, мобильные устройства, классификация |
| 7-8B | Один GPU, простые агенты |
| 13-30B | Более мощный GPU или 2–4 небольших GPU, полноценные агенты |
| 70B+ | Несколько GPU, качество передовых моделей |
Важные тесты производительности
- MMLU — общие знания
- GSM8K — математика
- HumanEval — код
- MT-Bench — качество диалога
- HELM / LMSYS Chatbot Arena — предпочтения людей
Выбирайте тесты, соответствующие YOUR задаче.
Разрыв с передовыми моделями сокращается
Передовые закрытые модели (GPT-4o, Claude Sonnet 4.5) всё ещё опережают остальные на самых сложных тестах. Но открытые модели 70B сопоставимы с закрытыми моделями среднего уровня в большинстве задач для агентов.
Что учитывать при выборе лицензии
Проверяйте лицензию каждой модели:
- Apache 2.0 — полностью разрешительная лицензия
- Лицензия сообщества Llama — ограничения для сервисов огромного масштаба и некоторых сценариев использования
- Некоторые лицензии «только для исследований» — коммерческое развёртывание запрещено
Облачное размещение и собственная инфраструктура
Вы можете использовать открытые модели через размещённые API (Together AI, Anyscale, Groq, Fireworks), не управляя инфраструктурой самостоятельно, — часто это дешевле, чем OpenAI, при сопоставимом качестве.
Hosted Open Models on Groq
from openai import OpenAI
client = OpenAI(
base_url='https://api.groq.com/openai/v1',
api_key=GROQ_KEY
)
response = client.chat.completions.create(
model='llama-3.1-70b-versatile',
messages=[{'role': 'user', 'content': 'Hello'}]
)Когда OSS выигрывает
- Критически важна конфиденциальность: медицина, право, оборона
- Очень большой объём: важна стоимость в несколько центов за вызов
- Требуется глубокая настройка: дообучение для конкретной области
- Многоязычные задачи, в которых закрытые поставщики работают хуже
Когда выигрывают закрытые модели
- Рассуждения на уровне передовых моделей
- Мультимодальные задачи: зрение, голос
- Большой контекст: Claude и Gemini по-прежнему лидируют
- Быстрое создание прототипов
Самая маленькая подходящая модель
Какой диапазон размеров обычно выбирают для простого внутреннего агента, работающего на одном GPU?
Итоги
Llama, Mistral и Qwen — три главных семейства. Выбирайте минимальный размер, обеспечивающий нужное качество. Размещённые провайдеры (Groq, Together) позволяют обойтись без собственной инфраструктуры.
Часто задаваемые вопросы
Урок «Обзор Llama, Mistral и Qwen» бесплатный?
Да — полный текст урока «Обзор Llama, Mistral и Qwen» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.
Чему я научусь в уроке «Обзор Llama, Mistral и Qwen»?
Три крупнейших семейства моделей с открытыми весами: лицензии, размеры и задачи, для которых каждая модель подходит лучше всего. Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Agents?
Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.
Сколько времени занимает урок «Обзор Llama, Mistral и Qwen»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Agents?
Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Обзор Llama, Mistral и Qwen
- Запуск локальных моделей с Ollama и llama.cpp
- Вызов функций в открытых моделях (Hermes, Functionary)
- Компромиссы: задержка, стоимость, возможности