Компромиссы: задержка, стоимость, возможности
Открытые веса экономят деньги, но требуют времени инженеров; проведите сравнительное тестирование до принятия решения.
«Компромиссы: задержка, стоимость, возможности» — бесплатный урок AI Agents на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.
Три параметра — выберите два
При выборе любой модели приходится искать компромисс между:
- Задержкой — временем на один ответ
- Стоимостью — за миллион токенов
- Возможностями — качеством решения сложных задач
Ни одна модель не лучшая по всем трём параметрам.
Спектр возможностей
| Высший уровень | Средний уровень | Небольшие модели | |
|---|---|---|---|
| Закрытые | GPT-4o, Claude Sonnet 4.5 | GPT-4o-mini, Haiku | — |
| Открытые | Llama 3.1 405B | Llama 3.1 70B, Qwen 2.5 72B | Llama 3.1 8B, Phi-3 |
Спектр задержки
Примерная задержка p50 для обычного шага агента:
- Groq Llama 3.1 70B: ~200 мс — молниеносно
- gpt-4o-mini: ~600 мс
- gpt-4o: ~1500 мс
- Llama 70B на собственной инфраструктуре с 1xH100: ~800 мс
- Llama 8B на собственной инфраструктуре с RTX 4090: ~200 мс
Стоимость миллиона токенов (примерно)
Ориентировочные цены на середину 2025 года, вход/выход:
- GPT-4o: $2.50 / $10
- GPT-4o-mini: $0.15 / $0.60
- Claude Sonnet 4.5: $3 / $15
- Claude Haiku: $0.80 / $4
- Together Llama 70B: $0.88 / $0.88
- Groq Llama 70B: $0.59 / $0.79
- Самостоятельное размещение (ваш GPU): фактически бесплатно за токен
Рассчитайте точку окупаемости
Самостоятельное размещение экономит деньги только после достижения определённого объёма. Грубая оценка:
GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")
Маршрутизация моделей
Используйте дешёвые модели по умолчанию и переходите на дорогие только при необходимости:
def answer(query):
cheap = call_model('gpt-4o-mini', query)
if confidence(cheap) > 0.8:
return cheap
return call_model('gpt-4o', query)Маршрутизация на каждом шаге
Внутри агента выбирайте модель для каждого шага:
- Планируйте с помощью GPT-4o (сложные рассуждения)
- Ищите с помощью Llama 8B (дешёвые циклы)
- Синтезируйте с помощью Claude (высокое качество написания)
Пути, чувствительные к задержке
Для голосового общения и чата в реальном времени:
- Используйте Groq, SambaNova или Cerebras для задержки менее 200 мс
- Активно передавайте токены потоком
- Не используйте многошаговых агентов на критическом пути
Пути, чувствительные к качеству
Для итоговых ответов и задач с высокими рисками:
- Используйте лучшую доступную вам модель
- Добавьте критику между моделями (GPT-4 пишет, Claude проверяет)
- Добавьте проверку (запустите код, проверьте факты)
Совокупная стоимость владения
Стоимость самостоятельного размещения включает:
- Аренду GPU или капитальные затраты
- Время инженеров на управление инфраструктурой
- Мониторинг и дежурство
- Меньшую пропускную способность по сравнению с размещёнными сервисами
Для большинства команд API размещённых сервисов имеют меньшую совокупную стоимость владения, пока объём не станет очень большим.
Когда стоит платить за большие закрытые модели
- Итоговые ответы для пользователей
- Передовые рассуждения
- Мультимодальность
- Контекст объёмом более 200 тыс. токенов
Проверьте модель на своей задаче
Публичные сравнительные тесты показывают лишь часть картины. Создайте набор из 50 вопросов на своих реальных данных и измерьте на нём каждую модель-кандидат. Выберите самую дешёвую модель, которая обеспечивает нужное качество.
Стратегия маршрутизации
Какова самая дешёвая стратегия маршрутизации моделей, которая всё ещё обеспечивает нужное качество?
Итоги
Задержка, стоимость, возможности — выберите два из трёх. Используйте дешёвые модели по умолчанию и переходите на более мощные при необходимости. API размещённых открытых моделей (Groq, Together) часто превосходят оба крайних варианта.
Часто задаваемые вопросы
Урок «Компромиссы: задержка, стоимость, возможности» бесплатный?
Да — полный текст урока «Компромиссы: задержка, стоимость, возможности» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.
Чему я научусь в уроке «Компромиссы: задержка, стоимость, возможности»?
Открытые веса экономят деньги, но требуют времени инженеров; проведите сравнительное тестирование до принятия решения. Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Agents?
Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.
Сколько времени занимает урок «Компромиссы: задержка, стоимость, возможности»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Agents?
Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Обзор Llama, Mistral и Qwen
- Запуск локальных моделей с Ollama и llama.cpp
- Вызов функций в открытых моделях (Hermes, Functionary)
- Компромиссы: задержка, стоимость, возможности