0Pricing
AI Agents · Урок

Компромиссы: задержка, стоимость, возможности

Открытые веса экономят деньги, но требуют времени инженеров; проведите сравнительное тестирование до принятия решения.

«Компромиссы: задержка, стоимость, возможности» — бесплатный урок AI Agents на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.

Три параметра — выберите два

При выборе любой модели приходится искать компромисс между:

  • Задержкой — временем на один ответ
  • Стоимостью — за миллион токенов
  • Возможностями — качеством решения сложных задач

Ни одна модель не лучшая по всем трём параметрам.

Спектр возможностей

Высший уровеньСредний уровеньНебольшие модели
ЗакрытыеGPT-4o, Claude Sonnet 4.5GPT-4o-mini, Haiku—
ОткрытыеLlama 3.1 405BLlama 3.1 70B, Qwen 2.5 72BLlama 3.1 8B, Phi-3

Спектр задержки

Примерная задержка p50 для обычного шага агента:

  • Groq Llama 3.1 70B: ~200 мс — молниеносно
  • gpt-4o-mini: ~600 мс
  • gpt-4o: ~1500 мс
  • Llama 70B на собственной инфраструктуре с 1xH100: ~800 мс
  • Llama 8B на собственной инфраструктуре с RTX 4090: ~200 мс

Стоимость миллиона токенов (примерно)

Ориентировочные цены на середину 2025 года, вход/выход:

  • GPT-4o: $2.50 / $10
  • GPT-4o-mini: $0.15 / $0.60
  • Claude Sonnet 4.5: $3 / $15
  • Claude Haiku: $0.80 / $4
  • Together Llama 70B: $0.88 / $0.88
  • Groq Llama 70B: $0.59 / $0.79
  • Самостоятельное размещение (ваш GPU): фактически бесплатно за токен

Рассчитайте точку окупаемости

Самостоятельное размещение экономит деньги только после достижения определённого объёма. Грубая оценка:

GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")

Маршрутизация моделей

Используйте дешёвые модели по умолчанию и переходите на дорогие только при необходимости:

def answer(query):
    cheap = call_model('gpt-4o-mini', query)
    if confidence(cheap) > 0.8:
        return cheap
    return call_model('gpt-4o', query)

Маршрутизация на каждом шаге

Внутри агента выбирайте модель для каждого шага:

  • Планируйте с помощью GPT-4o (сложные рассуждения)
  • Ищите с помощью Llama 8B (дешёвые циклы)
  • Синтезируйте с помощью Claude (высокое качество написания)

Пути, чувствительные к задержке

Для голосового общения и чата в реальном времени:

  • Используйте Groq, SambaNova или Cerebras для задержки менее 200 мс
  • Активно передавайте токены потоком
  • Не используйте многошаговых агентов на критическом пути

Пути, чувствительные к качеству

Для итоговых ответов и задач с высокими рисками:

  • Используйте лучшую доступную вам модель
  • Добавьте критику между моделями (GPT-4 пишет, Claude проверяет)
  • Добавьте проверку (запустите код, проверьте факты)

Совокупная стоимость владения

Стоимость самостоятельного размещения включает:

  • Аренду GPU или капитальные затраты
  • Время инженеров на управление инфраструктурой
  • Мониторинг и дежурство
  • Меньшую пропускную способность по сравнению с размещёнными сервисами

Для большинства команд API размещённых сервисов имеют меньшую совокупную стоимость владения, пока объём не станет очень большим.

Когда стоит платить за большие закрытые модели

  • Итоговые ответы для пользователей
  • Передовые рассуждения
  • Мультимодальность
  • Контекст объёмом более 200 тыс. токенов

Проверьте модель на своей задаче

Публичные сравнительные тесты показывают лишь часть картины. Создайте набор из 50 вопросов на своих реальных данных и измерьте на нём каждую модель-кандидат. Выберите самую дешёвую модель, которая обеспечивает нужное качество.

Стратегия маршрутизации

Какова самая дешёвая стратегия маршрутизации моделей, которая всё ещё обеспечивает нужное качество?

Итоги

Задержка, стоимость, возможности — выберите два из трёх. Используйте дешёвые модели по умолчанию и переходите на более мощные при необходимости. API размещённых открытых моделей (Groq, Together) часто превосходят оба крайних варианта.

Часто задаваемые вопросы

Урок «Компромиссы: задержка, стоимость, возможности» бесплатный?

Да — полный текст урока «Компромиссы: задержка, стоимость, возможности» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.

Чему я научусь в уроке «Компромиссы: задержка, стоимость, возможности»?

Открытые веса экономят деньги, но требуют времени инженеров; проведите сравнительное тестирование до принятия решения. Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Agents?

Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.

Сколько времени занимает урок «Компромиссы: задержка, стоимость, возможности»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Agents?

Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Обзор Llama, Mistral и Qwen
  2. Запуск локальных моделей с Ollama и llama.cpp
  3. Вызов функций в открытых моделях (Hermes, Functionary)
  4. Компромиссы: задержка, стоимость, возможности
← Назад к AI Agents