0Pricing
AI Agents · Урок

Маршрутизация моделей (от дешёвых к дорогим)

Сначала попробуйте небольшую модель, а к передовой переходите только при сбое небольшой модели или низкой уверенности в результате

«Маршрутизация моделей (от дешёвых к дорогим)» — бесплатный урок AI Agents на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

Не используйте большие модели для простых задач

Вызывать GPT-4o, чтобы определить, является ли письмо спамом, — пустая трата денег. Направляйте простые задачи в дешёвые модели, а сложные — в дорогие.

Схема маршрутизации

  1. Сначала попробуйте небольшую или дешёвую модель
  2. Если уверенность в результате низкая или он не проходит проверку, передайте задачу большой модели
  3. Записывайте в журнал, какой путь был выбран

Confidence-Based Routing

cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
    return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)

Маршрутизация по результатам проверки

Если результат дешёвой модели не проходит проверку схемы, передайте задачу другой модели:

try:
    result = Schema.model_validate_json(cheap_response.content)
    return result
except ValidationError:
    return Schema.model_validate_json(call('gpt-4o', messages).content)

Выбор модели для каждого шага

Для разных частей агента нужны разные модели:

MODEL_BY_STEP = {
    'classify_intent': 'gpt-4o-mini',     # easy
    'plan': 'gpt-4o',                     # critical
    'extract': 'gpt-4o-mini',             # routine
    'write_response': 'claude-sonnet-4-5' # quality matters
}

# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
    print(f'{step:16s} -> {MODEL_BY_STEP[step]}')

Маршрутизация между поставщиками

Используйте Groq для малой задержки, OpenAI для качества, а Anthropic — для длинного контекста:

if need_low_latency:
    return call_groq('llama-3.1-70b')
elif need_long_context:
    return call_anthropic('claude-sonnet-4-5')
else:
    return call_openai('gpt-4o-mini')

LLM в роли маршрутизатора

Небольшая модель классифицирует запрос и выбирает следующую модель:

router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
    return call('gpt-4o-mini', user_msg)
else:
    return call('gpt-4o', user_msg)

Резервная цепочка

Если основная модель не сработала (ограничение частоты запросов или ошибка), попробуйте резервную:

for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
    try:
        return call(model, messages)
    except RateLimitError:
        continue
raise AllModelsFailed()

Маршрутизация на основе векторных представлений

Преобразуйте запрос в векторное представление. Если он похож на известный простой случай, используйте дешёвую модель, иначе — большую:

embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
    use_cheap_model()

Пример иерархии маршрутизации

УровеньСтоимостьПрименение
Уровень 1$ — Llama 8BКлассификация, извлечение
Уровень 2$$ — gpt-4o-miniСтандартные шаги агента
Уровень 3$$$ — gpt-4o / claudeСложные рассуждения, итоговый синтез

Измеряйте чистую экономию

Отслеживайте:

  • Долю запросов, обслуженных на каждом уровне
  • Качество (долю успешных оценок) для каждого уровня
  • Общую стоимость одного запроса

Сравнивайте результаты с базовым вариантом (всегда использовать большую модель), чтобы убедиться, что маршрутизация действительно помогает.

Калибруйте уверенность

Уверенность, о которой сообщает сама модель, ненадёжна. Калибруйте её по оценочному набору: если модель говорит о 90%-ной уверенности, но отвечает правильно лишь в 60% случаев, скорректируйте порог.

Маршрутизаторы с открытым исходным кодом

RouteLLM (LMSYS) — это фреймворк OSS для обученных маршрутизаторов моделей. Его стоит изучить, если маршрутизация играет важную роль в структуре Ваших расходов.

Стратегия маршрутизации

Какова самая простая и эффективная стратегия маршрутизации?

Итоги

Иерархия моделей, сначала дешёвая модель с последующей передачей сложных случаев, маршрутизация по шагам и резервные цепочки. Измеряйте состав уровней и качество. Маршрутизация — самый действенный рычаг управления производственными расходами.

Часто задаваемые вопросы

Урок «Маршрутизация моделей (от дешёвых к дорогим)» бесплатный?

Да — полный текст урока «Маршрутизация моделей (от дешёвых к дорогим)» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.

Чему я научусь в уроке «Маршрутизация моделей (от дешёвых к дорогим)»?

Сначала попробуйте небольшую модель, а к передовой переходите только при сбое небольшой модели или низкой уверенности в результате Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Agents?

Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.

Сколько времени занимает урок «Маршрутизация моделей (от дешёвых к дорогим)»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Agents?

Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Бюджеты токенов на каждый шаг
  2. Маршрутизация моделей (от дешёвых к дорогим)
  3. Кэширование подсказок и результатов (Anthropic, Vertex)
  4. Квантизация и спекулятивное декодирование
← Назад к AI Agents