Маршрутизация моделей (от дешёвых к дорогим)
Сначала попробуйте небольшую модель, а к передовой переходите только при сбое небольшой модели или низкой уверенности в результате
«Маршрутизация моделей (от дешёвых к дорогим)» — бесплатный урок AI Agents на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
Не используйте большие модели для простых задач
Вызывать GPT-4o, чтобы определить, является ли письмо спамом, — пустая трата денег. Направляйте простые задачи в дешёвые модели, а сложные — в дорогие.
Схема маршрутизации
- Сначала попробуйте небольшую или дешёвую модель
- Если уверенность в результате низкая или он не проходит проверку, передайте задачу большой модели
- Записывайте в журнал, какой путь был выбран
Confidence-Based Routing
cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)Маршрутизация по результатам проверки
Если результат дешёвой модели не проходит проверку схемы, передайте задачу другой модели:
try:
result = Schema.model_validate_json(cheap_response.content)
return result
except ValidationError:
return Schema.model_validate_json(call('gpt-4o', messages).content)Выбор модели для каждого шага
Для разных частей агента нужны разные модели:
MODEL_BY_STEP = {
'classify_intent': 'gpt-4o-mini', # easy
'plan': 'gpt-4o', # critical
'extract': 'gpt-4o-mini', # routine
'write_response': 'claude-sonnet-4-5' # quality matters
}
# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
print(f'{step:16s} -> {MODEL_BY_STEP[step]}')
Маршрутизация между поставщиками
Используйте Groq для малой задержки, OpenAI для качества, а Anthropic — для длинного контекста:
if need_low_latency:
return call_groq('llama-3.1-70b')
elif need_long_context:
return call_anthropic('claude-sonnet-4-5')
else:
return call_openai('gpt-4o-mini')LLM в роли маршрутизатора
Небольшая модель классифицирует запрос и выбирает следующую модель:
router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
return call('gpt-4o-mini', user_msg)
else:
return call('gpt-4o', user_msg)Резервная цепочка
Если основная модель не сработала (ограничение частоты запросов или ошибка), попробуйте резервную:
for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
try:
return call(model, messages)
except RateLimitError:
continue
raise AllModelsFailed()Маршрутизация на основе векторных представлений
Преобразуйте запрос в векторное представление. Если он похож на известный простой случай, используйте дешёвую модель, иначе — большую:
embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
use_cheap_model()Пример иерархии маршрутизации
| Уровень | Стоимость | Применение |
|---|---|---|
| Уровень 1 | $ — Llama 8B | Классификация, извлечение |
| Уровень 2 | $$ — gpt-4o-mini | Стандартные шаги агента |
| Уровень 3 | $$$ — gpt-4o / claude | Сложные рассуждения, итоговый синтез |
Измеряйте чистую экономию
Отслеживайте:
- Долю запросов, обслуженных на каждом уровне
- Качество (долю успешных оценок) для каждого уровня
- Общую стоимость одного запроса
Сравнивайте результаты с базовым вариантом (всегда использовать большую модель), чтобы убедиться, что маршрутизация действительно помогает.
Калибруйте уверенность
Уверенность, о которой сообщает сама модель, ненадёжна. Калибруйте её по оценочному набору: если модель говорит о 90%-ной уверенности, но отвечает правильно лишь в 60% случаев, скорректируйте порог.
Маршрутизаторы с открытым исходным кодом
RouteLLM (LMSYS) — это фреймворк OSS для обученных маршрутизаторов моделей. Его стоит изучить, если маршрутизация играет важную роль в структуре Ваших расходов.
Стратегия маршрутизации
Какова самая простая и эффективная стратегия маршрутизации?
Итоги
Иерархия моделей, сначала дешёвая модель с последующей передачей сложных случаев, маршрутизация по шагам и резервные цепочки. Измеряйте состав уровней и качество. Маршрутизация — самый действенный рычаг управления производственными расходами.
Часто задаваемые вопросы
Урок «Маршрутизация моделей (от дешёвых к дорогим)» бесплатный?
Да — полный текст урока «Маршрутизация моделей (от дешёвых к дорогим)» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.
Чему я научусь в уроке «Маршрутизация моделей (от дешёвых к дорогим)»?
Сначала попробуйте небольшую модель, а к передовой переходите только при сбое небольшой модели или низкой уверенности в результате Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Agents?
Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.
Сколько времени занимает урок «Маршрутизация моделей (от дешёвых к дорогим)»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Agents?
Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Бюджеты токенов на каждый шаг
- Маршрутизация моделей (от дешёвых к дорогим)
- Кэширование подсказок и результатов (Anthropic, Vertex)
- Квантизация и спекулятивное декодирование