0Pricing
AI Agents · Lección

Enrutamiento de modelos (barato -> caro)

Pruebe primero un modelo pequeño y recurra a un modelo de frontera solo cuando el pequeño falle o tenga poca confianza.

Enrutamiento de modelos (barato -> caro) es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.

Partes de esta lección aún no han sido traducidas y se muestran en inglés.

No use modelos grandes para tareas sencillas

Llamar a GPT-4o para preguntar «¿este correo es spam?» desperdicia dinero. Enrute las tareas sencillas a modelos baratos y las tareas difíciles a modelos costosos.

El patrón de enrutamiento

  1. Pruebe primero con un modelo pequeño y barato
  2. Si la salida tiene poca confianza o no supera la validación, escale al modelo grande
  3. Registre qué ruta se siguió

Confidence-Based Routing

cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
    return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)

Enrutamiento basado en la validación

Si la salida del modelo barato no supera la validación del esquema, escale:

try:
    result = Schema.model_validate_json(cheap_response.content)
    return result
except ValidationError:
    return Schema.model_validate_json(call('gpt-4o', messages).content)

Elección del modelo por paso

Las distintas partes de un agente necesitan modelos diferentes:

MODEL_BY_STEP = {
    'classify_intent': 'gpt-4o-mini',     # easy
    'plan': 'gpt-4o',                     # critical
    'extract': 'gpt-4o-mini',             # routine
    'write_response': 'claude-sonnet-4-5' # quality matters
}

# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
    print(f'{step:16s} -> {MODEL_BY_STEP[step]}')

Enrutamiento entre proveedores

Use Groq para la latencia, OpenAI para la calidad y Anthropic para contextos largos:

if need_low_latency:
    return call_groq('llama-3.1-70b')
elif need_long_context:
    return call_anthropic('claude-sonnet-4-5')
else:
    return call_openai('gpt-4o-mini')

LLM como enrutador

Un modelo pequeño clasifica la solicitud y elige el siguiente modelo:

router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
    return call('gpt-4o-mini', user_msg)
else:
    return call('gpt-4o', user_msg)

Cadena de respaldo

Si el modelo principal falla (límite de solicitudes o error), pruebe con el secundario:

for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
    try:
        return call(model, messages)
    except RateLimitError:
        continue
raise AllModelsFailed()

Enrutamiento basado en embeddings

Genere el embedding de la consulta; si es similar a un caso sencillo conocido, use el modelo barato; de lo contrario, use el modelo grande:

embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
    use_cheap_model()

Ejemplo de jerarquía de enrutamiento

NivelCosteUso
Nivel 1$ — Llama 8BClasificación, extracción
Nivel 2$$ — gpt-4o-miniPasos estándar del agente
Nivel 3$$$ — gpt-4o / claudeRazonamiento difícil, síntesis final

Mida el ahorro neto

Registre:

  • El porcentaje de solicitudes atendidas por cada nivel
  • La calidad (tasa de aprobaciones en la evaluación) de cada nivel
  • El coste total por solicitud

Compárelo con la línea base (usar siempre el modelo grande) para verificar que el enrutamiento resulta útil.

Calibre la confianza

La confianza declarada por el propio modelo no es fiable. Calíbrela con un conjunto de evaluación; si el modelo afirma tener un 90 % de confianza, pero solo acierta el 60 % de las veces, ajuste el umbral.

Enrutadores de código abierto

RouteLLM (LMSYS) es un framework de código abierto para enrutadores de modelos entrenados. Merece la pena explorarlo si el enrutamiento es fundamental para su estructura de costes.

Estrategia de enrutamiento

¿Cuál es la estrategia de enrutamiento más sencilla y eficaz?

Resumen

Modelos organizados por niveles, empezar por el barato y escalar cuando sea necesario, enrutamiento por paso y cadenas de respaldo. Mida la combinación de niveles y la calidad. El enrutamiento es la palanca más importante para reducir los costes de producción.

Preguntas frecuentes

¿La lección «Enrutamiento de modelos (barato -> caro)» es gratis?

Sí — el texto completo de «Enrutamiento de modelos (barato -> caro)» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.

¿Qué aprenderé en «Enrutamiento de modelos (barato -> caro)»?

Pruebe primero un modelo pequeño y recurra a un modelo de frontera solo cuando el pequeño falle o tenga poca confianza. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Agents?

No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «Enrutamiento de modelos (barato -> caro)»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Agents?

Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Presupuestos de tokens por paso
  2. Enrutamiento de modelos (barato -> caro)
  3. Almacenamiento en caché de prompts y resultados (Anthropic, Vertex)
  4. Cuantización y decodificación especulativa
← Volver a AI Agents