AI Agents · Lección

Por qué los contextos largos no escalan

El coste crece linealmente, la calidad se degrada y el fenómeno «lost-in-the-middle» hace que el modelo olvide contenido enterrado en prompts largos.

Lección 2 de 413 pasos

Por qué los contextos largos no escalan es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.

Más grande no siempre es mejor

Los modelos modernos tienen ventanas de contexto enormes: 200k, 1M e incluso 2M de tokens. Resulta tentador "volcarlo todo" en lugar de crear una memoria real.

Este enfoque falla en producción por tres motivos.

Motivo 1: coste

Cada token de cada llamada cuesta dinero. Un prompt del sistema de 100k tokens con 1000 turnos equivale a 100M de tokens de entrada, lo que suma decenas de dólares por sesión.

El almacenamiento en caché del prompt ayuda, pero no elimina el coste.

Motivo 2: latencia

Procesar 100k tokens de entrada añade entre 1 y 3 segundos al tiempo hasta el primer token. Para la experiencia de usuario de un chat, debe procurar que el TTFT sea inferior a 500 ms.

Motivo 3: la calidad disminuye

Los modelos prestan menos atención al contenido situado en el centro de prompts largos: el efecto "lost-in-the-middle" documentado por Liu et al. en 2023.

La información del principio o del final se recuerda con precisión; la del centro suele pasarse por alto.

Una prueba concreta

Inserte un dato único en distintas posiciones de un documento largo y pida al modelo que lo recupere. Precisión:

  • Principio del documento: 95 %
  • Final del documento: 90 %
  • Centro: 50-70 %

Contexto largo para evaluación, no para producción

Los contextos largos son útiles para tareas puntuales (analizar todo este código base), pero no son adecuados para agentes de producción en funcionamiento continuo.

En producción, use retrieval para inyectar únicamente el 5 % relevante en cada turno.

Cuándo ayudan los contextos largos

  • Análisis inicial del código base
  • Preguntas y respuestas sobre un documento completo en una sola llamada
  • Comparación de dos documentos largos

Tareas puntuales sin repetición.

Cuándo perjudican los contextos largos

  • Chatbots con cientos de turnos
  • Agentes multiinquilino compartidos entre usuarios
  • Cualquier situación en la que importen el coste o la latencia

La arquitectura adecuada

Para agentes de larga duración:

  1. Turnos recientes en el prompt (los últimos 10-20)
  2. Turnos anteriores resumidos en un resumen acumulativo
  3. Datos vectorizados en la memoria a largo plazo
  4. Recupere las memorias relevantes con mayor puntuación en cada turno

Enfoque híbrido

Combine técnicas:

messages = [
    {'role': 'system', 'content': PERSONA},
    {'role': 'system', 'content': f'Conversation summary so far: {summary}'},
    {'role': 'system', 'content': f'Relevant past facts: {retrieved_facts}'},
    *last_n_turns,
]

Desencadenadores de compactación

Decida CUÁNDO compactar:

  • Cada N turnos (sencillo)
  • Cuando el recuento de tokens supere un umbral (mejor)
  • Cuando el modelo empiece a olvidar (lo mejor, pero difícil de detectar)

Lost in the Middle

¿Qué es el efecto "lost-in-the-middle"?

Recapitulación

No resuelva la memoria agotando el contexto. Use resúmenes y retrieval para mostrar lo importante en cada turno.

Gratis para empezar

Aprende AI Agents con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
60
Lecciones
239

Preguntas frecuentes

¿La lección «Por qué los contextos largos no escalan» es gratis?

Sí — el texto completo de «Por qué los contextos largos no escalan» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.

¿Qué aprenderé en «Por qué los contextos largos no escalan»?

El coste crece linealmente, la calidad se degrada y el fenómeno «lost-in-the-middle» hace que el modelo olvide contenido enterrado en prompts largos. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Agents?

No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «Por qué los contextos largos no escalan»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Agents?

Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Memoria a corto plazo en la ventana de contexto
  2. Por qué los contextos largos no escalan
  3. La resumización como compresión
  4. Almacenes de memoria sencillos (clave-valor)
← Volver a AI Agents