Por que contextos longos não escalam
O custo cresce linearmente, a qualidade se deteriora e o fenômeno de “perda no meio” faz o modelo esquecer conteúdos enterrados em prompts longos.
Por que contextos longos não escalam é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Maior nem sempre é melhor
Os modelos modernos têm janelas de contexto enormes — 200 mil, 1 milhão ou até 2 milhões de tokens. É tentador simplesmente "colocar tudo aqui" em vez de criar uma memória de verdade.
Essa abordagem falha em produção por três motivos.
Motivo 1: custo
Cada token de cada chamada custa dinheiro. Uma instrução do sistema com 100 mil tokens e 1000 interações totaliza 100 milhões de tokens de entrada, chegando a dezenas de dólares por sessão.
O armazenamento em cache de instruções ajuda, mas não elimina o custo.
Motivo 2: latência
Processar 100 mil tokens de entrada acrescenta de 1 a 3 segundos ao tempo até o primeiro token. Para uma boa experiência de conversa, você deseja um TTFT inferior a 500 ms.
Motivo 3: a qualidade cai
Os modelos prestam menos atenção ao conteúdo no meio de instruções longas — o efeito de "perdido no meio", documentado por Liu e colaboradores em 2023.
As informações no início ou no fim são lembradas com precisão; as informações no meio costumam ser ignoradas.
Um teste concreto
Insira um fato exclusivo em posições diferentes de um documento longo e peça ao modelo para recuperá-lo. Precisão:
- Início do documento: 95%
- Fim do documento: 90%
- Meio: 50–70%
Contexto longo para avaliação, não para produção
Contextos longos são úteis para tarefas pontuais (analisar toda esta base de código), mas não são adequados para agentes de produção em operação contínua.
Em produção, use recuperação para inserir apenas os 5% relevantes a cada interação.
Quando contextos longos ajudam
- Análise inicial da base de código
- Perguntas e respostas sobre um documento inteiro em uma única chamada
- Comparação de dois documentos longos
Tarefas de uma única execução, sem repetição.
Quando contextos longos atrapalham
- Chatbots com centenas de interações
- Agentes multiusuário compartilhados entre usuários
- Qualquer situação em que custo ou latência sejam importantes
A arquitetura correta
Para agentes de longa duração:
- Interações recentes na instrução (as últimas 10–20)
- Interações mais antigas sumarizadas em um resumo contínuo
- Fatos vetorizados na memória de longo prazo
- Recupere as K memórias mais relevantes a cada interação
Abordagem híbrida
Combine técnicas:
messages = [
{'role': 'system', 'content': PERSONA},
{'role': 'system', 'content': f'Conversation summary so far: {summary}'},
{'role': 'system', 'content': f'Relevant past facts: {retrieved_facts}'},
*last_n_turns,
]Gatilhos de compactação
Decida WHEN fazer compact:
- A cada N interações (simples)
- Quando a contagem de tokens ultrapassar um limite (melhor)
- Quando o modelo começar a esquecer (melhor, mas difícil de detectar)
Perdido no meio
O que é o efeito de "perdido no meio"?
Recapitulação
Não resolva a memória usando o máximo de contexto possível. Use resumos + recuperação para destacar o que importa em cada interação.
Aprenda AI Agents com um tutor de IA — grátis
Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.
- Cursos
- 60
- Aulas
- 239
Perguntas Frequentes
A aula “Por que contextos longos não escalam” é grátis?
Sim — o texto completo de “Por que contextos longos não escalam” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Por que contextos longos não escalam”?
O custo cresce linearmente, a qualidade se deteriora e o fenômeno de “perda no meio” faz o modelo esquecer conteúdos enterrados em prompts longos. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.
Quanto tempo leva a aula “Por que contextos longos não escalam”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Memória de curto prazo na janela de contexto
- Por que contextos longos não escalam
- Sumarização como compressão
- Armazenamentos simples de memória (chave-valor)