O que o RAG resolve (limite de conhecimento, alucinações)
O RAG recupera contexto relevante no momento da consulta para que o LLM cite fontes reais em vez de inventar fatos.
O que o RAG resolve (limite de conhecimento, alucinações) é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Dois problemas dos LLMs comuns
Mesmo os melhores LLMs têm dois problemas estruturais:
- Limite de conhecimento — eles só conhecem o que estava nos dados de treinamento. Pergunte ao GPT-4 sobre um evento de ontem e ele não saberá nada.
- Alucinação — quando o modelo não sabe algo, ele inventa informações com confiança.
O que é RAG
Geração aumentada por recuperação (RAG) significa:
- Pesquise em uma base de conhecimento por trechos relevantes
- Insira esses trechos na instrução
- Peça ao LLM que responda usando ONLY esses trechos
O modelo se torna um "leitor" de conhecimento externo, em vez de depender de seus pesos congelados.
Um exemplo concreto
Usuário: "Qual é nossa política de devolução para produtos eletrônicos abertos?"
- Pesquise na KB da empresa por "política de devolução produtos eletrônicos" — obtenha 3 parágrafos dos documentos de ajuda
- Crie a instrução: "Usando o contexto abaixo, responda: ..."
- O modelo produz uma resposta fiel com citações
Por que o RAG supera o ajuste fino
Para conhecimento factual, RAG > ajuste fino porque:
- Atualize a KB sem treinar novamente
- Os dados por usuário / por locatário são separados de forma trivial
- As citações são possíveis (você sabe WHICH trecho produziu a resposta)
- É mais barato de manter
Por que o RAG reduz alucinações
Se o modelo for instruído a responder ONLY com base no contexto fornecido, e o contexto contiver a verdade, será muito mais provável que ele esteja correto do que se depender da memória.
Não é perfeito — os modelos ainda inventam informações ocasionalmente —, mas isso reduz as alucinações de forma drástica.
As três etapas
Todo sistema RAG tem três etapas:
- Ingestão (off-line) — divida os documentos em trechos, gere incorporações e armazene-os
- Recuperação (on-line) — gere a incorporação da consulta e encontre os K melhores trechos
- Geração (on-line) — o LLM produz uma resposta usando os trechos recuperados
RAG ingênuo vs. RAG avançado
RAG ingênuo (protótipo de 5 linhas):
- Divisão em trechos de tamanho fixo
- Recuperação de vetor único
- Insira os K melhores trechos na instrução
O RAG avançado adiciona reclassificação, reescrita de consultas, HyDE, múltiplos vetores e avaliação — cada recurso aumenta a qualidade, mas também a complexidade.
Quando o RAG ajuda
- Bases de conhecimento / documentos da empresa
- Suporte ao cliente com base em um manual de produto
- Perguntas e respostas factuais de cauda longa
- Assistentes pessoais baseados nos dados do usuário
Quando o RAG atrapalha
- Conversas informais simples (nenhum fato é necessário)
- Tarefas que exigem raciocínio, não fatos
- Quando o corpus é pequeno o suficiente para caber no contexto de qualquer maneira
O modelo de instrução
Uma instrução RAG típica se parece com isto:
prompt = f'''
Answer the user\'s question using ONLY the context below.
If the answer is not in the context, say 'I do not know'.
Context:
{retrieved_chunks}
Question:
{user_question}
Answer:
'''Citações
Formate os trechos com identificadores de fonte e peça ao modelo que os cite:
context = '\n'.join(
f'[doc {i+1}] {chunk.text}'
for i, chunk in enumerate(chunks)
)
# Then ask: 'Cite the relevant [doc N] for each claim.'Objetivo do RAG
O que o RAG aborda principalmente?
Recapitulação
O RAG transforma os LLMs em alunos que fazem provas com consulta. A seguir: como dividir documentos em trechos para recuperação.
Perguntas Frequentes
A aula “O que o RAG resolve (limite de conhecimento, alucinações)” é grátis?
Sim — o texto completo de “O que o RAG resolve (limite de conhecimento, alucinações)” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “O que o RAG resolve (limite de conhecimento, alucinações)”?
O RAG recupera contexto relevante no momento da consulta para que o LLM cite fontes reais em vez de inventar fatos. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.
Quanto tempo leva a aula “O que o RAG resolve (limite de conhecimento, alucinações)”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- O que o RAG resolve (limite de conhecimento, alucinações)
- Estratégias de divisão em partes (fixa, por frase, semântica)
- Indexando um conjunto de documentos
- Construindo um RAG ingênuo com FAISS ou Chroma