0Pricing
AI Agents · Aula

O que o RAG resolve (limite de conhecimento, alucinações)

O RAG recupera contexto relevante no momento da consulta para que o LLM cite fontes reais em vez de inventar fatos.

O que o RAG resolve (limite de conhecimento, alucinações) é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Dois problemas dos LLMs comuns

Mesmo os melhores LLMs têm dois problemas estruturais:

  1. Limite de conhecimento — eles só conhecem o que estava nos dados de treinamento. Pergunte ao GPT-4 sobre um evento de ontem e ele não saberá nada.
  2. Alucinação — quando o modelo não sabe algo, ele inventa informações com confiança.

O que é RAG

Geração aumentada por recuperação (RAG) significa:

  1. Pesquise em uma base de conhecimento por trechos relevantes
  2. Insira esses trechos na instrução
  3. Peça ao LLM que responda usando ONLY esses trechos

O modelo se torna um "leitor" de conhecimento externo, em vez de depender de seus pesos congelados.

Um exemplo concreto

Usuário: "Qual é nossa política de devolução para produtos eletrônicos abertos?"

  1. Pesquise na KB da empresa por "política de devolução produtos eletrônicos" — obtenha 3 parágrafos dos documentos de ajuda
  2. Crie a instrução: "Usando o contexto abaixo, responda: ..."
  3. O modelo produz uma resposta fiel com citações

Por que o RAG supera o ajuste fino

Para conhecimento factual, RAG > ajuste fino porque:

  • Atualize a KB sem treinar novamente
  • Os dados por usuário / por locatário são separados de forma trivial
  • As citações são possíveis (você sabe WHICH trecho produziu a resposta)
  • É mais barato de manter

Por que o RAG reduz alucinações

Se o modelo for instruído a responder ONLY com base no contexto fornecido, e o contexto contiver a verdade, será muito mais provável que ele esteja correto do que se depender da memória.

Não é perfeito — os modelos ainda inventam informações ocasionalmente —, mas isso reduz as alucinações de forma drástica.

As três etapas

Todo sistema RAG tem três etapas:

  1. Ingestão (off-line) — divida os documentos em trechos, gere incorporações e armazene-os
  2. Recuperação (on-line) — gere a incorporação da consulta e encontre os K melhores trechos
  3. Geração (on-line) — o LLM produz uma resposta usando os trechos recuperados

RAG ingênuo vs. RAG avançado

RAG ingênuo (protótipo de 5 linhas):

  • Divisão em trechos de tamanho fixo
  • Recuperação de vetor único
  • Insira os K melhores trechos na instrução

O RAG avançado adiciona reclassificação, reescrita de consultas, HyDE, múltiplos vetores e avaliação — cada recurso aumenta a qualidade, mas também a complexidade.

Quando o RAG ajuda

  • Bases de conhecimento / documentos da empresa
  • Suporte ao cliente com base em um manual de produto
  • Perguntas e respostas factuais de cauda longa
  • Assistentes pessoais baseados nos dados do usuário

Quando o RAG atrapalha

  • Conversas informais simples (nenhum fato é necessário)
  • Tarefas que exigem raciocínio, não fatos
  • Quando o corpus é pequeno o suficiente para caber no contexto de qualquer maneira

O modelo de instrução

Uma instrução RAG típica se parece com isto:

prompt = f'''
Answer the user\'s question using ONLY the context below.
If the answer is not in the context, say 'I do not know'.

Context:
{retrieved_chunks}

Question:
{user_question}

Answer:
'''

Citações

Formate os trechos com identificadores de fonte e peça ao modelo que os cite:

context = '\n'.join(
    f'[doc {i+1}] {chunk.text}'
    for i, chunk in enumerate(chunks)
)
# Then ask: 'Cite the relevant [doc N] for each claim.'

Objetivo do RAG

O que o RAG aborda principalmente?

Recapitulação

O RAG transforma os LLMs em alunos que fazem provas com consulta. A seguir: como dividir documentos em trechos para recuperação.

Perguntas Frequentes

A aula “O que o RAG resolve (limite de conhecimento, alucinações)” é grátis?

Sim — o texto completo de “O que o RAG resolve (limite de conhecimento, alucinações)” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “O que o RAG resolve (limite de conhecimento, alucinações)”?

O RAG recupera contexto relevante no momento da consulta para que o LLM cite fontes reais em vez de inventar fatos. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.

Quanto tempo leva a aula “O que o RAG resolve (limite de conhecimento, alucinações)”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. O que o RAG resolve (limite de conhecimento, alucinações)
  2. Estratégias de divisão em partes (fixa, por frase, semântica)
  3. Indexando um conjunto de documentos
  4. Construindo um RAG ingênuo com FAISS ou Chroma
← Voltar para AI Agents