Geração aumentada por recuperação (RAG)
Entenda a arquitetura RAG e como combinar sistemas de recuperação com LLMs para gerar respostas fundamentadas.
Geração aumentada por recuperação (RAG) é uma aula grátis de AI Prompt Engineering no CoddyKit. Esta é a aula 2 de 3. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Prompt Engineering, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Prompt Engineering inclui 3 aulas no total.
O que é RAG?
Boas-vindas à Geração Aumentada por Recuperação (RAG)! Esta lição apresenta uma técnica poderosa para tornar os modelos de linguagem de grande porte (LLM) mais precisos e confiáveis.
RAG combina o vasto conhecimento dos modelos LLM com informações externas e atualizadas. É como dar a um LLM um livro aberto durante uma prova difícil!
Por que precisamos de RAG?
Os modelos LLM básicos, embora impressionantes, têm algumas limitações:
- Alucinações: Às vezes, eles podem gerar informações factualmente incorretas ou sem sentido.
- Conhecimento desatualizado: Seu conhecimento é limitado à data de corte dos dados de treinamento.
- Falta de especificidade: Eles talvez não conheçam fatos específicos de nichos ou de domínios privados.
- Ausência de citações: Eles não conseguem informar facilmente de onde vêm suas informações.
Conceito central do RAG
RAG resolve essas limitações ao integrar um sistema de recuperação com um LLM gerador.
Antes de o LLM gerar uma resposta, o RAG primeiro recupera informações relevantes de uma base de conhecimento externa confiável. Em seguida, essas informações recuperadas "ampliam" (aprimoram) a instrução fornecida ao LLM.
Etapa 1 do RAG: recuperação de informações
A primeira etapa do RAG é a recuperação. Quando um usuário faz uma pergunta, um componente dedicado de recuperação entra em ação.
- Ele analisa a consulta do usuário.
- Pesquisa uma grande base de conhecimento externa (por exemplo, documentos, bancos de dados, páginas da Web).
- Identifica e busca as informações ou os "documentos" mais relevantes relacionados à consulta.
Etapa 2 do RAG: ampliação da instrução
Depois que as informações relevantes são recuperadas, a próxima etapa é a ampliação.
- Os trechos de texto recuperados são inseridos diretamente na instrução original do usuário.
- Isso cria uma "instrução ampliada" que agora contém tanto a solicitação do usuário quanto o contexto factual.
- Essa instrução enriquecida fornece ao LLM os dados específicos necessários para formular uma resposta precisa.
Etapa 3 do RAG: geração aprimorada
Por fim, ocorre a etapa de geração. O modelo de linguagem de grande porte recebe a instrução ampliada.
- Com o contexto relevante explicitamente fornecido, o LLM gera sua resposta.
- Ele é instruído a basear sua resposta principalmente nas informações fornecidas, em vez de depender somente de seu conhecimento pré-treinado.
- Isso resulta em respostas mais fundamentadas, factuais e verificáveis.
Benefícios do uso do RAG
A implementação do RAG oferece várias vantagens significativas:
- Redução de alucinações: As respostas do LLM são fundamentadas em fatos da base de conhecimento.
- Informações atualizadas: Acesso a dados atuais além da data de corte do treinamento do LLM.
- Especificidade de domínio: Integração fácil de dados organizacionais privados ou especializados.
- Explicabilidade: Muitas vezes, o sistema consegue citar as fontes das quais as informações foram recuperadas.
RAG em ação: um fluxo simples
Vamos visualizar uma interação simples com RAG:
- Consulta do usuário: "Quando a Torre Eiffel foi concluída?"
- Recuperação: O sistema pesquisa um banco de dados de fatos históricos e encontra "A Torre Eiffel foi concluída em 31 de março de 1889."
- Ampliação: A instrução se torna: "Com base nas informações a seguir: 'A Torre Eiffel foi concluída em 31 de março de 1889.', quando ela foi concluída?"
- Geração: O LLM responde: "A Torre Eiffel foi concluída em 31 de março de 1889."
Principais componentes do sistema RAG
Em seu cerne, um sistema RAG consiste em dois componentes lógicos principais:
- O recuperador: Este componente é responsável por pesquisar e buscar os documentos ou fragmentos de dados mais relevantes de uma base de conhecimento externa com base na consulta do usuário.
- O gerador: Este é o próprio modelo de linguagem de grande porte (LLM), que combina a consulta original do usuário com o contexto recuperado para produzir uma resposta coerente e esclarecedora.
Verificação do conceito de RAG
Quais das opções a seguir são benefícios importantes do uso da Geração Aumentada por Recuperação (RAG) para modelos LLM?
Recapitulação do RAG e próximos passos
Agora você aprendeu o conceito central e a arquitetura da Geração Aumentada por Recuperação (RAG). RAG é uma técnica essencial para criar aplicações baseadas em LLM mais confiáveis, factuais e sensíveis ao contexto.
Ao combinar recuperação e geração, RAG permite que os modelos LLM interajam com dados externos dinâmicos e forneçam respostas baseadas neles. Em seguida, exploraremos como os bancos de dados vetoriais desempenham um papel fundamental na recuperação eficiente para sistemas RAG!
Perguntas Frequentes
A aula “Geração aumentada por recuperação (RAG)” é grátis?
Sim — o texto completo de “Geração aumentada por recuperação (RAG)” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Prompt Engineering, atualize para CoddyKit PRO. O curso de AI Prompt Engineering inclui 3 aulas no total.
O que vou aprender em “Geração aumentada por recuperação (RAG)”?
Entenda a arquitetura RAG e como combinar sistemas de recuperação com LLMs para gerar respostas fundamentadas. Você pratica AI Prompt Engineering com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Prompt Engineering?
Nenhuma experiência prévia é necessária. AI Prompt Engineering no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 3.
Quanto tempo leva a aula “Geração aumentada por recuperação (RAG)”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Prompt Engineering?
Sim. Cada aula de AI Prompt Engineering inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Prompting com dados externos
- Geração aumentada por recuperação (RAG)
- Bancos de dados vetoriais para prompting