Mecanismos de consulta e síntese de respostas
Os mecanismos de consulta coordenam a recuperação e a síntese com estratégias como refine, compact e tree_summarize.
Mecanismos de consulta e síntese de respostas é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
Mecanismo de consulta = Recuperação + Síntese
Um mecanismo de consulta do LlamaIndex tem duas etapas:
- Recuperação — encontrar fragmentos relevantes
- Síntese — gerar uma resposta a partir desses fragmentos
Ambas são configuráveis.
The Default Query Engine
query_engine = index.as_query_engine()
response = query_engine.query('What is our refund policy?')
print(response.response) # the answer
print(response.source_nodes) # the chunks usedModos de resposta
Como o mecanismo monta a resposta final a partir dos fragmentos recuperados:
- refinar — processar os fragmentos um a um, refinando a resposta (mais preciso, mais lento)
- compacto — incluir o maior número possível de fragmentos no contexto a cada chamada (padrão)
- sumarização em árvore — sumarização recursiva
- sumarização simples — uma única chamada com todos os fragmentos
Setting Response Mode
query_engine = index.as_query_engine(response_mode='tree_summarize')Configuring Retrieval
query_engine = index.as_query_engine(
similarity_top_k=5,
response_mode='compact'
)Instruções personalizadas
Insira seus próprios modelos de instruções:
from llama_index.core.prompts import PromptTemplate
qa_template = PromptTemplate(
'Context:\n{context_str}\n\nQuestion: {query_str}\nAnswer:'
)
query_engine.update_prompts({'response_synthesizer:text_qa_template': qa_template})Streaming Responses
query_engine = index.as_query_engine(streaming=True)
response = query_engine.query('Hello')
for token in response.response_gen:
print(token, end='', flush=True)Citações
Use CitationQueryEngine para obter citações geradas pelo LLM:
from llama_index.core.query_engine import CitationQueryEngine
engine = CitationQueryEngine.from_args(index, similarity_top_k=4)
response = engine.query('What is our refund policy?')
print(response.response)
for i, node in enumerate(response.source_nodes):
print(f'[{i+1}] {node.metadata}')Pós-processadores
Reordene ou filtre os nós recuperados antes da síntese:
from llama_index.postprocessor.cohere_rerank import CohereRerank
rerank = CohereRerank(api_key=COHERE_KEY, top_n=3)
query_engine = index.as_query_engine(
similarity_top_k=20, # retrieve 20
node_postprocessors=[rerank] # rerank to top 3
)Metadata Filters
from llama_index.core.vector_stores import MetadataFilters, ExactMatchFilter
filters = MetadataFilters(filters=[
ExactMatchFilter(key='department', value='engineering')
])
query_engine = index.as_query_engine(filters=filters)Async Queries
response = await query_engine.aquery('What is our refund policy?')
print(response.response)Mecanismo de conversa
Para conversas com várias interações e memória:
chat_engine = index.as_chat_engine(chat_mode='context')
response = chat_engine.chat('What is our refund policy?')
followup = chat_engine.chat('And for opened items?')Fluxos e processos de trabalho
Para agentes complexos com várias etapas, os fluxos de trabalho do LlamaIndex oferecem um fluxo orientado a eventos ao estilo Python — semelhante, em essência, ao LangGraph.
Modo de resposta
Qual modo de resposta é mais lento, mas mais preciso?
Recapitulação
Configure o número máximo de resultados, o modo de resposta, os pós-processadores e os filtros de metadados para ajustar seu mecanismo de consulta. Use CitationQueryEngine para obter respostas confiáveis.
Perguntas Frequentes
A aula “Mecanismos de consulta e síntese de respostas” é grátis?
Sim — o texto completo de “Mecanismos de consulta e síntese de respostas” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Mecanismos de consulta e síntese de respostas”?
Os mecanismos de consulta coordenam a recuperação e a síntese com estratégias como refine, compact e tree_summarize. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.
Quanto tempo leva a aula “Mecanismos de consulta e síntese de respostas”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Carregadores e analisadores de documentos
- A hierarquia de índices: vetorial, em árvore, por palavras-chave
- Mecanismos de consulta e síntese de respostas
- Estratégia de decomposição em subperguntas