0Pricing
AI Agents · Aula

Mecanismos de consulta e síntese de respostas

Os mecanismos de consulta coordenam a recuperação e a síntese com estratégias como refine, compact e tree_summarize.

Mecanismos de consulta e síntese de respostas é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

Mecanismo de consulta = Recuperação + Síntese

Um mecanismo de consulta do LlamaIndex tem duas etapas:

  1. Recuperação — encontrar fragmentos relevantes
  2. Síntese — gerar uma resposta a partir desses fragmentos

Ambas são configuráveis.

The Default Query Engine

query_engine = index.as_query_engine()
response = query_engine.query('What is our refund policy?')
print(response.response)         # the answer
print(response.source_nodes)     # the chunks used

Modos de resposta

Como o mecanismo monta a resposta final a partir dos fragmentos recuperados:

  • refinar — processar os fragmentos um a um, refinando a resposta (mais preciso, mais lento)
  • compacto — incluir o maior número possível de fragmentos no contexto a cada chamada (padrão)
  • sumarização em árvore — sumarização recursiva
  • sumarização simples — uma única chamada com todos os fragmentos

Setting Response Mode

query_engine = index.as_query_engine(response_mode='tree_summarize')

Configuring Retrieval

query_engine = index.as_query_engine(
    similarity_top_k=5,
    response_mode='compact'
)

Instruções personalizadas

Insira seus próprios modelos de instruções:

from llama_index.core.prompts import PromptTemplate

qa_template = PromptTemplate(
    'Context:\n{context_str}\n\nQuestion: {query_str}\nAnswer:'
)
query_engine.update_prompts({'response_synthesizer:text_qa_template': qa_template})

Streaming Responses

query_engine = index.as_query_engine(streaming=True)
response = query_engine.query('Hello')
for token in response.response_gen:
    print(token, end='', flush=True)

Citações

Use CitationQueryEngine para obter citações geradas pelo LLM:

from llama_index.core.query_engine import CitationQueryEngine

engine = CitationQueryEngine.from_args(index, similarity_top_k=4)
response = engine.query('What is our refund policy?')
print(response.response)
for i, node in enumerate(response.source_nodes):
    print(f'[{i+1}] {node.metadata}')

Pós-processadores

Reordene ou filtre os nós recuperados antes da síntese:

from llama_index.postprocessor.cohere_rerank import CohereRerank

rerank = CohereRerank(api_key=COHERE_KEY, top_n=3)
query_engine = index.as_query_engine(
    similarity_top_k=20,           # retrieve 20
    node_postprocessors=[rerank]   # rerank to top 3
)

Metadata Filters

from llama_index.core.vector_stores import MetadataFilters, ExactMatchFilter

filters = MetadataFilters(filters=[
    ExactMatchFilter(key='department', value='engineering')
])
query_engine = index.as_query_engine(filters=filters)

Async Queries

response = await query_engine.aquery('What is our refund policy?')
print(response.response)

Mecanismo de conversa

Para conversas com várias interações e memória:

chat_engine = index.as_chat_engine(chat_mode='context')
response = chat_engine.chat('What is our refund policy?')
followup = chat_engine.chat('And for opened items?')

Fluxos e processos de trabalho

Para agentes complexos com várias etapas, os fluxos de trabalho do LlamaIndex oferecem um fluxo orientado a eventos ao estilo Python — semelhante, em essência, ao LangGraph.

Modo de resposta

Qual modo de resposta é mais lento, mas mais preciso?

Recapitulação

Configure o número máximo de resultados, o modo de resposta, os pós-processadores e os filtros de metadados para ajustar seu mecanismo de consulta. Use CitationQueryEngine para obter respostas confiáveis.

Perguntas Frequentes

A aula “Mecanismos de consulta e síntese de respostas” é grátis?

Sim — o texto completo de “Mecanismos de consulta e síntese de respostas” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Mecanismos de consulta e síntese de respostas”?

Os mecanismos de consulta coordenam a recuperação e a síntese com estratégias como refine, compact e tree_summarize. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.

Quanto tempo leva a aula “Mecanismos de consulta e síntese de respostas”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Carregadores e analisadores de documentos
  2. A hierarquia de índices: vetorial, em árvore, por palavras-chave
  3. Mecanismos de consulta e síntese de respostas
  4. Estratégia de decomposição em subperguntas
← Voltar para AI Agents