0Pricing
AI Agents · Aula

Carregadores e analisadores de documentos

Utilize carregadores do LlamaHub para mais de 200 tipos de fonte e analisadores que preservem a estrutura (tabelas, títulos).

Carregadores e analisadores de documentos é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

LlamaIndex versus LangChain

LlamaIndex (anteriormente GPT-Index) é o outro grande framework de agentes. Seu foco está em RAG e agentes centrados em documentos.

Pontos fortes: abstrações mais limpas para tipos de índice, melhor análise de PDFs/documentos estruturados e opções avançadas de síntese de respostas.

Install

# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader

Easiest Path: SimpleDirectoryReader

documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])

LlamaHub

LlamaHub é um registro comunitário com mais de 200 carregadores de dados:

# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])

LlamaParse para PDFs

LlamaParse é o analisador de PDFs de referência — lida com tabelas, layouts de várias colunas e matemática:

# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')

Tabelas são difíceis

Analisadores de PDF padrão destroem as tabelas. LlamaParse as extrai como tabelas Markdown apropriadas — algo fundamental para documentos financeiros/científicos.

Web Loaders

from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])

Database Loaders

from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')

Metadados de documentos

Cada Document tem metadados que você pode usar para filtragem e citações:

doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}

Adicionando metadados personalizados

Enriqueça os documentos após o carregamento:

for doc in documents:
    doc.metadata['department'] = 'engineering'
    doc.metadata['last_reviewed'] = '2024-08'

Excluindo metadados do LLM

Alguns metadados servem apenas para filtragem, não para serem vistos pelo LLM:

doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.

Carregamento assíncrono

Muitos carregadores oferecem suporte a operações assíncronas para lotes grandes:

docs = await reader.aload_data(['url1', 'url2', 'url3'])

Ponto forte do LlamaParse

Pelo que LlamaParse é conhecido?

Recapitulação

SimpleDirectoryReader para começar rapidamente, LlamaHub para fontes de software como serviço e LlamaParse para PDFs complexos. Document.metadata é seu grande aliado.

Perguntas Frequentes

A aula “Carregadores e analisadores de documentos” é grátis?

Sim — o texto completo de “Carregadores e analisadores de documentos” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Carregadores e analisadores de documentos”?

Utilize carregadores do LlamaHub para mais de 200 tipos de fonte e analisadores que preservem a estrutura (tabelas, títulos). Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.

Quanto tempo leva a aula “Carregadores e analisadores de documentos”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Carregadores e analisadores de documentos
  2. A hierarquia de índices: vetorial, em árvore, por palavras-chave
  3. Mecanismos de consulta e síntese de respostas
  4. Estratégia de decomposição em subperguntas
← Voltar para AI Agents