Belge Yükleyicileri ve Ayrıştırıcılar
200'den fazla kaynak türü için LlamaHub yükleyicilerini ve yapıyı (tablolar, başlıklar) koruyan ayrıştırıcıları kullanın.
Belge Yükleyicileri ve Ayrıştırıcılar, CoddyKit'te ücretsiz bir AI Agents dersidir. Bu, 4 dersinin 1. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Agents öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Agents kursu toplamda 4 dersten oluşur.
Bu dersin bazı bölümleri henüz çevrilmemiş olup İngilizce olarak gösterilmektedir.
LlamaIndex ve LangChain Karşılaştırması
LlamaIndex (eski adıyla GPT-Dizini), diğer büyük aracı çatısıdır. RAG ve belge merkezli aracılara odaklanır.
Güçlü yönleri: dizin türleri için daha temiz soyutlamalar, daha iyi PDF ve yapılandırılmış belge ayrıştırma ve derinlemesine yanıt sentezi seçenekleri.
Install
# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReaderEasiest Path: SimpleDirectoryReader
documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])LlamaHub
LlamaHub, 200'den fazla veri yükleyicisinin bulunduğu bir topluluk kayıt merkezidir:
# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])PDF'ler için LlamaParse
LlamaParse, tabloları, çok sütunlu düzenleri ve matematiği işleyebilen altın standart PDF ayrıştırıcısıdır:
# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')Tablolar Zordur
Standart PDF ayrıştırıcıları tabloları bozar. LlamaParse bunları düzgün Markdown tabloları olarak çıkarır — finansal ve bilimsel belgeler için kritik öneme sahiptir.
Web Loaders
from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])Database Loaders
from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')Belge Üst Verileri
Her Document, filtreleme ve alıntılar için kullanabileceğiniz üst verilere sahiptir:
doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}Özel Üst Veri Ekleme
Belgeleri yükleme sonrasında zenginleştirin:
for doc in documents:
doc.metadata['department'] = 'engineering'
doc.metadata['last_reviewed'] = '2024-08'Üst Verileri LLM'den Hariç Tutma
Bazı üst veriler yalnızca filtreleme içindir; LLM'nin bunları görmesi gerekmez:
doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.Eşzamansız Yükleme
Birçok yükleyici, büyük toplu işlemler için eşzamansız çalışmayı destekler:
docs = await reader.aload_data(['url1', 'url2', 'url3'])LlamaParse'in Gücü
LlamaParse neyle tanınır?
Özet
Hızlı başlangıçlar için SimpleDirectoryReader, SaaS kaynakları için LlamaHub, kapsamlı PDF'ler için LlamaParse kullanın. Document.metadata dostunuzdur.
Sıkça Sorulan Sorular
“Belge Yükleyicileri ve Ayrıştırıcılar” dersi ücretsiz mi?
Evet — “Belge Yükleyicileri ve Ayrıştırıcılar” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Agents kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Agents kursu toplamda 4 dersten oluşur.
“Belge Yükleyicileri ve Ayrıştırıcılar” dersinde ne öğreneceğim?
200'den fazla kaynak türü için LlamaHub yükleyicilerini ve yapıyı (tablolar, başlıklar) koruyan ayrıştırıcıları kullanın. AI Agents ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
AI Agents öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te AI Agents, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 1. dersidir.
“Belge Yükleyicileri ve Ayrıştırıcılar” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu AI Agents dersinde kod yazıp çalıştırabilir miyim?
Evet. Her AI Agents dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Belge Yükleyicileri ve Ayrıştırıcılar
- Dizin Hiyerarşisi: Vektör, Ağaç, Anahtar Sözcük
- Sorgu Motorları ve Yanıt Sentezi
- Alt Soru Ayrıştırma Stratejisi