Membagi Teks untuk Embedding yang Lebih Baik
Pelajari cara membagi dokumen menjadi potongan yang menghasilkan embedding dengan baik, alasan ukuran dan tumpang tindih potongan penting, serta strategi untuk memaksimalkan kualitas pengambilan.
Membagi Teks untuk Embedding yang Lebih Baik adalah pelajaran Vector Databases: Pinecone, Weaviate & pgvector gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Vector Databases: Pinecone, Weaviate & pgvector, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Vector Databases: Pinecone, Weaviate & pgvector mencakup 4 pelajaran total.
Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.
Why Chunking Matters
Embedding models have a token limit and produce one vector per input. Feeding a whole document yields a vague, averaged vector. Chunking splits text into focused pieces so each vector captures a specific idea.
The Goldilocks Problem
Chunk size is a balance:
- Too large — diluted meaning, mixed topics in one vector
- Too small — fragments lose context, more vectors to store
Aim for chunks that hold one coherent thought.
Fixed-Size Chunking
The simplest method: split every N characters or tokens.
def chunk(text, size):
return [text[i:i+size] for i in range(0, len(text), size)]
print(chunk('abcdefghij', 4))The Overlap Trick
Fixed splits can cut a sentence in half, losing context at the boundary. Adding overlap repeats the last few tokens of one chunk at the start of the next so ideas spanning a boundary survive.
def chunk_overlap(text, size, overlap):
out = []
i = 0
while i < len(text):
out.append(text[i:i+size])
i += size - overlap
return out
print(chunk_overlap('abcdefghij', 4, 1))Sentence-Aware Chunking
Better than blind character splits: break on sentence boundaries, then group sentences up to a target size. Chunks end cleanly and read coherently.
Recursive Chunking
Recursive splitting tries large separators first (paragraphs), then smaller ones (sentences, then words) until chunks fit the size limit. It respects document structure while guaranteeing size.
Structure-Aware Chunking
For Markdown, code, or HTML, split along structural elements:
- Markdown headers and sections
- Code functions or classes
- HTML sections and lists
This keeps related content together.
Token Counting
Models limit by tokens, not characters. Estimate tokens before embedding so chunks fit the model window.
def approx_tokens(text):
return max(1, len(text) // 4)
print(approx_tokens('The quick brown fox jumps'))Matching Chunks to Queries
Think about how users query. If questions target short facts, smaller chunks improve precision. If questions need broad context, larger chunks help. Sometimes you store both granularities.
Adding Context to Chunks
A chunk taken out of context can be ambiguous. Prepend a short header (document title, section name) to each chunk before embedding so the vector knows where it came from.
Iterate and Measure
There is no universal best chunk size. Pick a starting point (often a few hundred tokens with modest overlap), then measure retrieval quality and adjust. Chunking is an experiment, not a fixed rule.
Quick Check
Test your understanding of chunk overlap.
Recap
You learned that chunking turns documents into focused, embeddable pieces. Balance chunk size, add overlap to preserve boundary context, prefer sentence-aware or recursive splitting, count tokens, enrich chunks with context headers, and iterate while measuring retrieval quality.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Membagi Teks untuk Embedding yang Lebih Baik” gratis?
Ya — teks lengkap “Membagi Teks untuk Embedding yang Lebih Baik” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Vector Databases: Pinecone, Weaviate & pgvector, upgrade ke CoddyKit PRO. Kursus Vector Databases: Pinecone, Weaviate & pgvector mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Membagi Teks untuk Embedding yang Lebih Baik”?
Pelajari cara membagi dokumen menjadi potongan yang menghasilkan embedding dengan baik, alasan ukuran dan tumpang tindih potongan penting, serta strategi untuk memaksimalkan kualitas pengambilan. Kamu berlatih Vector Databases: Pinecone, Weaviate & pgvector dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai Vector Databases: Pinecone, Weaviate & pgvector?
Tidak diperlukan pengalaman sebelumnya. Vector Databases: Pinecone, Weaviate & pgvector di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.
Berapa lama pelajaran “Membagi Teks untuk Embedding yang Lebih Baik” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran Vector Databases: Pinecone, Weaviate & pgvector ini?
Ya. Setiap pelajaran Vector Databases: Pinecone, Weaviate & pgvector menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Model Penyematan Teks
- Menggunakan API Penyematan
- Menyimpan dan Memperbarui Penyematan
- Membagi Teks untuk Embedding yang Lebih Baik