0Pricing
NLP Academy · درس

تقسيم المستندات وتضمينها

جهّز قاعدة معرفية قابلة للبحث

تقسيم المستندات وتضمينها درس مجاني في NLP Academy على CoddyKit. هذا هو الدرس 2 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في NLP Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة NLP Academy 4 دروس في المجموع.

بعض أجزاء هذا الدرس لم تُترجم بعد وتظهر باللغة الإنجليزية.

Documents Are Too Big to Search Whole

A long PDF holds many topics at once. To retrieve precisely, you first split it into smaller pieces called chunks.

What Makes a Good Chunk

A good chunk is one coherent thought: a paragraph or two. Too big buries the answer; too small loses the surrounding context.

Splitting by Size

The simplest method cuts text every fixed number of characters or tokens. It is quick but can slice a sentence in half.

chunks = [text[i:i+500] for i in range(0, len(text), 500)]

Overlapping Chunks

To avoid cutting an idea apart, let chunks share an overlap. Repeating the last lines keeps context flowing across boundaries.

Splitting on Structure

Smarter splitters break on paragraphs or headings first. Respecting structure keeps each chunk on a single, clean topic.

From Text to Vectors

Search needs numbers, not words. An embedding turns each chunk into a dense vector that captures its meaning.

Meaning Lives in Distance

Embeddings place similar text close together. Two chunks about the same idea sit near each other in vector space.

Calling an Embedding Model

You pass text to an embedding model and get back a list of floats. The same model must encode both chunks and queries.

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")

Encoding Your Chunks

Run every chunk through the model to build its vector. One call can encode the whole list at once for speed.

vectors = model.encode(chunks)

Vector Dimensions

Each vector has a fixed length, its dimension. A small model may give 384 numbers; larger ones give 768 or more.

print(vectors.shape)  # (n_chunks, 384)

Store Chunk and Vector Together

Keep each vector linked to its original text and source. Later you retrieve by vector but show the human-readable chunk.

Quick Check

Consider why we add overlap when splitting documents.

Recap

You split documents into chunks, optionally overlapping, then embed each into a vector. Store text and vector together for retrieval. ✅

الأسئلة الشائعة

هل درس «تقسيم المستندات وتضمينها» مجاني؟

نعم — نص درس «تقسيم المستندات وتضمينها» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة NLP Academy، انتقل إلى CoddyKit PRO. تتضمن دورة NLP Academy 4 دروس في المجموع.

ماذا ستتعلم في «تقسيم المستندات وتضمينها»؟

جهّز قاعدة معرفية قابلة للبحث تتمرن على NLP Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ NLP Academy؟

لا تُشترط خبرة سابقة. NLP Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 2 من أصل 4.

كم من الوقت يستغرق درس «تقسيم المستندات وتضمينها»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس NLP Academy هذا؟

نعم. كل درس في NLP Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. لماذا تحتاج LLMs إلى الاسترجاع
  2. تقسيم المستندات وتضمينها
  3. البحث المتجهي باستخدام مخزن متجهات
  4. دمج الاسترجاع في المطالبة
← العودة إلى NLP Academy