Elasticsearch dan Sistem Carian Teks Penuh · Pelajaran

Penganalisis, Penoken dan Indeks Terbalik

Pelajari cara Elasticsearch menukar teks kepada token yang boleh dicari menggunakan penganalisis dan menyimpannya dalam indeks terbalik.

Pelajaran 4 daripada 413 langkah

Penganalisis, Penoken dan Indeks Terbalik ialah pelajaran Elasticsearch dan Sistem Carian Teks Penuh percuma di CoddyKit. Ini ialah pelajaran 4 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Elasticsearch dan Sistem Carian Teks Penuh, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Elasticsearch dan Sistem Carian Teks Penuh merangkumi sejumlah 4 pelajaran.

Daripada Teks kepada Token

Sebelum teks boleh dicari, penganalisis memecahkannya kepada token dan menyimpannya dalam indeks terbalik. Itulah langkah pertama bagi setiap carian.

Indeks Terbalik

Indeks terbalik memetakan setiap token kepada dokumen yang mengandunginya — seperti indeks buku — lalu menjadikan carian teks penuh sangat pantas.

Anatomi Penganalisis

Penganalisis menjalankan tiga peringkat mengikut turutan: penapis aksara membersihkan teks mentah, pemecah token membahagikannya kepada token, dan penapis token membentuknya semula.

Penganalisis Standard

Penganalisis standard lalai memisahkan teks pada sempadan perkataan dan menukarkan huruf kepada huruf kecil, jadi Quick Brown Fox! menjadi quick, brown, fox.

Menguji dengan _analyze

API _analyze menunjukkan dengan tepat token yang dihasilkan oleh penganalisis daripada teks anda — jalankannya untuk melihat output.

POST /_analyze
{
  "analyzer": "standard",
  "text": "The Quick Brown Foxes"
}

Pensteman

Penapis pensteman mengurangkan perkataan kepada akarnya, jadi running, runs dan ran semuanya dipetakan kepada run — dan carian untuk satu daripadanya menemui yang lain.

Kata Henti

Penapis henti membuang perkataan yang kurang bernilai seperti the, a dan is, lalu mengecilkan indeks serta meningkatkan kerelevanan.

Penganalisis Tersuai

Takrifkan penganalisis tersuai dalam tetapan indeks dengan menggabungkan pemecah token dengan penapis — kod tersebut menyambungkan huruf kecil, kata henti dan pensteman.

PUT /articles
{
  "settings": { "analysis": { "analyzer": {
    "my_english": {
      "tokenizer": "standard",
      "filter": ["lowercase", "english_stop", "english_stemmer"]
    }}}}
}

text berbanding keyword

Medan text dianalisis untuk carian teks penuh; medan keyword kekal sebagai satu token tepat untuk penapisan, pengisihan dan pengagregatan.

Masa Pengindeksan berbanding Masa Carian

Analisis dijalankan pada masa pengindeksan apabila dokumen disimpan dan sekali lagi pada masa carian terhadap pertanyaan — biasanya menggunakan penganalisis yang sama supaya token sepadan.

Pemetaan Berbilang Medan

Satu helah yang berguna: petakan rentetan sebagai text untuk carian dan tambahkan submedan .keyword untuk padanan tepat serta pengagregatan secara serentak.

"title": { "type": "text",
  "fields": { "raw": { "type": "keyword" } } }

Semakan Ringkas

Mengapakah medan text dan keyword dilayan secara berbeza?

Imbas Kembali

Imbas kembali: penganalisis (penapis, pemecah token, penapis) membina indeks terbalik, pensteman dan kata henti memperkemaskannya, manakala text berbanding keyword menentukan cara medan berfungsi.

Percuma untuk bermula

Pelajari Elasticsearch dan Sistem Carian Teks Penuh dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
12
Pelajaran
48

Soalan Lazim

Adakah pelajaran “Penganalisis, Penoken dan Indeks Terbalik” percuma?

Ya — teks penuh “Penganalisis, Penoken dan Indeks Terbalik” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Elasticsearch dan Sistem Carian Teks Penuh, tingkat taraf kepada CoddyKit PRO. Kursus Elasticsearch dan Sistem Carian Teks Penuh merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Penganalisis, Penoken dan Indeks Terbalik”?

Pelajari cara Elasticsearch menukar teks kepada token yang boleh dicari menggunakan penganalisis dan menyimpannya dalam indeks terbalik. Anda berlatih Elasticsearch dan Sistem Carian Teks Penuh menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Elasticsearch dan Sistem Carian Teks Penuh?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Elasticsearch dan Sistem Carian Teks Penuh di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 4 daripada 4.

Berapa lamakah pelajaran “Penganalisis, Penoken dan Indeks Terbalik” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Elasticsearch dan Sistem Carian Teks Penuh ini?

Ya. Setiap pelajaran Elasticsearch dan Sistem Carian Teks Penuh menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Apakah Carian Teks Penuh?
  2. Konsep Teras Elasticsearch
  3. Menyediakan Kelompok Pertama Anda
  4. Penganalisis, Penoken dan Indeks Terbalik
← Kembali ke Elasticsearch dan Sistem Carian Teks Penuh