Elasticsearch dan Sistem Carian Teks Penuh · Pelajaran

Penganalisis, Penoken dan Penapis

Dalami komponen analisis teks: penapis aksara, penoken dan penapis token, serta fahami peranan setiap satunya.

Pelajaran 1 daripada 411 langkah

Penganalisis, Penoken dan Penapis ialah pelajaran Elasticsearch dan Sistem Carian Teks Penuh percuma di CoddyKit. Ini ialah pelajaran 1 daripada 4. Sebanyak 3 pelajaran dalam laluan pembelajaran ini boleh dibaca sepenuhnya secara percuma — selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan praktikal dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Elasticsearch dan Sistem Carian Teks Penuh, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Elasticsearch dan Sistem Carian Teks Penuh merangkumi sejumlah 4 pelajaran.

Membuka Potensi Carian dengan Analisis Teks

Apabila anda membuat carian, anda menjangkakan hasil yang relevan, walaupun terdapat kesilapan taip atau bentuk perkataan yang berbeza. Keajaiban ini berlaku melalui analisis teks!

Analisis teks ialah cara Elasticsearch memproses teks mentah menjadi format yang sesuai untuk carian. Analisis ini memecahkan dan mengubah kandungan anda supaya lebih mudah dicari serta meningkatkan kerelevanan.

Penganalisis: Pemproses Teks Anda

Teras analisis teks ialah penganalisis. Anggaplah penganalisis sebagai pipeline lengkap, iaitu satu siri langkah yang mengambil teks mentah dan menyediakannya untuk pengindeksan serta carian.

Setiap penganalisis terdiri daripada sehingga tiga komponen utama:

  • Penapis Aksara: Membersihkan teks mentah.
  • Pemecah Token: Memecahkan teks kepada 'token' individu (perkataan).
  • Penapis Token: Memperhalus dan mengubah token tersebut.

Penapis Aksara: Membersihkan Teks

Penapis aksara ialah langkah pertama dalam saluran pemprosesan analisis. Penapis ini berfungsi pada rentetan teks mentah sebelum teks itu dipecahkan kepada token.

Tugasnya adalah untuk membersihkan atau mengubah teks. Kegunaan lazimnya termasuk:

  • Mengalih keluar tag HTML (contohnya, <b>hello</b> menjadi hello).
  • Menggantikan aksara (contohnya, & kepada and).
  • Memetakan aksara tertentu kepada aksara lain.

Demo Penapis Aksara: Menanggalkan HTML

Mari gunakan API _analyze untuk melihat penapis aksara html_strip mengalih keluar tag HTML. Perhatikan bahawa teks itu masih merupakan satu rentetan tunggal pada peringkat ini.

POST _analyze
{
  "char_filter": ["html_strip"],
  "text": "<b>Hello</b> <i>world</i>!"
}

Pemecah Token: Memecahkan kepada Perkataan

Selepas penapis aksara, pemecah token mengambil alih. Peranan utamanya adalah untuk memecahkan teks yang telah dibersihkan kepada 'token' atau perkataan individu. Token ini kemudiannya akan diindeks dan dicari.

Terdapat pelbagai pemecah token untuk keperluan yang berbeza:

  • Pemecah Token Standard: Lalai, sesuai untuk kebanyakan bahasa dan mengendalikan tanda baca.
  • Pemecah Token Ruang Putih: Memecahkan teks hanya berdasarkan ruang putih.
  • Pemecah Token Kata Kunci: Menganggap keseluruhan input sebagai satu token yang tidak boleh diubah (berguna untuk ID atau kod tertentu).

Demo Pemecah Token: Pemecah Token Standard

Pemecah token standard digunakan secara meluas. Pemecah ini memecahkan teks dengan bijak, mengalih keluar kebanyakan tanda baca dan menukarkan perkataan kepada huruf kecil secara lalai (walaupun penukaran kepada huruf kecil secara teknikalnya ialah penapis token yang sering digunakan bersamanya).

POST _analyze
{
  "tokenizer": "standard",
  "text": "Quick brown fox!"
}

Penapis Token: Memperhalus Token

Langkah terakhir ialah penapis token. Penapis ini mengambil token yang dihasilkan oleh pemecah token lalu mengubahnya. Penapis ini boleh menambah, mengalih keluar atau mengubah token, sekali gus memberi kesan besar terhadap kerelevanan carian.

Contoh penapis token:

  • Penapis Huruf Kecil: Menukarkan semua token kepada huruf kecil.
  • Penapis Kata Henti: Mengalih keluar perkataan lazim yang kurang bermakna (contohnya, 'the', 'is', 'a').
  • Penapis Sinonim: Menggantikan perkataan dengan sinonimnya.
  • Penapis Kata Dasar: Mengurangkan perkataan kepada bentuk akarnya (contohnya, 'running' kepada 'run').

Demo Penapis Token: Huruf Kecil & Henti

Mari lihat cara penapis lowercase dan stop berfungsi. Mula-mula kita akan menggunakan pemecah token standard, kemudian menggunakan penapis ini.

POST _analyze
{
  "tokenizer": "standard",
  "filter": ["lowercase", "stop"],
  "text": "The Quick brown fox is fast."
}

Saluran Pemprosesan Analisis Lengkap

Beginilah semua komponen berfungsi bersama mengikut urutan:

  • Teks Mentah memasuki penganalisis.
  • Teks itu melalui Penapis Aksara (pembersihan).
  • Output dihantar kepada Pemecah Token (pemecahan kepada token).
  • Akhir sekali, token diproses oleh Penapis Token (pemurnian).
  • Hasilnya ialah sekumpulan Istilah yang Boleh Dicari.

Saluran pemprosesan ini memastikan pemprosesan teks yang konsisten dan berkesan untuk data carian anda.

Semak Pemahaman Anda

Pertimbangkan teks ini: <p>Learn Elasticsearch</p>

Jika anda mahu mengalih keluar tag HTML <p> dan <b> sebelum teks itu dipecahkan kepada perkataan, komponen manakah dalam saluran pemprosesan penganalisis yang akan anda gunakan?

Imbas Kembali: Komponen Analisis

Syabas! Anda telah berjaya meneroka blok binaan analisis teks Elasticsearch:

  • Penganalisis: Saluran pemprosesan teks yang lengkap.
  • Penapis Aksara: Memproses teks mentah terlebih dahulu (contohnya, mengalih keluar HTML dan menggantikan aksara).
  • Pemecah Token: Memecahkan teks kepada token individu (perkataan).
  • Penapis Token: Memperhalus dan mengubah token (contohnya, menukarkannya kepada huruf kecil, mengalih keluar kata henti dan mendapatkan kata dasar).

Memahami komponen ini amat penting untuk membina pengalaman carian yang berkuasa dan relevan!

Percuma untuk bermula

Pelajari Elasticsearch dan Sistem Carian Teks Penuh dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
12
Pelajaran
48

Soalan Lazim

Adakah pelajaran “Penganalisis, Penoken dan Penapis” percuma?

Ya — sebanyak 3 pelajaran dalam laluan pembelajaran Elasticsearch dan Sistem Carian Teks Penuh, termasuk “Penganalisis, Penoken dan Penapis”, boleh dibaca sepenuhnya secara percuma di web ini. Selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan interaktif dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Kursus Elasticsearch dan Sistem Carian Teks Penuh merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Penganalisis, Penoken dan Penapis”?

Dalami komponen analisis teks: penapis aksara, penoken dan penapis token, serta fahami peranan setiap satunya. Anda berlatih Elasticsearch dan Sistem Carian Teks Penuh menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Elasticsearch dan Sistem Carian Teks Penuh?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Elasticsearch dan Sistem Carian Teks Penuh di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 1 daripada 4.

Berapa lamakah pelajaran “Penganalisis, Penoken dan Penapis” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Elasticsearch dan Sistem Carian Teks Penuh ini?

Ya. Setiap pelajaran Elasticsearch dan Sistem Carian Teks Penuh menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Penganalisis, Penoken dan Penapis
  2. Penyesuaian Penganalisis Teks
  3. Peningkatan dan Pemarkahan Relevan
  4. Sinonim dan Pemangkasan Kata
← Kembali ke Elasticsearch dan Sistem Carian Teks Penuh