NLP Academy · Pelajaran

Kekerapan Istilah dan Kekerapan Dokumen Songsang

Dua bahagian skor

Pelajaran 2 daripada 413 langkah

Kekerapan Istilah dan Kekerapan Dokumen Songsang ialah pelajaran NLP Academy percuma di CoddyKit. Ini ialah pelajaran 2 daripada 4. Sebanyak 3 pelajaran dalam laluan pembelajaran ini boleh dibaca sepenuhnya secara percuma — selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan praktikal dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran NLP Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus NLP Academy merangkumi sejumlah 4 pelajaran.

Dua Bahagian bagi Satu Skor

TF-IDF dibina daripada dua bahagian yang didarabkan bersama: kekerapan istilah dan kekerapan dokumen songsang. Setiap bahagian membaiki kelemahan kiraan mentah yang berbeza.

Kekerapan Istilah dengan Ringkas

Kekerapan istilah mengukur kekerapan sesuatu perkataan muncul dalam satu dokumen. Lebih banyak sebutan bagi sesuatu perkataan menunjukkan bahawa dokumen itu cenderung kepada topik tersebut.

Menormalkan TF

Kita sering membahagikan kiraan sesuatu perkataan dengan panjang dokumen. Penormalan ini menghalang dokumen yang panjang daripada kelihatan penting hanya kerana mempunyai lebih banyak perkataan.

count = 3
doc_length = 50
tf = count / doc_length
print(round(tf, 3))

TF Sahaja Tidak Mencukupi

Dengan sendirinya, kekerapan istilah masih memberikan ganjaran kepada perkataan pengisi yang kerap muncul. Kita memerlukan faktor kedua untuk menghukum perkataan yang muncul di mana-mana.

Kekerapan Dokumen

Kekerapan dokumen mengira bilangan dokumen yang mengandungi sesuatu perkataan. Kekerapan dokumen yang tinggi bermakna perkataan itu biasa ditemui dalam keseluruhan koleksi anda.

Terbalikkannya: Songsang

Kita mahu perkataan yang jarang muncul mendapat skor tinggi, jadi kita menyongsangkan kiraan tersebut. Kekerapan dokumen songsang meningkat apabila sesuatu perkataan muncul dalam beberapa dokumen sahaja dan menurun apabila perkataan itu muncul di mana-mana.

Log Menjinakkannya

IDF menggunakan logaritma supaya nilainya tidak melambung bagi perkataan yang sangat jarang. log mengekalkan skala yang lancar dan boleh dibandingkan antara istilah.

import math
total_docs = 1000
docs_with_word = 10
idf = math.log(total_docs / docs_with_word)
print(round(idf, 3))

Darabkan Bersama

Skor akhir hanyalah TF didarabkan dengan IDF. Sesuatu perkataan hanya mendapat skor tinggi jika kerap muncul di sini dan jarang muncul di tempat lain, iaitu gabungan yang kita kehendaki.

tf = 0.06
idf = 4.6
tfidf = tf * idf
print(round(tfidf, 3))

Perkara yang Mendapat Skor Tinggi

Perkataan topik seperti neuroscience dalam satu artikel mendapat skor tinggi. Perkataan seperti the mendapat skor yang sangat rendah kerana IDF-nya hampir sifar.

Perkara yang Mendapat Skor Rendah

Perkataan yang muncul dalam hampir setiap dokumen mendapat wajaran yang sangat kecil. TF-IDF secara automatik merendahkan gangguan latar ini tanpa sebarang senarai kata henti manual.

Sebab Ia Berkesan

TF-IDF mengimbangi kepentingan setempat dengan kelangkaan global dalam satu formula yang kemas. Keseimbangan itu menyebabkan pemberat ini kekal menjadi asas carian dan teks selama berdekad-dekad. ⭐

Semakan Pantas

Apakah yang sebenarnya diberi ganjaran oleh bahagian kekerapan dokumen songsang?

Rumusan

TF mengukur kekerapan setempat, IDF memberi ganjaran kepada kelangkaan global, dan hasil darabnya ialah TF-IDF. Bersama-sama, kedua-duanya menyerlahkan perkataan yang benar-benar mentakrifkan sesuatu dokumen. ✅

Percuma untuk bermula

Pelajari Python dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
30
Pelajaran
120

Soalan Lazim

Adakah pelajaran “Kekerapan Istilah dan Kekerapan Dokumen Songsang” percuma?

Ya — sebanyak 3 pelajaran dalam laluan pembelajaran NLP Academy, termasuk “Kekerapan Istilah dan Kekerapan Dokumen Songsang”, boleh dibaca sepenuhnya secara percuma di web ini. Selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan interaktif dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Kursus NLP Academy merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Kekerapan Istilah dan Kekerapan Dokumen Songsang”?

Dua bahagian skor Anda berlatih NLP Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan NLP Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran NLP Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 2 daripada 4.

Berapa lamakah pelajaran “Kekerapan Istilah dan Kekerapan Dokumen Songsang” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran NLP Academy ini?

Ya. Setiap pelajaran NLP Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Masalah dengan Kiraan Mentah
  2. Kekerapan Istilah dan Kekerapan Dokumen Songsang
  3. TF-IDF dengan scikit-learn
  4. Mencari Perkataan Paling Penting
← Kembali ke NLP Academy