Frekuensi Istilah dan Frekuensi Dokumen Terbalik
Dua bagian penyusun skor
Frekuensi Istilah dan Frekuensi Dokumen Terbalik adalah pelajaran NLP Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar NLP Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus NLP Academy mencakup 4 pelajaran total.
Dua Bagian dari Satu Skor
TF-IDF dibangun dari dua bagian yang dikalikan: frekuensi istilah dan frekuensi dokumen terbalik. Setiap bagian mengatasi kelemahan yang berbeda dari hitungan mentah.
Frekuensi Istilah secara Sederhana
Frekuensi istilah mengukur seberapa sering sebuah kata muncul dalam satu dokumen. Semakin banyak penyebutan suatu kata, semakin besar kemungkinan dokumen tersebut berkaitan dengan topik itu.
Menormalkan TF
Kita sering membagi jumlah kemunculan kata dengan panjang dokumen. Normalisasi ini mencegah dokumen panjang terlihat penting hanya karena memiliki lebih banyak kata.
count = 3
doc_length = 50
tf = count / doc_length
print(round(tf, 3))TF Saja Tidak Cukup
Jika berdiri sendiri, frekuensi istilah masih memberi bobot pada kata pengisi yang sering muncul. Kita memerlukan faktor kedua untuk mengurangi bobot kata yang muncul di mana-mana.
Frekuensi Dokumen
Frekuensi dokumen menghitung jumlah dokumen yang memuat sebuah kata. Frekuensi dokumen yang tinggi berarti kata tersebut umum di seluruh koleksi Anda.
Balikkan: Invers
Kita ingin kata yang jarang muncul memperoleh skor tinggi, jadi hitungan tersebut kita balik. Frekuensi dokumen terbalik meningkat ketika sebuah kata muncul dalam sedikit dokumen dan menurun ketika kata itu ada di mana-mana.
Log Menjinakkannya
IDF menggunakan logaritma agar nilainya tidak melonjak untuk kata yang sangat jarang. log menjaga skala tetap halus dan dapat dibandingkan antarterm.
import math
total_docs = 1000
docs_with_word = 10
idf = math.log(total_docs / docs_with_word)
print(round(idf, 3))Kalikan Keduanya
Skor akhir hanyalah TF dikalikan IDF. Sebuah kata hanya unggul jika sering muncul di sini dan jarang muncul di tempat lain, tepat seperti gabungan yang kita inginkan.
tf = 0.06
idf = 4.6
tfidf = tf * idf
print(round(tfidf, 3))Apa yang Mendapat Skor Tinggi
Kata topik seperti neuroscience dalam satu artikel mendapat skor tinggi. Kata seperti the mendapat skor sangat rendah karena IDF-nya hampir nol.
Apa yang Mendapat Skor Rendah
Kata yang muncul di hampir setiap dokumen memperoleh bobot yang sangat kecil. TF-IDF secara otomatis menurunkan bobot derau latar belakang ini tanpa daftar kata henti manual.
Mengapa Cara Ini Sangat Efektif
TF-IDF menyeimbangkan kepentingan lokal dengan kelangkaan global dalam satu rumus sederhana. Keseimbangan inilah yang membuat pembobotan ini tetap menjadi dasar pencarian dan teks selama puluhan tahun. ⭐
Pemeriksaan Singkat
Apa yang sebenarnya diberi bobot oleh bagian frekuensi dokumen terbalik?
Rangkuman
TF mengukur frekuensi lokal, IDF memberi bobot pada kelangkaan global, dan hasil kalinya adalah TF-IDF. Bersama-sama, keduanya menyoroti kata yang benar-benar mendefinisikan suatu dokumen. ✅
Belajar Python dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Frekuensi Istilah dan Frekuensi Dokumen Terbalik” gratis?
Ya — teks lengkap “Frekuensi Istilah dan Frekuensi Dokumen Terbalik” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus NLP Academy, upgrade ke CoddyKit PRO. Kursus NLP Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Frekuensi Istilah dan Frekuensi Dokumen Terbalik”?
Dua bagian penyusun skor Kamu berlatih NLP Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai NLP Academy?
Tidak diperlukan pengalaman sebelumnya. NLP Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.
Berapa lama pelajaran “Frekuensi Istilah dan Frekuensi Dokumen Terbalik” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran NLP Academy ini?
Ya. Setiap pelajaran NLP Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Masalah pada Hitungan Mentah
- Frekuensi Istilah dan Frekuensi Dokumen Terbalik
- TF-IDF dengan scikit-learn
- Menemukan Kata yang Paling Penting