NLP Academy · Pelajaran

Melatih dengan Fitur TF-IDF

Melatih pengklasifikasi dalam scikit-learn

Pelajaran 2 dari 413 langkah

Melatih dengan Fitur TF-IDF adalah pelajaran NLP Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar NLP Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus NLP Academy mencakup 4 pelajaran total.

Dari Teks ke Angka Terlebih Dahulu

Model tidak dapat membaca kalimat mentah. Anda harus mengubah dokumen menjadi vektor TF-IDF terlebih dahulu, lalu melatih regresi logistik pada angka-angka tersebut. 🔢

Latih Pengubah Vektor

TfidfVectorizer mempelajari kosakata dan pembobotan dari teks pelatihan. Satu pemanggilan mengubah daftar string menjadi matriks fitur.

from sklearn.feature_extraction.text import TfidfVectorizer
vec = TfidfVectorizer()
X = vec.fit_transform(train_texts)

Label Tetap Terpisah

Fitur X Anda berasal dari teks, tetapi label y berasal dari Anda. Setiap dokumen memerlukan kelas yang benar, seperti spam atau bukan spam.

Pisahkan Sebelum Melatih

Sisihkan set pengujian agar Anda dapat menilai secara adil. train_test_split menyimpan sebagian data agar tidak terlihat hingga evaluasi benar-benar selesai.

from sklearn.model_selection import train_test_split
X_tr, X_te, y_tr, y_te = train_test_split(X, y)

Fit Berarti Belajar

Memanggil fit memberi tahu regresi logistik untuk menemukan bobot kata yang paling baik memisahkan kelas Anda pada data pelatihan.

from sklearn.linear_model import LogisticRegression
clf = LogisticRegression(max_iter=1000)
clf.fit(X_tr, y_tr)

Naikkan max_iter Jika Muncul Peringatan

Teks memiliki banyak fitur, sehingga pemecah mungkin memerlukan lebih banyak langkah. Menaikkan max_iter mengatasi peringatan konvergensi yang umum muncul.

Prediksi pada Vektor Baru

Untuk mengklasifikasikan teks baru, ubah teks tersebut dengan pengubah vektor yang sama dan telah dilatih, lalu panggil predict. Jangan pernah melatih ulang pengubah vektor pada data pengujian.

preds = clf.predict(X_te)

Lakukan Transformasi, Bukan Pelatihan, pada Data Pengujian

Teks pengujian menggunakan transform, bukan fit_transform. Melatih ulang akan membocorkan informasi pengujian dan diam-diam meningkatkan skor Anda secara tidak semestinya.

Periksa Akurasi

Pemanggilan cepat score memberikan akurasi pada set yang disisihkan. Inilah sinyal pertama bahwa pelatihan benar-benar berhasil.

print(clf.score(X_te, y_te))

Langkah yang Sama Tetap Selaras

Pelatihan dan prediksi harus menggunakan kosakata yang sama persis. Menggunakan satu pengubah vektor yang telah dilatih di semua tempat menjaga kolom fitur tetap selaras.

Pipeline Membantu Anda

Membungkus pengubah vektor dan model dalam pipeline merangkai transformasi dan prediksi secara otomatis, sehingga Anda tidak pernah melupakan satu langkah pun.

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(TfidfVectorizer(), LogisticRegression())

Pemeriksaan Singkat

Bagaimana seharusnya Anda menyiapkan teks pengujian sebelum melakukan prediksi?

Rangkuman: Ubah Menjadi Vektor, lalu Latih

Ubah teks menjadi vektor dengan TF-IDF, pisahkan, lalu lakukan fit pada regresi logistik. Gunakan kembali pengubah vektor yang sama untuk data pengujian, idealnya di dalam pipeline. ✅

Gratis untuk memulai

Belajar Python dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
30
Pelajaran
120

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Melatih dengan Fitur TF-IDF” gratis?

Ya — teks lengkap “Melatih dengan Fitur TF-IDF” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus NLP Academy, upgrade ke CoddyKit PRO. Kursus NLP Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Melatih dengan Fitur TF-IDF”?

Melatih pengklasifikasi dalam scikit-learn Kamu berlatih NLP Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai NLP Academy?

Tidak diperlukan pengalaman sebelumnya. NLP Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Melatih dengan Fitur TF-IDF” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran NLP Academy ini?

Ya. Setiap pelajaran NLP Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Mengapa Regresi Logistik Unggul pada Teks
  2. Melatih dengan Fitur TF-IDF
  3. Memeriksa Koefisien Terkuat
  4. Menyetel Kekuatan Regularisasi
← Kembali ke NLP Academy