NLP Academy · Pelajaran

Melatih dengan Ciri TF-IDF

Latih pengelas dalam scikit-learn

Pelajaran 2 daripada 413 langkah

Melatih dengan Ciri TF-IDF ialah pelajaran NLP Academy percuma di CoddyKit. Ini ialah pelajaran 2 daripada 4. Sebanyak 3 pelajaran dalam laluan pembelajaran ini boleh dibaca sepenuhnya secara percuma — selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan praktikal dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran NLP Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus NLP Academy merangkumi sejumlah 4 pelajaran.

Daripada Teks kepada Nombor Dahulu

Model tidak dapat membaca ayat mentah. Mula-mula, anda menukar dokumen kepada vektor TF-IDF, kemudian melatih regresi logistik menggunakan nombor tersebut. 🔢

Pasang Pemvektor

TfidfVectorizer mempelajari kosa kata dan pemberat daripada teks latihan anda. Satu panggilan menukar senarai rentetan kepada matriks ciri.

from sklearn.feature_extraction.text import TfidfVectorizer
vec = TfidfVectorizer()
X = vec.fit_transform(train_texts)

Label Kekal Berasingan

Ciri X anda datang daripada teks, tetapi label y datang daripada anda. Setiap dokumen memerlukan kelas yang betul, seperti spam atau bukan spam.

Pisahkan Sebelum Melatih

Ketepikan set ujian supaya anda boleh menilainya dengan adil. train_test_split memastikan sebahagian data tidak dilihat sehingga penilaian selesai.

from sklearn.model_selection import train_test_split
X_tr, X_te, y_tr, y_te = train_test_split(X, y)

Fit Bermaksud Belajar

Memanggil fit memberitahu regresi logistik untuk mencari wajaran perkataan yang paling baik memisahkan kelas anda pada data latihan.

from sklearn.linear_model import LogisticRegression
clf = LogisticRegression(max_iter=1000)
clf.fit(X_tr, y_tr)

Naikkan max_iter Jika Muncul Amaran

Teks mempunyai banyak ciri, jadi penyelesai mungkin memerlukan lebih banyak langkah. Menaikkan max_iter menghapuskan amaran penumpuan yang biasa anda lihat.

Buat Ramalan pada Vektor Baharu

Untuk mengelaskan teks baharu, ubah teks itu menggunakan pemvektor yang sama dan telah dipasang, kemudian panggil predict. Jangan sekali-kali memasang semula pemvektor pada data ujian.

preds = clf.predict(X_te)

Ubah, Jangan Pasang, pada Ujian

Teks ujian menggunakan transform, bukannya fit_transform. Memasangnya semula akan membocorkan maklumat ujian dan meningkatkan skor anda secara senyap.

Semak Ketepatan

Panggilan score yang pantas memberikan ketepatan pada set yang diketepikan. Ini ialah isyarat pertama bahawa latihan benar-benar berjaya.

print(clf.score(X_te, y_te))

Langkah yang Sama Kekal Selaras

Latihan dan ramalan mesti berkongsi kosa kata yang sama sepenuhnya. Menggunakan satu pemvektor yang telah dipasang di semua tempat memastikan lajur ciri selaras.

Saluran Paip Membantu Anda

Membungkus pemvektor dan model dalam saluran paip merangkaikan transform dan predict secara automatik, jadi anda tidak akan terlupa satu pun langkah.

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(TfidfVectorizer(), LogisticRegression())

Semakan Pantas

Bagaimanakah anda patut menyediakan teks ujian sebelum membuat ramalan?

Imbas Kembali: Vektorkan Kemudian Pasang

Vektorkan teks dengan TF-IDF, pisahkan, kemudian fit regresi logistik. Gunakan semula pemvektor yang sama untuk data ujian, sebaik-baiknya di dalam saluran paip. ✅

Percuma untuk bermula

Pelajari Python dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
30
Pelajaran
120

Soalan Lazim

Adakah pelajaran “Melatih dengan Ciri TF-IDF” percuma?

Ya — sebanyak 3 pelajaran dalam laluan pembelajaran NLP Academy, termasuk “Melatih dengan Ciri TF-IDF”, boleh dibaca sepenuhnya secara percuma di web ini. Selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan interaktif dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Kursus NLP Academy merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Melatih dengan Ciri TF-IDF”?

Latih pengelas dalam scikit-learn Anda berlatih NLP Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan NLP Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran NLP Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 2 daripada 4.

Berapa lamakah pelajaran “Melatih dengan Ciri TF-IDF” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran NLP Academy ini?

Ya. Setiap pelajaran NLP Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Mengapa Regresi Logistik Menang untuk Teks
  2. Melatih dengan Ciri TF-IDF
  3. Memeriksa Pekali Terkuat
  4. Melaraskan Kekuatan Regularisasi
← Kembali ke NLP Academy