NLP Academy · Pelajaran

Dari Hitungan Jarang ke Vektor Padat

Mengapa embedding mengungguli bag-of-words

Pelajaran 1 dari 413 langkah

Dari Hitungan Jarang ke Vektor Padat adalah pelajaran NLP Academy gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar NLP Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus NLP Academy mencakup 4 pelajaran total.

Ringkasan Singkat

Bag-of-words dan TF-IDF mengubah teks menjadi vektor hitungan yang panjang. Keduanya berfungsi, tetapi vektor jarang tersebut menyembunyikan kelemahan nyata yang akan segera Anda lihat.

Sebagian Besar Nol

Vektor bag-of-words memiliki satu slot untuk setiap kata dalam kosakata, sehingga kalimat pendek hampir seluruhnya berisi angka nol. Kami menyebutnya representasi jarang.

Besar dan Boros

Dengan 50.000 kata dalam kosakata, setiap dokumen menjadi vektor sepanjang 50.000. Itu berarti terlalu banyak dimensi untuk hanya beberapa sinyal nyata.

Kata-Kata Tidak Memiliki Hubungan

Dalam bag-of-words, kata cat dan anak kucing menempati slot yang sepenuhnya terpisah. Model sama sekali tidak melihat kemiripan di antara keduanya, meskipun kita melihatnya.

Titik Buta Utama

Vektor jarang menganggap setiap kata tidak berhubungan dengan kata lainnya. Vektor ini menangkap keberadaan, tetapi sama sekali melewatkan makna dan hubungan antarkata.

Perkenalkan Vektor Padat

Embedding merepresentasikan setiap kata sebagai daftar pendek berisi bilangan riil, mungkin 100 nilai. Bentuk ringkas ini disebut vektor padat.

cat   = [0.21, -0.44, 0.10, 0.88]
kitten = [0.19, -0.40, 0.13, 0.85]

Sedikit Dimensi, Makna yang Kaya

Alih-alih memiliki 50.000 slot yang sebagian besar bernilai nol, Anda mendapatkan sekitar 100 bilangan yang tersusun padat. Setiap dimensi secara tersirat menyandikan aspek makna yang dipelajari. ✨

Kata-Kata yang Mirip Berdekatan

Keajaibannya terletak pada geometri: kata-kata dengan makna serupa berada berdekatan di dalam ruang. Kedekatan di ruang ini kini berarti kedekatan dalam makna.

Mengukur Kedekatan

Kami membandingkan dua vektor padat dengan kemiripan kosinus, yang mengukur seberapa selaras arah keduanya. Nilai yang lebih tinggi berarti maknanya lebih mirip.

Dipelajari dari Data

Tidak ada yang menulis angka-angka ini secara manual. Algoritme membaca teks dalam jumlah besar dan mempelajari setiap vektor kata berdasarkan cara kata-kata tersebut benar-benar digunakan.

Mengapa Ini Merupakan Lompatan Besar

Vektor padat lebih kecil, lebih cerdas, dan mampu menangkap hubungan yang tidak mungkin ditangkap oleh hitungan jarang. Perubahan tunggal ini mendukung sebagian besar NLP modern.

Pemeriksaan Singkat

Apa keunggulan utama vektor kata padat dibandingkan hitungan jarang?

Rangkuman

Hitungan jarang berukuran sangat besar dan menganggap kata-kata tidak saling berhubungan. Embedding padat mengatasi hal ini dengan vektor ringkas yang menempatkan kata-kata serupa secara berdekatan. ✅

Gratis untuk memulai

Belajar Python dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
30
Pelajaran
120

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Dari Hitungan Jarang ke Vektor Padat” gratis?

Ya — teks lengkap “Dari Hitungan Jarang ke Vektor Padat” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus NLP Academy, upgrade ke CoddyKit PRO. Kursus NLP Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Dari Hitungan Jarang ke Vektor Padat”?

Mengapa embedding mengungguli bag-of-words Kamu berlatih NLP Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai NLP Academy?

Tidak diperlukan pengalaman sebelumnya. NLP Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.

Berapa lama pelajaran “Dari Hitungan Jarang ke Vektor Padat” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran NLP Academy ini?

Ya. Setiap pelajaran NLP Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Dari Hitungan Jarang ke Vektor Padat
  2. Bagaimana word2vec Mempelajari Makna
  3. Memuat Vektor GloVe dalam Python
  4. Matematika Kata: King Dikurangi Man Ditambah Woman
← Kembali ke NLP Academy