NLP Academy · Pelajaran

Memisahkan Berdasarkan Spasi dan Batasannya

Saat pemisahan sederhana tidak lagi memadai

Pelajaran 2 dari 413 langkah

Memisahkan Berdasarkan Spasi dan Batasannya adalah pelajaran NLP Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar NLP Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus NLP Academy mencakup 4 pelajaran total.

Tokenizer Paling Sederhana

Cara termudah untuk melakukan tokenisasi adalah memisahkan teks berdasarkan spasi. Metode split() Python melakukan tepat hal itu tanpa persiapan apa pun. ✂️

text = "I love cats"
print(text.split())  # ['I', 'love', 'cats']

Cara Kerja split()

Jika dipanggil tanpa argumen, split() memecah teks pada rangkaian whitespace apa pun: spasi, tab, atau baris baru. Jarak kosong diabaikan secara otomatis.

Terkadang Sudah Cukup Baik

Untuk kalimat yang bersih dan sederhana, pemisahan berdasarkan whitespace berlangsung cepat dan cukup baik. Ini merupakan langkah awal yang tepat saat Anda mempelajari dasar-dasarnya.

Tanda Baca Menempel

Inilah masalah pertama: tanda baca melekat pada kata. Memisahkan cats! menghasilkan cats! sebagai satu token, bukan kata bersih cats yang Anda inginkan.

print("I love cats!".split())  # ['I', 'love', 'cats!']

Kata Sama, Token Berbeda

Sekarang cats dan cats! dihitung sebagai dua token yang berbeda. Jumlah kata Anda terpecah, dan hal itu secara diam-diam merusak semua pengukuran berikutnya.

Kontraksi Menjadi Masalah

Pemisahan berdasarkan whitespace mempertahankan don't sebagai satu bagian. Cara ini tidak dapat melihat not yang tersembunyi di dalamnya, sehingga negasi hilang sepenuhnya.

Tanda Hubung Membingungkan

Kata seperti state-of-the-art tetap melekat sebagai satu token. Terkadang itu memang benar, tetapi split() tidak memberi Anda choice dalam hal ini.

Tanpa Spasi, Tidak Ada Pemisahan

Banyak bahasa, seperti bahasa Mandarin, ditulis tanpa spasi di antara kata-kata. Dalam kasus ini, pemisahan berdasarkan whitespace fails sepenuhnya dan menghasilkan satu token raksasa.

Perbedaan Huruf Besar Tetap Ada

Pemisahan saja tetap membedakan Cats dan cats karena huruf kapitalnya. Pemisahan berdasarkan whitespace sama sekali tidak melakukan normalization untuk Anda.

Mengapa Ini Penting

Semua masalah ini terakumulasi. Token yang kotor menghasilkan hitungan yang salah, dan hitungan yang salah menghasilkan model yang lebih lemah dalam pipeline Anda.

Langkah Selanjutnya

Pemisahan berdasarkan whitespace merupakan pengajar yang baik, tetapi bukan solusi akhir yang baik. Proyek nyata menggunakan tokenizer yang tepat untuk menangani kasus-kasus khusus ini.

Pemeriksaan Singkat

Temukan kelemahan pemisahan sederhana.

Ringkasan

split() berdasarkan whitespace memang sederhana dan cepat, tetapi membuat tanda baca menempel, melewatkan kontraksi, dan gagal jika tidak ada spasi. Bagus untuk belajar, tetapi belum cukup untuk digunakan dalam produk.

Gratis untuk memulai

Belajar Python dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
30
Pelajaran
120

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Memisahkan Berdasarkan Spasi dan Batasannya” gratis?

Ya — teks lengkap “Memisahkan Berdasarkan Spasi dan Batasannya” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus NLP Academy, upgrade ke CoddyKit PRO. Kursus NLP Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Memisahkan Berdasarkan Spasi dan Batasannya”?

Saat pemisahan sederhana tidak lagi memadai Kamu berlatih NLP Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai NLP Academy?

Tidak diperlukan pengalaman sebelumnya. NLP Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Memisahkan Berdasarkan Spasi dan Batasannya” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran NLP Academy ini?

Ya. Setiap pelajaran NLP Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Sebenarnya, Apa Itu Token?
  2. Memisahkan Berdasarkan Spasi dan Batasannya
  3. Dasar-Dasar Segmentasi Kalimat
  4. Melakukan Tokenisasi dengan NLTK
← Kembali ke NLP Academy