Python Academy · Pelajaran

Konsep Asas Pembelajaran Pengukuhan

Ejen, persekitaran, ganjaran dan penalti.

Pelajaran 1 daripada 510 langkah

Konsep Asas Pembelajaran Pengukuhan ialah pelajaran Python Academy percuma di CoddyKit. Ini ialah pelajaran 1 daripada 5. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Python Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Python Academy merangkumi sejumlah 5 pelajaran.

Apakah Pembelajaran Pengukuhan?

Konsep Asas Pembelajaran Pengukuhan

Pembelajaran Pengukuhan (RL) ialah sejenis pembelajaran mesin yang membolehkan ejen belajar membuat keputusan dengan berinteraksi dengan persekitaran. Matlamatnya adalah untuk memaksimumkan ganjaran dari semasa ke semasa.

Komponen utama RL termasuk ejen, persekitaran, ganjaran dan denda.

Konsep Asas Pembelajaran Pengukuhan — ilustrasi 1

Istilah Utama dalam RL

Istilah penting dalam pembelajaran pengukuhan:

  • Ejen: Pembuat keputusan, contohnya robot atau perisian.
  • Persekitaran: Sistem yang berinteraksi dengan ejen.
  • Keadaan: Situasi semasa persekitaran.
  • Tindakan: Keputusan yang diambil oleh ejen.
  • Ganjaran: Maklum balas daripada persekitaran untuk sesuatu tindakan.

Interaksi Ejen-Persekitaran

Interaksi ejen-persekitaran boleh diringkaskan seperti berikut:

  1. Ejen memerhatikan keadaan semasa persekitaran.
  2. Ejen mengambil tindakan berdasarkan suatu dasar.
  3. Persekitaran beralih kepada keadaan baharu dan memberikan ganjaran.

Gelung ini berterusan sehingga keadaan penamat dicapai.

Ganjaran dan Denda

Ganjaran ialah maklum balas yang diberikan kepada ejen untuk tindakannya. Matlamatnya adalah untuk memaksimumkan ganjaran terkumpul dari semasa ke semasa. Denda ialah ganjaran negatif yang tidak menggalakkan tindakan yang tidak diingini.

Contohnya:

  • Ganjaran: +10 kerana mencapai matlamat.
  • Denda: -5 kerana melanggar halangan.

Dasar dalam RL

Dasar ialah strategi yang digunakan oleh ejen untuk menentukan tindakan berdasarkan keadaan semasa.

Jenis dasar:

  • Deterministik: Sentiasa memilih tindakan yang sama untuk keadaan tertentu.
  • Stokastik: Memilih tindakan berdasarkan kebarangkalian.

Penerokaan berbanding Eksploitasi

Ejen perlu mengimbangi:

  • Penerokaan: Mencuba tindakan baharu untuk mengetahui lebih banyak tentang persekitaran.
  • Eksploitasi: Memilih tindakan yang menghasilkan ganjaran tertinggi yang diketahui.

Mengimbangi kedua-duanya amat penting untuk pembelajaran yang berkesan.

Proses Keputusan Markov (MDP)

Masalah pembelajaran pengukuhan sering dimodelkan sebagai MDP, yang ditakrifkan oleh:

  • Keadaan (S): Konfigurasi persekitaran yang mungkin.
  • Tindakan (A): Pilihan yang tersedia untuk ejen.
  • Ganjaran (R): Maklum balas untuk tindakan.
  • Kebarangkalian Peralihan (P): Kemungkinan beralih antara keadaan.

Cabaran dalam Pembelajaran Pengukuhan

Pembelajaran pengukuhan mempunyai beberapa cabaran:

  • Ganjaran Tertunda: Ganjaran mungkin diterima selepas beberapa tindakan.
  • Ganjaran Jarang: Ganjaran mungkin berlaku secara tidak kerap.
  • Dimensi Tinggi: Persekitaran kompleks dengan banyak keadaan dan tindakan.

Ringkasan dan Langkah Seterusnya

Dalam pelajaran ini, kita:

  • Meneroka konsep asas pembelajaran pengukuhan, termasuk ejen, persekitaran dan ganjaran.
  • Membincangkan dasar, penerokaan berbanding eksploitasi dan MDP.
  • Mempelajari tentang cabaran dalam RL.

Seterusnya, kita akan mendalami konsep Jadual-Q, iaitu pendekatan asas untuk pembelajaran pengukuhan.

Konsep Asas Pembelajaran Pengukuhan — ilustrasi 10
Percuma untuk bermula

Pelajari Python dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
76
Pelajaran
320

Soalan Lazim

Adakah pelajaran “Konsep Asas Pembelajaran Pengukuhan” percuma?

Ya — teks penuh “Konsep Asas Pembelajaran Pengukuhan” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Python Academy, tingkat taraf kepada CoddyKit PRO. Kursus Python Academy merangkumi sejumlah 5 pelajaran.

Apakah yang akan saya pelajari dalam “Konsep Asas Pembelajaran Pengukuhan”?

Ejen, persekitaran, ganjaran dan penalti. Anda berlatih Python Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Python Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Python Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 1 daripada 5.

Berapa lamakah pelajaran “Konsep Asas Pembelajaran Pengukuhan” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Python Academy ini?

Ya. Setiap pelajaran Python Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Konsep Asas Pembelajaran Pengukuhan
  2. Konsep Jadual Q
  3. Melaksanakan Jadual Q dalam Python
  4. Pembelajaran Q Mendalam
  5. Meneroka OpenAI Gym
← Kembali ke Python Academy