Konsep Dasar Pembelajaran Penguatan
Agen, lingkungan, imbalan, dan penalti
Konsep Dasar Pembelajaran Penguatan adalah pelajaran Learn AI with Python gratis di CoddyKit. Ini adalah pelajaran 1 dari 5. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Learn AI with Python, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Learn AI with Python mencakup 5 pelajaran total.
Apa Itu Pembelajaran Penguatan?
Konsep Dasar Pembelajaran Penguatan
Pembelajaran Penguatan (RL) adalah jenis pembelajaran mesin yang memungkinkan agen belajar mengambil keputusan dengan berinteraksi dengan lingkungan. Tujuannya adalah memaksimalkan imbalan dari waktu ke waktu.
Komponen utama RL meliputi agen, lingkungan, imbalan, dan penalti.

Istilah Kunci dalam RL
Istilah Kunci dalam RL
Istilah penting dalam pembelajaran penguatan:
- Agen: Pengambil keputusan (misalnya, robot atau perangkat lunak).
- Lingkungan: Sistem yang berinteraksi dengan agen.
- Keadaan: Situasi lingkungan saat ini.
- Tindakan: Keputusan yang diambil oleh agen.
- Imbalan: Umpan balik dari lingkungan atas suatu tindakan.
Interaksi Agen dan Lingkungan
Interaksi Agen dan Lingkungan
Interaksi antara agen dan lingkungan dapat diringkas sebagai berikut:
- Agen mengamati keadaan lingkungan saat ini.
- Agen melakukan tindakan berdasarkan suatu kebijakan.
- Lingkungan berpindah ke keadaan baru dan memberikan imbalan.
Perulangan ini berlanjut hingga keadaan terminal tercapai.
Imbalan dan Penalti
Imbalan dan Penalti
Imbalan adalah umpan balik yang diberikan kepada agen atas tindakannya. Tujuannya adalah memaksimalkan imbalan kumulatif dari waktu ke waktu. Penalti adalah imbalan negatif yang mencegah tindakan yang tidak diinginkan.
Misalnya:
- Imbalan: +10 karena mencapai tujuan.
- Penalti: -5 karena menabrak rintangan.
Kebijakan dalam RL
Kebijakan dalam RL
Kebijakan adalah strategi yang digunakan agen untuk menentukan tindakan berdasarkan keadaan saat ini.
Jenis kebijakan:
- Deterministik: Selalu memilih tindakan yang sama untuk keadaan tertentu.
- Stokastik: Memilih tindakan berdasarkan probabilitas.
Eksplorasi vs. Eksploitasi
Eksplorasi vs. Eksploitasi
Agen menghadapi pertukaran antara:
- Eksplorasi: Mencoba tindakan baru untuk mengetahui lebih banyak tentang lingkungan.
- Eksploitasi: Memilih tindakan yang menghasilkan imbalan tertinggi yang telah diketahui.
Menyeimbangkan keduanya sangat penting untuk pembelajaran yang efektif.
Proses Keputusan Markov (MDP)
Proses Keputusan Markov (MDP)
Masalah pembelajaran penguatan sering dimodelkan sebagai MDP, yang didefinisikan oleh:
- Keadaan (S): Konfigurasi lingkungan yang mungkin.
- Tindakan (A): Pilihan yang tersedia bagi agen.
- Imbalan (R): Umpan balik atas tindakan.
- Probabilitas Transisi (P): Kemungkinan berpindah di antara keadaan.
Tantangan dalam Pembelajaran Penguatan
Tantangan dalam Pembelajaran Penguatan
Pembelajaran penguatan memiliki beberapa tantangan:
- Imbalan Tertunda: Imbalan mungkin diterima setelah beberapa tindakan.
- Imbalan Jarang: Imbalan mungkin muncul secara tidak sering.
- Dimensi Tinggi: Lingkungan kompleks dengan banyak keadaan dan tindakan.
Ringkasan dan Langkah Berikutnya
Ringkasan dan Langkah Berikutnya
Dalam pelajaran ini, kita:
- Mempelajari konsep dasar pembelajaran penguatan, termasuk agen, lingkungan, dan imbalan.
- Membahas kebijakan, eksplorasi vs. eksploitasi, dan MDP.
- Mempelajari tantangan dalam RL.
Selanjutnya, kita akan mempelajari konsep Tabel-Q, yaitu pendekatan dasar untuk pembelajaran penguatan.

Pertanyaan yang Sering Diajukan
Apakah pelajaran “Konsep Dasar Pembelajaran Penguatan” gratis?
Ya — teks lengkap “Konsep Dasar Pembelajaran Penguatan” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Learn AI with Python, upgrade ke CoddyKit PRO. Kursus Learn AI with Python mencakup 5 pelajaran total.
Apa yang akan aku pelajari di “Konsep Dasar Pembelajaran Penguatan”?
Agen, lingkungan, imbalan, dan penalti Kamu berlatih Learn AI with Python dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai Learn AI with Python?
Tidak diperlukan pengalaman sebelumnya. Learn AI with Python di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 5.
Berapa lama pelajaran “Konsep Dasar Pembelajaran Penguatan” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran Learn AI with Python ini?
Ya. Setiap pelajaran Learn AI with Python menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Konsep Dasar Pembelajaran Penguatan
- Konsep Tabel-Q
- Menerapkan Tabel Q dalam Python
- Pembelajaran Q Mendalam
- Menjelajahi OpenAI Gym