Konsep Dasar Pembelajaran Penguatan
Agen, lingkungan, imbalan, dan penalti
Konsep Dasar Pembelajaran Penguatan adalah pelajaran Python Academy gratis di CoddyKit. Ini adalah pelajaran 1 dari 5. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Python Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Python Academy mencakup 5 pelajaran total.
Apa Itu Pembelajaran Penguatan?
Konsep Dasar dalam Pembelajaran Penguatan
Pembelajaran Penguatan (RL) adalah jenis pembelajaran mesin yang memungkinkan seorang agen belajar mengambil keputusan dengan berinteraksi dengan sebuah lingkungan. Tujuannya adalah memaksimalkan imbalan seiring waktu.
Komponen utama RL meliputi agen, lingkungan, imbalan, dan penalti.

Terminologi Utama dalam RL
Terminologi Utama dalam RL
Istilah penting dalam pembelajaran penguatan:
- Agen: Pengambil keputusan, misalnya robot atau perangkat lunak.
- Lingkungan: Sistem yang berinteraksi dengan agen.
- Keadaan: Situasi lingkungan saat ini.
- Tindakan: Keputusan yang diambil oleh agen.
- Imbalan: Umpan balik dari lingkungan atas suatu tindakan.
Interaksi Agen-Lingkungan
Interaksi Agen-Lingkungan
Interaksi agen-lingkungan dapat diringkas sebagai berikut:
- Agen mengamati keadaan lingkungan saat ini.
- Agen mengambil tindakan berdasarkan suatu kebijakan.
- Lingkungan beralih ke keadaan baru dan memberikan imbalan.
Siklus ini berlanjut hingga keadaan akhir tercapai.
Imbalan dan Penalti
Imbalan dan Penalti
Imbalan adalah umpan balik yang diberikan kepada agen atas tindakannya. Tujuannya adalah memaksimalkan imbalan kumulatif seiring waktu. Penalti adalah imbalan negatif yang mencegah tindakan yang tidak diinginkan.
Contohnya:
- Imbalan: +10 karena mencapai tujuan.
- Penalti: -5 karena menabrak rintangan.
Kebijakan dalam RL
Kebijakan dalam RL
Kebijakan adalah strategi yang digunakan agen untuk menentukan tindakan berdasarkan keadaan saat ini.
Jenis kebijakan:
- Deterministik: Selalu memilih tindakan yang sama untuk keadaan tertentu.
- Stokastik: Memilih tindakan berdasarkan probabilitas.
Eksplorasi vs. Eksploitasi
Eksplorasi vs. Eksploitasi
Agen menghadapi kompromi antara:
- Eksplorasi: Mencoba tindakan baru untuk mengetahui lebih banyak tentang lingkungan.
- Eksploitasi: Memilih tindakan yang menghasilkan imbalan tertinggi yang telah diketahui.
Menyeimbangkan keduanya sangat penting untuk pembelajaran yang efektif.
Proses Keputusan Markov (MDP)
Proses Keputusan Markov (MDP)
Masalah pembelajaran penguatan sering dimodelkan sebagai MDP, yang ditentukan oleh:
- Keadaan (S): Kemungkinan konfigurasi lingkungan.
- Tindakan (A): Pilihan yang tersedia bagi agen.
- Imbalan (R): Umpan balik atas tindakan.
- Probabilitas Perpindahan (P): Kemungkinan berpindah dari satu keadaan ke keadaan lain.
Tantangan dalam Pembelajaran Penguatan
Tantangan dalam Pembelajaran Penguatan
Pembelajaran penguatan memiliki beberapa tantangan:
- Imbalan yang Tertunda: Imbalan mungkin diterima setelah beberapa tindakan.
- Imbalan yang Jarang: Imbalan mungkin terjadi secara tidak sering.
- Dimensi Tinggi: Lingkungan kompleks dengan banyak keadaan dan tindakan.
Ringkasan dan Langkah Berikutnya
Ringkasan dan Langkah Berikutnya
Dalam pelajaran ini, kami:
- Menjelajahi konsep dasar pembelajaran penguatan, termasuk agen, lingkungan, dan imbalan.
- Membahas kebijakan, eksplorasi vs. eksploitasi, dan MDP.
- Mempelajari tantangan dalam RL.
Selanjutnya, kami akan mempelajari konsep Tabel-Q, yaitu pendekatan dasar dalam pembelajaran penguatan.

Pertanyaan yang Sering Diajukan
Apakah pelajaran “Konsep Dasar Pembelajaran Penguatan” gratis?
Ya — teks lengkap “Konsep Dasar Pembelajaran Penguatan” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Python Academy, upgrade ke CoddyKit PRO. Kursus Python Academy mencakup 5 pelajaran total.
Apa yang akan aku pelajari di “Konsep Dasar Pembelajaran Penguatan”?
Agen, lingkungan, imbalan, dan penalti Kamu berlatih Python Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai Python Academy?
Tidak diperlukan pengalaman sebelumnya. Python Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 5.
Berapa lama pelajaran “Konsep Dasar Pembelajaran Penguatan” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran Python Academy ini?
Ya. Setiap pelajaran Python Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Konsep Dasar Pembelajaran Penguatan
- Konsep Tabel-Q
- Menerapkan Tabel-Q dalam Python
- Pembelajaran-Q Mendalam
- Menjelajahi OpenAI Gym