Pekiştirmeli öğrenmenin temel kavramları
Ajan, ortam, ödüller ve cezalar
Pekiştirmeli öğrenmenin temel kavramları, CoddyKit'te ücretsiz bir Python Academy dersidir. Bu, 5 dersinin 1. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, Python Academy öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. Python Academy kursu toplamda 5 dersten oluşur.
Pekiştirmeli Öğrenme Nedir?
Pekiştirmeli Öğrenmenin Temel Kavramları
Pekiştirmeli Öğrenme (RL), bir etmenin bir ortamla etkileşime girerek karar vermeyi öğrendiği bir makine öğrenmesi türüdür. Amaç, zaman içinde ödülleri en üst düzeye çıkarmaktır.
RL'nin temel bileşenleri arasında etmenler, ortamlar, ödüller ve cezalar bulunur.

RL'de Temel Terminoloji
RL'de Temel Terminoloji
Pekiştirmeli öğrenmedeki önemli terimler:
- Etmen: Karar verici (ör. robot veya yazılım).
- Ortam: Etmenin etkileşime girdiği sistem.
- Durum: Ortamın mevcut durumu.
- Eylem: Etmenin aldığı karar.
- Ödül: Bir eylem karşılığında ortamdan gelen geri bildirim.
Etmen-Ortam Etkileşimi
Etmen-Ortam Etkileşimi
Etmen-ortam etkileşimi şu şekilde özetlenebilir:
- Etmen, ortamın mevcut durumunu gözlemler.
- Etmen, bir politikaya dayanarak bir eylem gerçekleştirir.
- Ortam yeni bir duruma geçer ve bir ödül sağlar.
Bu döngü, bir sonlanma durumuna ulaşılana kadar devam eder.
Ödüller ve Cezalar
Ödüller ve Cezalar
Ödüller, eylemleri karşılığında etmene verilen geri bildirimdir. Amaç, zaman içinde birikimli ödülü en üst düzeye çıkarmaktır. Cezalar, istenmeyen eylemleri caydıran negatif ödüllerdir.
Örneğin:
- Ödül: Bir hedefe ulaşma karşılığında +10.
- Ceza: Bir engele çarpma karşılığında -5.
RL'deki Politikalar
RL'deki Politikalar
Politika, mevcut duruma göre eylemlere karar vermek için etmenin kullandığı bir stratejidir.
Politika türleri:
- Belirlenimci: Belirli bir durum için her zaman aynı eylemi seçer.
- Olasılıksal: Eylemleri olasılıklara göre seçer.
Keşif ve Yararlanma Arasındaki Denge
Keşif ve Yararlanma Arasındaki Denge
Etmen şu iki seçenek arasında bir ödünleşimle karşı karşıyadır:
- Keşif: Ortam hakkında daha fazla bilgi edinmek için yeni eylemleri deneme.
- Yararlanma: Bilinen en yüksek ödülü sağlayan eylemleri seçme.
Bunlar arasında denge kurmak etkili öğrenme için kritik öneme sahiptir.
Markov Karar Süreci (MDP)
Markov Karar Süreci (MDP)
Pekiştirmeli öğrenme problemleri genellikle şu şekilde tanımlanan bir MDP olarak modellenir:
- Durumlar (S): Ortamın olası yapılandırmaları.
- Eylemler (A): Etmenin kullanabileceği seçenekler.
- Ödüller (R): Eylemlere ilişkin geri bildirim.
- Geçiş Olasılıkları (P): Durumlar arasında geçiş yapma olasılığı.
Pekiştirmeli Öğrenmedeki Zorluklar
Pekiştirmeli Öğrenmedeki Zorluklar
Pekiştirmeli öğrenmenin bazı zorlukları vardır:
- Gecikmeli Ödüller: Ödüller birkaç eylemden sonra alınabilir.
- Seyrek Ödüller: Ödüller seyrek aralıklarla ortaya çıkabilir.
- Yüksek Boyutluluk: Çok sayıda durum ve eylem içeren karmaşık ortamlar.
Özet ve Sonraki Adımlar
Özet ve Sonraki Adımlar
Bu derste:
- Etmenler, ortamlar ve ödüller de dahil olmak üzere pekiştirmeli öğrenmenin temel kavramlarını inceledik.
- Politikaları, keşif ve yararlanmayı ve MDP'leri ele aldık.
- RL'deki zorlukları öğrendik.
Sonraki adımda, pekiştirmeli öğrenmeye temel oluşturan bir yaklaşım olan Q tablosu kavramını ayrıntılı olarak inceleyeceğiz.

Sıkça Sorulan Sorular
“Pekiştirmeli öğrenmenin temel kavramları” dersi ücretsiz mi?
Evet — “Pekiştirmeli öğrenmenin temel kavramları” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve Python Academy kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. Python Academy kursu toplamda 5 dersten oluşur.
“Pekiştirmeli öğrenmenin temel kavramları” dersinde ne öğreneceğim?
Ajan, ortam, ödüller ve cezalar Python Academy ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
Python Academy öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te Python Academy, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 5 dersinin 1. dersidir.
“Pekiştirmeli öğrenmenin temel kavramları” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu Python Academy dersinde kod yazıp çalıştırabilir miyim?
Evet. Her Python Academy dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Pekiştirmeli öğrenmenin temel kavramları
- Q-Tablosu kavramı
- Python'da Q-Tablosu uygulama
- Derin Q-öğrenme
- OpenAI Gym'i keşfetme