> ML_ALGORITHM // REINFORCE-POLICY-GRADIENTS_v1.0
REINFORCE (Monte Carlo Politika Gradyanı)
Parametre ağırlıklarını gözlemlenen tam bölüm kümülatif getirileriyle orantılı olarak güncelleyen klasik Monte Carlo politika gradyan algoritması.
Policy Gradient RLreinforcement-learningblack-boxmedium (1k-100k)
Tüm Algoritmalara DönHesaplama Karmaşıklığı
Eğitim (Training):O(episodes * episode_length * policy_pass)
Çıkarım (Inference):O(policy_pass)
Donanım Karakteristiği
CPU Uygunluğu:Evet
GPU Zorunluluğu:Hayır
Bellek Ayak İzi:low
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:medium (1k-100k)
Açıklanabilirlik Değerlendirmesi
Ortalamanın üzerinde getiri sağlayan eylemlerin log-olasılıklarını artırarak doğrudan J(theta) = E[R] amacını optimize eder.
Uygun Görevler ve Desteklenen Modaliteler
Uygun Görevler:
reinforcement learningdiscrete control
Desteklenen Modaliteler:
tabular
Uygulayıcı Kütüphaneler
Temel Literatür & Yayınlar
Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning (REINFORCE)Ronald J. Williams (1992) · Machine Learning
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
- Öğrenilmiş bir referans noktası (baseline) olmadan aşırı gradyan varyansı düzensiz öğrenme yörüngelerine ve yavaş yakınsamaya yol açar
