Skip to main content

> ML_ALGORITHM // REINFORCE-POLICY-GRADIENTS_v1.0

REINFORCE (Monte Carlo Politika Gradyanı)

Parametre ağırlıklarını gözlemlenen tam bölüm kümülatif getirileriyle orantılı olarak güncelleyen klasik Monte Carlo politika gradyan algoritması.

Policy Gradient RLreinforcement-learningblack-boxmedium (1k-100k)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(episodes * episode_length * policy_pass)
Çıkarım (Inference):O(policy_pass)
Donanım Karakteristiği
CPU Uygunluğu:Evet
GPU Zorunluluğu:Hayır
Bellek Ayak İzi:low
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:medium (1k-100k)

Açıklanabilirlik Değerlendirmesi

Ortalamanın üzerinde getiri sağlayan eylemlerin log-olasılıklarını artırarak doğrudan J(theta) = E[R] amacını optimize eder.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
reinforcement learningdiscrete control
Desteklenen Modaliteler:
tabular

Uygulayıcı Kütüphaneler

stable-baselines3
torchrl
PyTorchLinux Foundation / PyTorch Foundation · v2.4.1
İncele

Temel Literatür & Yayınlar

Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • Öğrenilmiş bir referans noktası (baseline) olmadan aşırı gradyan varyansı düzensiz öğrenme yörüngelerine ve yavaş yakınsamaya yol açar