Skip to main content

> ML_LITERATURE // WILLIAMS-1992-SIMPLE-STATISTICAL-GRADIENT-FOLLOWING-REINFORCE_v1.0

Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning (REINFORCE)

Ronald J. Williams · Machine Learning (1992)

foundational1992foundationalthirdPartyReproduced

Temel Katkı (Principal Contribution)

Politika Gradyanı Teoremini ve REINFORCE algoritmasını türeterek log-türev olabilirlik hilesiyle doğrudan parametreli politika dağılımları üzerinde gradyan çıkışını mümkün kıldı.

Operasyonel ve Mühendislik Uygunluğu

task-reinforcement-learning için yetkili teorik ve sistem temeli olarak hizmet eder.

Temel Varsayımlar (Assumptions)

  • Hedef değerlendirme ortamlarında Markovian durum dinamikleri ve durağan ödül fonksiyonları geçerlidir

Kısıtlar ve Sınırlamalar (Limitations)

  • Örneklem verimliliği, keşif kararlılığı ve simülasyondan gerçeğe transfer boşlukları özel ayarlama gerektirir

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: