Skip to main content

> ML_LITERATURE // HAARNOJA-2018-SOFT-ACTOR-CRITIC-OFF-POLICY-MAXIMUM-ENTROPY-DEEP-RL_v1.0

Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor

Tuomas Haarnoja, Aurick Zhou, Pieter Abbeel, Sergey Levine · International Conference on Machine Learning (ICML) (2018)

algorithm2018industry-standardthirdPartyReproduced

Temel Katkı (Principal Contribution)

Maksimum entropi RL'i off-policy aktör-eleştirmen mimarileri ve ikiz Q-ağları ile entegre ederek maksimum eylem entropisini korurken ödülü maksimize etti.

Operasyonel ve Mühendislik Uygunluğu

Fiziksel gerçek dünya robotiğinde ve otonom araç yörünge planlamasında sürekli kontrol için önde gelen referans algoritma.

Temel Varsayımlar (Assumptions)

  • Beklenen getiriyi politika entropisiyle artırmak erken politika çöküşünü önler ve sağlam çok modlu keşfi teşvik eder

Kısıtlar ve Sınırlamalar (Limitations)

  • Tamamen rastgele politikaları veya hızlı deterministik çöküşü önlemek için otomatik entropi sıcaklık ayarı gerektirir

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: