> ML_LITERATURE // HAARNOJA-2018-SOFT-ACTOR-CRITIC-OFF-POLICY-MAXIMUM-ENTROPY-DEEP-RL_v1.0
Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor
Tuomas Haarnoja, Aurick Zhou, Pieter Abbeel, Sergey Levine · International Conference on Machine Learning (ICML) (2018)
algorithm2018industry-standardthirdPartyReproduced
Temel Katkı (Principal Contribution)
Maksimum entropi RL'i off-policy aktör-eleştirmen mimarileri ve ikiz Q-ağları ile entegre ederek maksimum eylem entropisini korurken ödülü maksimize etti.
Operasyonel ve Mühendislik Uygunluğu
Fiziksel gerçek dünya robotiğinde ve otonom araç yörünge planlamasında sürekli kontrol için önde gelen referans algoritma.
Temel Varsayımlar (Assumptions)
- Beklenen getiriyi politika entropisiyle artırmak erken politika çöküşünü önler ve sağlam çok modlu keşfi teşvik eder
Kısıtlar ve Sınırlamalar (Limitations)
- Tamamen rastgele politikaları veya hızlı deterministik çöküşü önlemek için otomatik entropi sıcaklık ayarı gerektirir
