> ML_ALGORITHM // SOFT-ACTOR-CRITIC-SAC_v1.0
Yumuşak Aktör-Eleştirmen (SAC)
Stokastik bir politikayı maksimum entropi ile optimize ederek üstün keşif ve sağlamlık sağlayan örneklem verimli pekiştirmeli öğrenme algoritması.
Maximum Entropy Continuous RLreinforcement-learningblack-boxlarge (>100k)
Tüm Algoritmalara DönHesaplama Karmaşıklığı
Eğitim (Training):O(steps * batch_size * passes)
Çıkarım (Inference):O(actor_forward)
Donanım Karakteristiği
CPU Uygunluğu:Hayır
GPU Zorunluluğu:Evet
Bellek Ayak İzi:moderate
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:large (>100k)
Açıklanabilirlik Değerlendirmesi
Stokastik aktör eylem dağılımının ortalama ve varyansını üretir; entropi terimi keşfi garanti eder.
Uygun Görevler ve Desteklenen Modaliteler
Uygun Görevler:
reinforcement learningcontinuous robotics controlautonomous driving
Desteklenen Modaliteler:
tabularimage
Uygulayıcı Kütüphaneler
stable-baselines3
torchrl
ray-rllib
Temel Literatür & Yayınlar
Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic ActorTuomas Haarnoja, Aurick Zhou (2018) · International Conference on Machine Learning (ICML)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
- Entropi katsayısı alpha'yı otomatik ayarlamamak ya düzensiz rastgele eylemlere ya da erken determinizme yol açar
