Skip to main content

> ML_ALGORITHM // SOFT-ACTOR-CRITIC-SAC_v1.0

Yumuşak Aktör-Eleştirmen (SAC)

Stokastik bir politikayı maksimum entropi ile optimize ederek üstün keşif ve sağlamlık sağlayan örneklem verimli pekiştirmeli öğrenme algoritması.

Maximum Entropy Continuous RLreinforcement-learningblack-boxlarge (>100k)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(steps * batch_size * passes)
Çıkarım (Inference):O(actor_forward)
Donanım Karakteristiği
CPU Uygunluğu:Hayır
GPU Zorunluluğu:Evet
Bellek Ayak İzi:moderate
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:large (>100k)

Açıklanabilirlik Değerlendirmesi

Stokastik aktör eylem dağılımının ortalama ve varyansını üretir; entropi terimi keşfi garanti eder.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
reinforcement learningcontinuous robotics controlautonomous driving
Desteklenen Modaliteler:
tabularimage

Uygulayıcı Kütüphaneler

stable-baselines3
torchrl
ray-rllib

Temel Literatür & Yayınlar

Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic ActorTuomas Haarnoja, Aurick Zhou (2018) · International Conference on Machine Learning (ICML)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • Entropi katsayısı alpha'yı otomatik ayarlamamak ya düzensiz rastgele eylemlere ya da erken determinizme yol açar