Skip to main content

> ML_ALGORITHM // ADVANTAGE-ACTOR-CRITIC-A2C-A3C_v1.0

Avantaj Aktör-Eleştirmen (A2C ve A3C)

Gradyan varyansını stabilize etmek için paralel ortam örnekleri çalıştırarak politika gradyan öğrenimini hızlandıran eşzamanlı aktör-eleştirmen çerçevesi.

On-Policy Actor-Critic RLreinforcement-learningblack-boxlarge (>100k)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(workers * steps * forward_backward)
Çıkarım (Inference):O(policy_forward)
Donanım Karakteristiği
CPU Uygunluğu:Evet
GPU Zorunluluğu:Evet
Bellek Ayak İzi:moderate
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:large (>100k)

Açıklanabilirlik Değerlendirmesi

Avantaj fonksiyonu A(s, a) = Q(s, a) - V(s) gradyan varyansını önemli ölçüde azaltır.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
reinforcement learningparallel simulation
Desteklenen Modaliteler:
tabularimage

Uygulayıcı Kütüphaneler

stable-baselines3
torchrl
ray-rllib

Temel Literatür & Yayınlar

Asynchronous Methods for Deep Reinforcement Learning (A3C)Volodymyr Mnih, Adrià Puigdomènech Badia (2016) · International Conference on Machine Learning (ICML)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • Tek bir yavaş ortam çalışanı A2C'deki tüm eşzamanlı adım güncellemesini geciktirir