> ML_ALGORITHM // ADVANTAGE-ACTOR-CRITIC-A2C-A3C_v1.0
Avantaj Aktör-Eleştirmen (A2C ve A3C)
Gradyan varyansını stabilize etmek için paralel ortam örnekleri çalıştırarak politika gradyan öğrenimini hızlandıran eşzamanlı aktör-eleştirmen çerçevesi.
On-Policy Actor-Critic RLreinforcement-learningblack-boxlarge (>100k)
Tüm Algoritmalara DönHesaplama Karmaşıklığı
Eğitim (Training):O(workers * steps * forward_backward)
Çıkarım (Inference):O(policy_forward)
Donanım Karakteristiği
CPU Uygunluğu:Evet
GPU Zorunluluğu:Evet
Bellek Ayak İzi:moderate
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:large (>100k)
Açıklanabilirlik Değerlendirmesi
Avantaj fonksiyonu A(s, a) = Q(s, a) - V(s) gradyan varyansını önemli ölçüde azaltır.
Uygun Görevler ve Desteklenen Modaliteler
Uygun Görevler:
reinforcement learningparallel simulation
Desteklenen Modaliteler:
tabularimage
Uygulayıcı Kütüphaneler
stable-baselines3
torchrl
ray-rllib
Temel Literatür & Yayınlar
Asynchronous Methods for Deep Reinforcement Learning (A3C)Volodymyr Mnih, Adrià Puigdomènech Badia (2016) · International Conference on Machine Learning (ICML)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
- Tek bir yavaş ortam çalışanı A2C'deki tüm eşzamanlı adım güncellemesini geciktirir
