Skip to main content

> ML_ALGORITHM // DEEP-DETERMINISTIC-POLICY-GRADIENT-DDPG_v1.0

Derin Belirleyici Politika Gradyanı (DDPG)

Belirleyici politika gradyanlarını derin Q-öğrenme ile birleştirerek sürekli eylem uzaylarında çalışan aktör-eleştirmen algoritması.

Actor-Critic Continuous RLreinforcement-learningblack-boxlarge (>100k)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(steps * batch_size * (actor + critic)_passes)
Çıkarım (Inference):O(actor_forward)
Donanım Karakteristiği
CPU Uygunluğu:Hayır
GPU Zorunluluğu:Evet
Bellek Ayak İzi:moderate
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:large (>100k)

Açıklanabilirlik Değerlendirmesi

Aktör, eleştirmen (critic) tarafından doğrudan değerlendirilen sürekli eylem vektörleri üretir.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
reinforcement learningcontinuous robotics control
Desteklenen Modaliteler:
tabular

Uygulayıcı Kütüphaneler

stable-baselines3
torchrl
ray-rllib

Temel Literatür & Yayınlar

Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • Hiperparametre ayarlarına ve gürültü azalmasına karşı son derece hassastır
  • Politika çöküşüne yol açan şiddetli Q-değeri aşırı tahmini (TD3 tarafından çözüldü)