Skip to main content

> ML_ALGORITHM // TWIN-DELAYED-DEEP-DETERMINISTIC-TD3_v1.0

İkiz Geciktirilmiş DDPG (TD3)

Kırpılmış ikili Q-öğrenme ve geciktirilmiş güncellemeler yoluyla sürekli aktör-eleştirmen RL'i stabilize eden gelişmiş algoritma.

Actor-Critic Continuous RLreinforcement-learningblack-boxlarge (>100k)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(steps * batch_size * (actor + 2 * critic)_passes)
Çıkarım (Inference):O(actor_forward)
Donanım Karakteristiği
CPU Uygunluğu:Hayır
GPU Zorunluluğu:Evet
Bellek Ayak İzi:moderate
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:large (>100k)

Açıklanabilirlik Değerlendirmesi

İkiz eleştirmenler aşırı tahmin yanlılığını azaltan savunmacı değer tahminleri üretir.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
reinforcement learningcontinuous robotics control
Desteklenen Modaliteler:
tabular

Uygulayıcı Kütüphaneler

stable-baselines3
torchrl
ray-rllib

Temel Literatür & Yayınlar

Addressing Function Approximation Error in Actor-Critic Methods (TD3)Scott Fujimoto, Herke van Hoof (2018) · International Conference on Machine Learning (ICML)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • Hedef politika yumuşatma gürültüsü kırpılmalıdır; aşırı gürültü hassas kontrolü engeller