> ML_ALGORITHM // TWIN-DELAYED-DEEP-DETERMINISTIC-TD3_v1.0
İkiz Geciktirilmiş DDPG (TD3)
Kırpılmış ikili Q-öğrenme ve geciktirilmiş güncellemeler yoluyla sürekli aktör-eleştirmen RL'i stabilize eden gelişmiş algoritma.
Actor-Critic Continuous RLreinforcement-learningblack-boxlarge (>100k)
Tüm Algoritmalara DönHesaplama Karmaşıklığı
Eğitim (Training):O(steps * batch_size * (actor + 2 * critic)_passes)
Çıkarım (Inference):O(actor_forward)
Donanım Karakteristiği
CPU Uygunluğu:Hayır
GPU Zorunluluğu:Evet
Bellek Ayak İzi:moderate
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:large (>100k)
Açıklanabilirlik Değerlendirmesi
İkiz eleştirmenler aşırı tahmin yanlılığını azaltan savunmacı değer tahminleri üretir.
Uygun Görevler ve Desteklenen Modaliteler
Uygun Görevler:
reinforcement learningcontinuous robotics control
Desteklenen Modaliteler:
tabular
Uygulayıcı Kütüphaneler
stable-baselines3
torchrl
ray-rllib
Temel Literatür & Yayınlar
Addressing Function Approximation Error in Actor-Critic Methods (TD3)Scott Fujimoto, Herke van Hoof (2018) · International Conference on Machine Learning (ICML)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
- Hedef politika yumuşatma gürültüsü kırpılmalıdır; aşırı gürültü hassas kontrolü engeller
