Skip to main content

> ML_LITERATURE // FUJIMOTO-2018-ADDRESSING-FUNCTION-APPROXIMATION-ERROR-ACTOR-CRITIC-TD3_v1.0

Addressing Function Approximation Error in Actor-Critic Methods (TD3)

Scott Fujimoto, Herke van Hoof, David Meger · International Conference on Machine Learning (ICML) (2018)

algorithm2018foundationalthirdPartyReproduced

Temel Katkı (Principal Contribution)

Kırpılmış ikili Q-öğrenme, geciktirilmiş politika güncellemeleri ve hedef politika yumuşatması içeren Twin Delayed DDPG (TD3) yöntemini tanıttı.

Operasyonel ve Mühendislik Uygunluğu

task-reinforcement-learning, task-continuous-control için yetkili teorik ve sistem temeli olarak hizmet eder.

Temel Varsayımlar (Assumptions)

  • Hedef değerlendirme ortamlarında Markovian durum dinamikleri ve durağan ödül fonksiyonları geçerlidir

Kısıtlar ve Sınırlamalar (Limitations)

  • Örneklem verimliliği, keşif kararlılığı ve simülasyondan gerçeğe transfer boşlukları özel ayarlama gerektirir

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: