> ML_LITERATURE // VANHASSELT-2016-DEEP-REINFORCEMENT-LEARNING-WITH-DOUBLE-Q-LEARNING_v1.0
Deep Reinforcement Learning with Double Q-learning (Double DQN)
Hado van Hasselt, Arthur Guez, David Silver · AAAI Conference on Artificial Intelligence (2016)
algorithm2016foundationalthirdPartyReproduced
Temel Katkı (Principal Contribution)
Q-öğrenmenin sistematik yukarı yönlü maksimizasyon yanlılığından muzdarip olduğunu göstererek açgözlü eylem seçimini hedef değerlendirmesinden Double Q-öğrenme ile ayırdı.
Operasyonel ve Mühendislik Uygunluğu
task-reinforcement-learning için yetkili teorik ve sistem temeli olarak hizmet eder.
Temel Varsayımlar (Assumptions)
- Hedef değerlendirme ortamlarında Markovian durum dinamikleri ve durağan ödül fonksiyonları geçerlidir
Kısıtlar ve Sınırlamalar (Limitations)
- Örneklem verimliliği, keşif kararlılığı ve simülasyondan gerçeğe transfer boşlukları özel ayarlama gerektirir
