> ML_LITERATURE // WANG-2016-DUELING-NETWORK-ARCHITECTURES-DEEP-REINFORCEMENT-LEARNING_v1.0
Dueling Network Architectures for Deep Reinforcement Learning (Dueling DQN)
Ziyu Wang, Tom Schaul, Matteo Hessel, Hado van Hasselt, Marc Lanctot, Nando de Freitas · International Conference on Machine Learning (ICML) (2016)
seminal-architecture2016foundationalthirdPartyReproduced
Temel Katkı (Principal Contribution)
Durum-eylem değeri Q(s,a)'yı iki ayrı akışa ayırdı: bir durum değeri tahmincisi V(s) ve duruma bağlı avantaj tahmincisi A(s,a).
Operasyonel ve Mühendislik Uygunluğu
task-reinforcement-learning için yetkili teorik ve sistem temeli olarak hizmet eder.
Temel Varsayımlar (Assumptions)
- Hedef değerlendirme ortamlarında Markovian durum dinamikleri ve durağan ödül fonksiyonları geçerlidir
Kısıtlar ve Sınırlamalar (Limitations)
- Örneklem verimliliği, keşif kararlılığı ve simülasyondan gerçeğe transfer boşlukları özel ayarlama gerektirir
