> ML_LITERATURE // SILVER-2017-MASTERING-CHESS-SHOGI-GO-SELF-PLAY-ALPHAZERO_v1.0
Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm (AlphaZero)
David Silver, Thomas Hubert, Julian Schrittwieser, Ioannis Antonoglou, Matthew Lai, Arthur Guez, Marc Lanctot, Laurent Sifre, Dharshan Kumaran, Thore Graepel, Timothy Lillicrap, Karen Simonyan, Demis Hassabis · Science (2017)
seminal-architecture2017foundationalthirdPartyReproduced
Temel Katkı (Principal Contribution)
Sıfır insan alan bilgisi veya açılış kitaplarıyla rastgele oyundan başlayarak saf MCTS kendi kendine oynama yoluyla satranç, şogi ve Go'da 24 saat içinde uzmanlaştı.
Operasyonel ve Mühendislik Uygunluğu
task-game-playing için yetkili teorik ve sistem temeli olarak hizmet eder.
Temel Varsayımlar (Assumptions)
- Hedef değerlendirme ortamlarında Markovian durum dinamikleri ve durağan ödül fonksiyonları geçerlidir
Kısıtlar ve Sınırlamalar (Limitations)
- Örneklem verimliliği, keşif kararlılığı ve simülasyondan gerçeğe transfer boşlukları özel ayarlama gerektirir
