> ML_ALGORITHM // TRUST-REGION-POLICY-OPTIMIZATION-TRPO_v1.0
Güven Bölgesi Politika Optimizasyonu (TRPO)
Monoton politika iyileştirmesini garanti eden, katı bir KL diverjansı adım kısıtlaması uygulayan güven bölgesi politika gradyan algoritması.
On-Policy Policy Gradient RLreinforcement-learningblack-boxlarge (>100k)
Tüm Algoritmalara DönHesaplama Karmaşıklığı
Eğitim (Training):O(conjugate_gradient_steps * fisher_vector_products)
Çıkarım (Inference):O(policy_forward)
Donanım Karakteristiği
CPU Uygunluğu:Evet
GPU Zorunluluğu:Hayır
Bellek Ayak İzi:moderate
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:large (>100k)
Açıklanabilirlik Değerlendirmesi
Sınırlı KL diverjansı güven bölgeleri altında monoton azalan olmayan politika performansını teorik olarak garanti eder.
Uygun Görevler ve Desteklenen Modaliteler
Uygun Görevler:
reinforcement learningcontinuous robotics control
Desteklenen Modaliteler:
tabular
Uygulayıcı Kütüphaneler
stable-baselines3
torchrl
Temel Literatür & Yayınlar
Trust Region Policy Optimization (TRPO)John Schulman, Sergey Levine (2015) · International Conference on Machine Learning (ICML)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
- Fisher Bilgi Matrisi vektör çarpımları hesaplama açısından ağırdır ve yüksek parametreli derin ağlarda ölçeklenmesi zordur
