Skip to main content

> ML_ALGORITHM // TRUST-REGION-POLICY-OPTIMIZATION-TRPO_v1.0

Güven Bölgesi Politika Optimizasyonu (TRPO)

Monoton politika iyileştirmesini garanti eden, katı bir KL diverjansı adım kısıtlaması uygulayan güven bölgesi politika gradyan algoritması.

On-Policy Policy Gradient RLreinforcement-learningblack-boxlarge (>100k)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(conjugate_gradient_steps * fisher_vector_products)
Çıkarım (Inference):O(policy_forward)
Donanım Karakteristiği
CPU Uygunluğu:Evet
GPU Zorunluluğu:Hayır
Bellek Ayak İzi:moderate
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:large (>100k)

Açıklanabilirlik Değerlendirmesi

Sınırlı KL diverjansı güven bölgeleri altında monoton azalan olmayan politika performansını teorik olarak garanti eder.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
reinforcement learningcontinuous robotics control
Desteklenen Modaliteler:
tabular

Uygulayıcı Kütüphaneler

stable-baselines3
torchrl

Temel Literatür & Yayınlar

Trust Region Policy Optimization (TRPO)John Schulman, Sergey Levine (2015) · International Conference on Machine Learning (ICML)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • Fisher Bilgi Matrisi vektör çarpımları hesaplama açısından ağırdır ve yüksek parametreli derin ağlarda ölçeklenmesi zordur