Skip to main content

> ML_ALGORITHM // PROXIMAL-POLICY-OPTIMIZATION-PPO_v1.0

Yakınsal Politika Optimizasyonu (PPO)

Kırpılmış vekil amaç fonksiyonları aracılığıyla kararlı ve sağlam politika optimizasyonu sağlayan endüstri standardı pekiştirmeli öğrenme algoritması.

On-Policy Policy Gradient RLreinforcement-learningblack-boxlarge (>100k)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(epochs * batch_size * forward_backward)
Çıkarım (Inference):O(policy_forward)
Donanım Karakteristiği
CPU Uygunluğu:Hayır
GPU Zorunluluğu:Evet
Bellek Ayak İzi:high
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:large (>100k)

Açıklanabilirlik Değerlendirmesi

Kırpma hedefi maliyetli ikinci dereceden Hessian hesaplamaları gerektirmeden yıkıcı politika çöküşünü önler.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
reinforcement learningllm alignment rlhfrobotics simulation
Desteklenen Modaliteler:
tabulartextimage

Uygulayıcı Kütüphaneler

stable-baselines3
TRLHugging Face · v0.10.1
İncele
torchrl
ray-rllib

Temel Literatür & Yayınlar

Proximal Policy Optimization Algorithms (PPO)John Schulman, Filip Wolski (2017) · arXiv preprint
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • Referans modele karşı KL cezası çok gevşek tutulursa RLHF ile LLM ince ayarında ödül istismarı (reward hacking)
  • Milyonlarca simüle edilmiş ortam etkileşimi gerektiren yüksek örneklem verimsizliği