> ML_ALGORITHM // STATE-ACTION-REWARD-STATE-ACTION-SARSA_v1.0
SARSA (On-Policy Zamansal Fark)
Q-değerlerini açgözlü maksimum yerine mevcut politikanın aldığı gerçek sonraki eylemi kullanarak güncelleyen on-policy zamansal fark algoritması.
Value-Based Model-Free RLreinforcement-learninghigh-intrinsicmedium (1k-100k)
Tüm Algoritmalara DönHesaplama Karmaşıklığı
Eğitim (Training):O(episodes * steps)
Çıkarım (Inference):O(|A|) lookup
Donanım Karakteristiği
CPU Uygunluğu:Evet
GPU Zorunluluğu:Hayır
Bellek Ayak İzi:low
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:high-intrinsic
Eğitim Verisi İhtiyacı:medium (1k-100k)
Açıklanabilirlik Değerlendirmesi
Öğrenilen Q-değerleri aktif keşif politikasının güvenlik cezalarını doğrudan yansıtır.
Uygun Görevler ve Desteklenen Modaliteler
Uygun Görevler:
reinforcement learningsafe exploration
Desteklenen Modaliteler:
tabular
Uygulayıcı Kütüphaneler
gymnasium
torchrl
Temel Literatür & Yayınlar
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
- Tehlikeli ortamlarda Q-öğrenmeye kıyasla optimum altı aşırı muhafazakar yollara yakınsar
