Skip to main content

> ML_ALGORITHM // STATE-ACTION-REWARD-STATE-ACTION-SARSA_v1.0

SARSA (On-Policy Zamansal Fark)

Q-değerlerini açgözlü maksimum yerine mevcut politikanın aldığı gerçek sonraki eylemi kullanarak güncelleyen on-policy zamansal fark algoritması.

Value-Based Model-Free RLreinforcement-learninghigh-intrinsicmedium (1k-100k)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(episodes * steps)
Çıkarım (Inference):O(|A|) lookup
Donanım Karakteristiği
CPU Uygunluğu:Evet
GPU Zorunluluğu:Hayır
Bellek Ayak İzi:low
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:high-intrinsic
Eğitim Verisi İhtiyacı:medium (1k-100k)

Açıklanabilirlik Değerlendirmesi

Öğrenilen Q-değerleri aktif keşif politikasının güvenlik cezalarını doğrudan yansıtır.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
reinforcement learningsafe exploration
Desteklenen Modaliteler:
tabular

Uygulayıcı Kütüphaneler

gymnasium
torchrl

Temel Literatür & Yayınlar

Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • Tehlikeli ortamlarda Q-öğrenmeye kıyasla optimum altı aşırı muhafazakar yollara yakınsar