Skip to main content

> ML_ALGORITHM // Q-LEARNING-TABULAR_v1.0

Tablosal Q-Öğrenme

Zamansal fark güncellemeleri yoluyla en uygun eylem-değer fonksiyonlarını yinelemeli olarak öğrenen temel modelden bağımsız pekiştirmeli öğrenme algoritması.

Value-Based Model-Free RLreinforcement-learninghigh-intrinsicmedium (1k-100k)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(episodes * steps)
Çıkarım (Inference):O(|A|) argmax table lookup
Donanım Karakteristiği
CPU Uygunluğu:Evet
GPU Zorunluluğu:Hayır
Bellek Ayak İzi:low
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:high-intrinsic
Eğitim Verisi İhtiyacı:medium (1k-100k)

Açıklanabilirlik Değerlendirmesi

Q-tablo değerleri eylem başına beklenen kümülatif indirgenmiş gelecekteki getirileri doğrudan ifade eder.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
reinforcement learningdiscrete control
Desteklenen Modaliteler:
tabular

Uygulayıcı Kütüphaneler

gymnasium
torchrl

Temel Literatür & Yayınlar

Q-learningChristopher J. C. H. Watkins, Peter Dayan (1992) · Machine Learning
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • Görülmemiş durumlar arasında genelleştirme yapamama; durum değişkenleriyle tablo boyutu üstel büyür
  • Maksimum operatörü nedeniyle eylem değerlerinin aşırı tahmin edilmesi