> ML_ALGORITHM // Q-LEARNING-TABULAR_v1.0
Tablosal Q-Öğrenme
Zamansal fark güncellemeleri yoluyla en uygun eylem-değer fonksiyonlarını yinelemeli olarak öğrenen temel modelden bağımsız pekiştirmeli öğrenme algoritması.
Value-Based Model-Free RLreinforcement-learninghigh-intrinsicmedium (1k-100k)
Tüm Algoritmalara DönHesaplama Karmaşıklığı
Eğitim (Training):O(episodes * steps)
Çıkarım (Inference):O(|A|) argmax table lookup
Donanım Karakteristiği
CPU Uygunluğu:Evet
GPU Zorunluluğu:Hayır
Bellek Ayak İzi:low
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:high-intrinsic
Eğitim Verisi İhtiyacı:medium (1k-100k)
Açıklanabilirlik Değerlendirmesi
Q-tablo değerleri eylem başına beklenen kümülatif indirgenmiş gelecekteki getirileri doğrudan ifade eder.
Uygun Görevler ve Desteklenen Modaliteler
Uygun Görevler:
reinforcement learningdiscrete control
Desteklenen Modaliteler:
tabular
Uygulayıcı Kütüphaneler
gymnasium
torchrl
Temel Literatür & Yayınlar
Q-learningChristopher J. C. H. Watkins, Peter Dayan (1992) · Machine Learning
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
- Görülmemiş durumlar arasında genelleştirme yapamama; durum değişkenleriyle tablo boyutu üstel büyür
- Maksimum operatörü nedeniyle eylem değerlerinin aşırı tahmin edilmesi
