> ML_LITERATUR_v1.0
Araştırma Literatürü Atlası
Temel istatistiksel öğrenmeden modern akıl yürüten LLM'lere (DeepSeek-R1, Llama 3) uzanan 253 doğrulanmış literatür kaydı: doğrulanmış DOI, arXiv bağlantıları ve orijinal iki dilli sentezler.
TruthfulQA: Measuring How Models Mimic Human Falsehoods
Açıkça hizalanmadıkça daha büyük modellerin genellikle daha az doğru olduğunu kanıtlayan ve halüsinasyonu ölçen birincil ACL kıyaslaması.
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
Öncü LLM'ler için insan kör tercih savaşlarını kesin kıyaslama olarak belirleyen üretici yapay zeka çağının en etkili ampirik kıyaslaması.
Q-learning
Bilgisayar bilimlerinde temel modelsiz politika dışı pekiştirmeli öğrenme algoritması olan Q-öğrenmeyi tanıtan çığır açıcı makale.
Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning (REINFORCE)
Modern derin pekiştirmeli öğrenmenin (PPO, TRPO, RLHF) teorik temelini oluşturan politika gradyanı yöntemlerini kuran temel makale.
Human-level control through deep reinforcement learning (Nature DQN)
Derin pekiştirmeli öğrenme alanını başlatan, derin evrişimli ağları dinamik programlamayla birleştiren tarihi Nature kapak makalesi.
Deep Reinforcement Learning with Double Q-learning (Double DQN)
Derin Q ağlarında aşırı değer tahminini çözen, karmaşık ortamlarda kararlılığı ve skor performansını artıran dönüm noktası AAAI makalesi.
Trust Region Policy Optimization (TRPO)
Sürekli kontrol robotiğinde yıkıcı adım boyutu çöküşünü çözen Trust Region Policy Optimization (TRPO) makalesi.
Addressing Function Approximation Error in Actor-Critic Methods (TD3)
Aktör-eleştirmen mimarilerindeki aşırı tahmin yanlılığını çözen ve robotik simülasyonda standart olan TD3'ü kuran temel ICML makalesi.
Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm (AlphaZero)
Tek bir genel amaçlı pekiştirmeli öğrenme algoritmasının birden çok karmaşık stratejik alanda sıfırdan insanüstü uzmanlığa ulaşabileceğini kanıtlayan çığır açıcı Science makalesi.
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
İnsan gösterimlerinden çevik robot manipülasyonu eğitimi için lider paradigma olan Diffusion Policy'yi kuran dönüm noktası RSS robotik makalesi.
Prioritized Experience Replay (PER)
DQN ve politika dışı aktör-eleştirmen mimarilerinde standart olan Önceliklendirilmiş Deneyim Yeniden Oynatmayı (PER) tanıtan ICLR makalesi.
Dueling Network Architectures for Deep Reinforcement Learning (Dueling DQN)
ICML 2016 En İyi Makale Ödülü kazananı, her durum için her eylemin etkisini öğrenmek zorunda kalmadan hangi durumların değerli olduğunu öğrenen Dueling DQN makalesi.
Asynchronous Methods for Deep Reinforcement Learning (A3C)
Çok çekirdekli standart CPU'larda doğrudan yüksek performanslı derin pekiştirmeli öğrenmeyi mümkün kılan dönüm noktası A3C/A2C makalesi.
Continuous control with deep reinforcement learning (DDPG)
Derin pekiştirmeli öğrenmenin fizik simülatörlerinde 20'den fazla sürekli fiziksel kontrol görevini çözmesini sağlayan dönüm noktası DDPG makalesi.
Hindsight Experience Replay (HER)
Ödül şekillendirmesi olmadan robotların itme, kaydırma ve yerleştirme görevlerini öğrenmesini sağlayan OpenAI HER makalesi.
Rainbow: Combining Improvements in Deep Reinforcement Learning
Ayrık derin pekiştirmeli öğrenmede örneklem verimliliğini ve skor sınırlarını nelerin yönlendirdiğine dair kapsamlı ablasyon sunan Rainbow makalesi.
Outracing champion Gran Turismo drivers with deep reinforcement learning (GT Sophy)
Gerçek zamanlı araç dinamiklerini, lastik sürtünme fiziğini ve yüksek hızlı taktiksel kuralları çözen tarihi Nature kapak makalesi.
RT-1: Robotics Transformer for Real-World Control at Scale
Büyük ölçekli çok görevli Transformer modellerinin yeni görevlere, ortamlara ve nesnelere sağlam biçimde genellendiğini gösteren robotik makalesi.
