Skip to main content

> ML_LITERATUR_v1.0

Araştırma Literatürü Atlası

Temel istatistiksel öğrenmeden modern akıl yürüten LLM'lere (DeepSeek-R1, Llama 3) uzanan 253 doğrulanmış literatür kaydı: doğrulanmış DOI, arXiv bağlantıları ve orijinal iki dilli sentezler.

Toplam 253 Doğrulanmış Kayıt (Sayfa 12 / 15)Doğrulanmış Akademik Kanıtlar
Literatür Kaydı
2022 · Annualbenchmark

TruthfulQA: Measuring How Models Mimic Human Falsehoods

Açıkça hizalanmadıkça daha büyük modellerin genellikle daha az doğru olduğunu kanıtlayan ve halüsinasyonu ölçen birincil ACL kıyaslaması.

question answering
Literatür Kaydı
2023 · Advancesbenchmark

Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Öncü LLM'ler için insan kör tercih savaşlarını kesin kıyaslama olarak belirleyen üretici yapay zeka çağının en etkili ampirik kıyaslaması.

text generationmodel evaluation
Literatür Kaydı
1992 · Machinefoundational

Q-learning

Bilgisayar bilimlerinde temel modelsiz politika dışı pekiştirmeli öğrenme algoritması olan Q-öğrenmeyi tanıtan çığır açıcı makale.

reinforcement learning
Literatür Kaydı
1992 · Machinefoundational

Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning (REINFORCE)

Modern derin pekiştirmeli öğrenmenin (PPO, TRPO, RLHF) teorik temelini oluşturan politika gradyanı yöntemlerini kuran temel makale.

reinforcement learning
Literatür Kaydı
2015 · Natureseminal-architecture

Human-level control through deep reinforcement learning (Nature DQN)

Derin pekiştirmeli öğrenme alanını başlatan, derin evrişimli ağları dinamik programlamayla birleştiren tarihi Nature kapak makalesi.

reinforcement learning
Literatür Kaydı
2016 · AAAIalgorithm

Deep Reinforcement Learning with Double Q-learning (Double DQN)

Derin Q ağlarında aşırı değer tahminini çözen, karmaşık ortamlarda kararlılığı ve skor performansını artıran dönüm noktası AAAI makalesi.

reinforcement learning
Literatür Kaydı
2015 · Internationalalgorithm

Trust Region Policy Optimization (TRPO)

Sürekli kontrol robotiğinde yıkıcı adım boyutu çöküşünü çözen Trust Region Policy Optimization (TRPO) makalesi.

reinforcement learning
Literatür Kaydı
2018 · Internationalalgorithm

Addressing Function Approximation Error in Actor-Critic Methods (TD3)

Aktör-eleştirmen mimarilerindeki aşırı tahmin yanlılığını çözen ve robotik simülasyonda standart olan TD3'ü kuran temel ICML makalesi.

reinforcement learningcontinuous control
Literatür Kaydı
2017 · Scienceseminal-architecture

Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm (AlphaZero)

Tek bir genel amaçlı pekiştirmeli öğrenme algoritmasının birden çok karmaşık stratejik alanda sıfırdan insanüstü uzmanlığa ulaşabileceğini kanıtlayan çığır açıcı Science makalesi.

game playing
Literatür Kaydı
2023 · Robotics:algorithm

Diffusion Policy: Visuomotor Policy Learning via Action Diffusion

İnsan gösterimlerinden çevik robot manipülasyonu eğitimi için lider paradigma olan Diffusion Policy'yi kuran dönüm noktası RSS robotik makalesi.

continuous controlrobotics
Literatür Kaydı
2016 · Internationalalgorithm

Prioritized Experience Replay (PER)

DQN ve politika dışı aktör-eleştirmen mimarilerinde standart olan Önceliklendirilmiş Deneyim Yeniden Oynatmayı (PER) tanıtan ICLR makalesi.

reinforcement learning
Literatür Kaydı
2016 · Internationalseminal-architecture

Dueling Network Architectures for Deep Reinforcement Learning (Dueling DQN)

ICML 2016 En İyi Makale Ödülü kazananı, her durum için her eylemin etkisini öğrenmek zorunda kalmadan hangi durumların değerli olduğunu öğrenen Dueling DQN makalesi.

reinforcement learning
Literatür Kaydı
2016 · Internationalalgorithm

Asynchronous Methods for Deep Reinforcement Learning (A3C)

Çok çekirdekli standart CPU'larda doğrudan yüksek performanslı derin pekiştirmeli öğrenmeyi mümkün kılan dönüm noktası A3C/A2C makalesi.

reinforcement learning
Literatür Kaydı
2016 · Internationalalgorithm

Continuous control with deep reinforcement learning (DDPG)

Derin pekiştirmeli öğrenmenin fizik simülatörlerinde 20'den fazla sürekli fiziksel kontrol görevini çözmesini sağlayan dönüm noktası DDPG makalesi.

reinforcement learningcontinuous control
Literatür Kaydı
2017 · Advancesalgorithm

Hindsight Experience Replay (HER)

Ödül şekillendirmesi olmadan robotların itme, kaydırma ve yerleştirme görevlerini öğrenmesini sağlayan OpenAI HER makalesi.

reinforcement learningrobotics
Literatür Kaydı
2018 · AAAIseminal-architecture

Rainbow: Combining Improvements in Deep Reinforcement Learning

Ayrık derin pekiştirmeli öğrenmede örneklem verimliliğini ve skor sınırlarını nelerin yönlendirdiğine dair kapsamlı ablasyon sunan Rainbow makalesi.

reinforcement learning
Literatür Kaydı
2022 · Natureseminal-architecture

Outracing champion Gran Turismo drivers with deep reinforcement learning (GT Sophy)

Gerçek zamanlı araç dinamiklerini, lastik sürtünme fiziğini ve yüksek hızlı taktiksel kuralları çözen tarihi Nature kapak makalesi.

game playingcontinuous control
Literatür Kaydı
2022 · Robotics:seminal-architecture

RT-1: Robotics Transformer for Real-World Control at Scale

Büyük ölçekli çok görevli Transformer modellerinin yeni görevlere, ortamlara ve nesnelere sağlam biçimde genellendiğini gösteren robotik makalesi.

roboticscontinuous control
Toplam 253 Literatür Kaydı arasından 199–216 gösteriliyor