> ML_LITERATUR_v1.0
Araştırma Literatürü Atlası
Temel istatistiksel öğrenmeden modern akıl yürüten LLM'lere (DeepSeek-R1, Llama 3) uzanan 253 doğrulanmış literatür kaydı: doğrulanmış DOI, arXiv bağlantıları ve orijinal iki dilli sentezler.
GLU Variants Improve Transformer
LLaMA, PaLM ve Mistral dahil modern mimarilerde standart olan SwiGLU aktivasyon fonksiyonlarını kuran temel mimari makalesi.
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
Transformer üstünlüğüne meydan okuyan ve sabit bellek durumlarıyla karesel olmayan uzun bağlam işleme sağlayan dönüm noktası seçici durum uzayı makalesi.
Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality
Durum güncellemelerini ikilik teorisiyle doğrudan GPU Tensor Çekirdeklerine eşleyerek Mamba-1'den 8 kat daha hızlı eğitim sağlayan Mamba-2 makalesi.
RWKV: Reinventing RNNs for the Transformer Era
Tekrarlayan mimarileri %100 doğrusal dikkat karmaşıklığıyla 14B parametreye ölçeklendiren RWKV mimarisini tanıtan temel makale.
Retentive Network: A Successor to Transformer for Large Language Models (RetNet)
Eşzamanlı paralel eğitim, O(1) çıkarım maliyeti ve doğrusal uzun bağlam modellemesi sunan etkili Microsoft Research makalesi.
Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
Büyük ölçekli seyrek uzmanlar karışımı eğitimi için istikrarlı ve düşük iletişimli teknikler kuran dönüm noktası JMLR makalesi.
GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding
Çok dilli çeviriyi 2.048 TPU hızlandırıcısında 600 milyar parametreye ölçeklendiren dönüm noktası Google sistem makalesi.
Code Llama: Open Foundation Models for Code
Açık kod üretimi, Python uzmanlaşması ve talimat ayarlı kod asistanlarını kuran temel Meta teknik raporu.
StarCoder 2 and The Stack v2: The Next Generation
Kurumsal sınıf geliştirici araçları için etik ve şeffaf kod veri setleri ve modelleri kuran BigCode Konsorsiyumu makalesi.
Scaling Laws for Neural Language Models
Yapay sinir ağı ölçekleme yasalarını biçimlendiren ve modern temel model eğitiminde milyarlarca dolarlık hesaplama tahsisine yön veren dönüm noktası OpenAI makalesi.
Deep Reinforcement Learning from Human Preferences
Modern RLHF'yi başlatan ve derin sinir ağlarını insan niyetine hizalamanın matematiksel temelini atan öncü OpenAI / DeepMind makalesi.
Improving Language Understanding by Generative Pre-Training (GPT-1)
Doğal dil işleme için üretici ön eğitim ve ince ayar taslağını kuran orijinal GPT makalesi.
BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension
Metin özetleme ve soyutlayıcı üretim için önde gelen mimariyi kuran dönüm noktası ACL BART makalesi.
PaLM: Scaling Language Modeling with Pathways
Çoklu pod dağıtık eğitimi, SwiGLU aktivasyonunu ve akıl yürütmedeki atılımları detaylandıran PaLM (540B) Google sistem makalesi.
Training data-efficient image transformers & distillation through attention (DeiT)
Yüz milyonlarca görüntülük tescilli eğitim setleri gereksinimini ortadan kaldırarak Vision Transformer'ları demokratikleştiren ICML makalesi.
Robust Speech Recognition via Large-Scale Weak Supervision (Whisper)
Konuşma tanımayı kırılgan akustik modellerden çok dilli transkripsiyon için sağlam bir temel modele dönüştüren Whisper makalesi.
Segment Anything (SAM)
Görüntü segmentasyonu için ilk genel amaçlı görsel temel modeli kuran dönüm noktası ICCV SAM makalesi.
Flow Matching for Generative Modeling
Stable Diffusion 3 ve Flux.1 gibi modern hızlı örnekleme modellerini güçlendiren temel matematiksel formülasyon Akış Eşleştirmeyi (Flow Matching) tanıtan ICLR makalesi.
