> ML_LITERATUR_v1.0
Araştırma Literatürü Atlası
Temel istatistiksel öğrenmeden modern akıl yürüten LLM'lere (DeepSeek-R1, Llama 3) uzanan 253 doğrulanmış literatür kaydı: doğrulanmış DOI, arXiv bağlantıları ve orijinal iki dilli sentezler.
Model Cards for Model Reporting
Hugging Face, Google, Meta ve ISO/IEC yapay zeka yönetişim çerçeveleri tarafından küresel olarak benimsenen Model Kartlarını kuran şeffaflık makalesi.
Constitutional AI: Harmlessness from AI Feedback (RLAIF)
Claude gibi güvenli, yardımcı ve dürüst asistanları güçlendiren temel paradigma olan Anayasal Yapay Zeka ve RLAIF'i kuran Anthropic makalesi.
Extracting Training Data from Large Language Models
Büyük dil modellerinin ezberlenmiş hassas eğitim verilerini sızdırdığını kanıtlayan USENIX Security ödüllü makale.
ImageNet: A Large-Scale Hierarchical Image Database
Yıllık yarışması (ILSVRC) modern derin öğrenmeyi ve GPU hızlandırmasını doğrudan katalizleyen bilgisayar bilimi tarihindeki en etkili veri seti.
GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding
BERT, RoBERTa ve erken dönem ön eğitimli Transformer modellerinin geliştirilmesini ve karşılaştırılmasını sağlayan temel değerlendirme kıyaslaması.
SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems
Gelişmiş temel modellerde dilsel akıl yürütme ve çok cümleli anlama yeteneklerinin titizlikle izlenmesini sağlayan önemli kıyaslama.
Measuring Massive Multitask Language Understanding (MMLU)
Geniş dünya bilgisini ve akademik akıl yürütmeyi ölçmek için her büyük LLM sürümünde kullanılan küresel standart kıyaslama.
Training Verifiers to Solve Math Word Problems (GSM8K)
Düşünce zinciri istemleme ve matematiksel doğrulama için kanıtlama alanı olarak ilkokul matematiğini belirleyen temel akıl yürütme kıyaslaması.
Evaluating Large Language Models Trained on Code (Codex / HumanEval)
Yüzeysel BLEU eşleştirmesi yerine birim test yürütmesi yoluyla kod üretim değerlendirmesini biçimlendiren ve geliştirici yapay zeka araçlarını güçlendiren makale.
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
LLM'lerin karmaşık GitHub sorunlarını çözüp çözemeyeceğini ölçen otonom kodlama ajanları için belirleyici kıyaslama.
Llama 2: Open Foundation and Fine-Tuned Chat Models
2T token ön eğitimi, Grouped-Query Attention (GQA) ve sohbet asistanları için güvenlik ayarlamasını ayrıntılandıran Meta makalesi.
The Llama 3 Herd of Models
Büyük ölçekli GPU küme altyapısını, sentetik veri boru hatlarını ve eğitim sonrası hizalamayı detaylandıran kapsamlı Llama 3 teknik raporu.
Mistral 7B
Karesel altı dikkat belleğiyle verimli uzun bağlam işlemeye öncülük eden ve Mistral 7B'yi lider kompakt açık model yapan makale.
Mixtral of Experts
Tüketici ve bulut donanımlarında açık modeller için yüksek kapasiteli, düşük gecikmeli çıkarımı yaygınlaştıran dönüm noktası seyrek MoE makalesi.
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
Üst düzey kıyaslama verimliliğine ulaşırken düşük rütbeli örtük KV izdüşümleriyle üretim çıkarım bellek ayak izini çarpıcı biçimde azaltan çığır açıcı mimari.
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Grup Göreceli Politika Optimizasyonu (GRPO), soğuk başlangıç damıtması ve tescilli öncü akıl yürütme performansını yakalayan çok aşamalı hizalamayı detaylandıran devrim niteliğindeki 2025 makalesi.
Gemma: Open Models Based on Gemini Research and Technology
Açık kaynaklı geliştirici iş akışlarına öncü araştırma mimarisini ve sorumlu yapay zeka güvenliğini getiren Google açık ağırlık temel yayını.
KTO: Model Alignment as Prospect Theoretic Optimization
Dil modeli hizalamasını davranışsal iktisada (Beklenti Teorisi) dayandıran ve gerçekçi eşleşmemiş geri bildirimlerle DPO performansını yakalayan etkili ICML makalesi.
