> ML_KUTUPHANE // TRL_v1.0
TRL
Hugging Face — Eğitim sonrası uyumlandırma için Transformer Pekiştirmeli Öğrenme kütüphanesi.
nlp-llmv0.10.1Apache-2.0qualified
Model Eğitimi (Training)
Desteklenen Hızlandırıcılar:
CPUCUDAROCMMPS
Dağıtık Eğitim (Distributed):Evet
Model Sunumu (Inference)
Inference Hızlandırıcıları:
CPUCUDAROCMMPS
Hedef Ortamlar (Targets):server
Neleri Sağlar (Ne Yapar)
- +Uçtan uca eğitim sonrası uyumlandırma (SFTTrainer, DPOTrainer, ORPOTrainer, PPOTrainer)
- +Ayrı bir ödül modeli eğitmeden Doğrudan Tercih Optimizasyonu (DPO)
- +DeepSpeed, FSDP ve PEFT ile doğrudan entegrasyon (QLoRA + DPO)
Neleri Sağlamaz (Ne Yapmaz)
- -Düşük gecikmeli canlı çıkarım token'ları sunma
- -Temel modelleri sıfırdan ön eğitme
- -PyTorch ekosistemi dışında çalışma
>Uygun İş Tipleri
- Büyük dil modellerini insan tercihleriyle uyumlandırma (DPO/RLHF)
- SFTTrainer ile kurumsal sohbet robotlarına talimat ince ayarı yapma
- Model tonunu, güvenlik bariyerlerini ve kurumsal kişiliği şekillendirme
>Uygun Olmayan İş Tipleri
- 100B+ temel modellerin ham ön eğitimi
- Tablo karar ağacı toplulukları
Veri Yerleşimi ve İkameti
Süreç içi GPU küme belleği.
Güvenlik Değerlendirmesi
Tercih verileri gizli kurumsal istem geri bildirimlerinden arındırılmalıdır.
Operasyonel Metrikler ve Bilinen Kısıtlar
Olgunluk:mature
Öğrenme Eğrisi:moderate
Operasyon Yükü:moderate
Maliyet Seviyesi:medium
> Bilinen Kısıtlamalar:
- PPO pekiştirmeli öğrenme eğitimi bilindiği üzere kararsızdır ve hiperparametrelere çok duyarlıdır (DPO tercih edilir).
- Seçilen ve reddedilen ikili yanıtları eğitirken yüksek GPU VRAM gerektirir.
İlişkili Üretim Arıza Paternleri (Incidentpedia)
Bu kütüphaneyi üretimde kullanırken aşağıdaki arıza senaryolarına karşı fail-closed korumalar uygulayın:
> Birincil Kanıt ve Doğrulama Kaynakları
TRL Documentationofficial-docs • >=0.8.0, <=0.10.x
2026-09-25HIGH
