Skip to main content

> ML_KUTUPHANE // TRL_v1.0

TRL

Hugging Face — Eğitim sonrası uyumlandırma için Transformer Pekiştirmeli Öğrenme kütüphanesi.

nlp-llmv0.10.1Apache-2.0qualified

Model Eğitimi (Training)

Destekleniyor
Desteklenen Hızlandırıcılar:
CPUCUDAROCMMPS
Dağıtık Eğitim (Distributed):Evet

Model Sunumu (Inference)

Destekleniyor
Inference Hızlandırıcıları:
CPUCUDAROCMMPS
Hedef Ortamlar (Targets):server

Neleri Sağlar (Ne Yapar)

  • +Uçtan uca eğitim sonrası uyumlandırma (SFTTrainer, DPOTrainer, ORPOTrainer, PPOTrainer)
  • +Ayrı bir ödül modeli eğitmeden Doğrudan Tercih Optimizasyonu (DPO)
  • +DeepSpeed, FSDP ve PEFT ile doğrudan entegrasyon (QLoRA + DPO)

Neleri Sağlamaz (Ne Yapmaz)

  • -Düşük gecikmeli canlı çıkarım token'ları sunma
  • -Temel modelleri sıfırdan ön eğitme
  • -PyTorch ekosistemi dışında çalışma

>Uygun İş Tipleri

  • Büyük dil modellerini insan tercihleriyle uyumlandırma (DPO/RLHF)
  • SFTTrainer ile kurumsal sohbet robotlarına talimat ince ayarı yapma
  • Model tonunu, güvenlik bariyerlerini ve kurumsal kişiliği şekillendirme

>Uygun Olmayan İş Tipleri

  • 100B+ temel modellerin ham ön eğitimi
  • Tablo karar ağacı toplulukları
Veri Yerleşimi ve İkameti

Süreç içi GPU küme belleği.

Güvenlik Değerlendirmesi

Tercih verileri gizli kurumsal istem geri bildirimlerinden arındırılmalıdır.

Operasyonel Metrikler ve Bilinen Kısıtlar

Olgunluk:mature
Öğrenme Eğrisi:moderate
Operasyon Yükü:moderate
Maliyet Seviyesi:medium
> Bilinen Kısıtlamalar:
  • PPO pekiştirmeli öğrenme eğitimi bilindiği üzere kararsızdır ve hiperparametrelere çok duyarlıdır (DPO tercih edilir).
  • Seçilen ve reddedilen ikili yanıtları eğitirken yüksek GPU VRAM gerektirir.

İlişkili Üretim Arıza Paternleri (Incidentpedia)

Bu kütüphaneyi üretimde kullanırken aşağıdaki arıza senaryolarına karşı fail-closed korumalar uygulayın:

> Birincil Kanıt ve Doğrulama Kaynakları

TRL Documentationofficial-docs • >=0.8.0, <=0.10.x
2026-09-25HIGH