Skip to main content

> ML_DATASET // OPENASSISTANT-CONVERSATIONS_v1.0

OpenAssistant Conversations (OASST1)

LAION / Large-scale AI Open Network (Köpf et al. 2023) · Instruction Tuning & Conversational RLHF · 161,443 messages in 66,497 conversation trees across 35 languages (13,500+ volunteer contributors)

Instruction Tuning & Conversational RLHFApache-2.0161,443 messages in 66,497 conversation trees across 35 languages (13,500+ volunteer contributors)open

Veri Profili ve Özellikler

Etiket Tipi:Human ratings across quality, helpfulness, humor, toxicity, and role labels
Diller:en, es, de, fr, ru, zh, tr
Lisans Seviyesi:permissive-open-source
Modaliteler:text

Amaçlanan Kullanım (Intended Use)

  • Açık ağırlıklı sohbet asistanları için talimat ayarlama ve ödül modeli eğitimi

Yasaklanan / Kaçınılması Gereken Kullanım

  • Klinik inceleme olmaksızın tıbbi tanı asistanı eğitimi

Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi

Kişisel Veri Riskleri (Privacy Risks):

Topluluk moderasyonu tarafından kişisel veriler için incelenmiş kitle kaynaklı gönüllü katkıları.

Bilinen Önyargılar (Known Bias):

Gönüllü katkıcı demografisi yanlılığı; çeşitli üslup farklılıkları.

Veri Sızıntısı Riski (Known Leakage):

Konuşma ağaçları eğitim ve doğrulama setleri arasında kesin olarak ayrılmıştır.

Uyumlu Araçlar ve Kütüphaneler