> ML_DATASET // OPENASSISTANT-CONVERSATIONS_v1.0
OpenAssistant Conversations (OASST1)
LAION / Large-scale AI Open Network (Köpf et al. 2023) · Instruction Tuning & Conversational RLHF · 161,443 messages in 66,497 conversation trees across 35 languages (13,500+ volunteer contributors)
Instruction Tuning & Conversational RLHFApache-2.0161,443 messages in 66,497 conversation trees across 35 languages (13,500+ volunteer contributors)open
Veri Profili ve Özellikler
Etiket Tipi:Human ratings across quality, helpfulness, humor, toxicity, and role labels
Diller:en, es, de, fr, ru, zh, tr
Lisans Seviyesi:permissive-open-source
Modaliteler:text
Amaçlanan Kullanım (Intended Use)
- Açık ağırlıklı sohbet asistanları için talimat ayarlama ve ödül modeli eğitimi
Yasaklanan / Kaçınılması Gereken Kullanım
- Klinik inceleme olmaksızın tıbbi tanı asistanı eğitimi
Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi
Kişisel Veri Riskleri (Privacy Risks):
Topluluk moderasyonu tarafından kişisel veriler için incelenmiş kitle kaynaklı gönüllü katkıları.
Bilinen Önyargılar (Known Bias):
Gönüllü katkıcı demografisi yanlılığı; çeşitli üslup farklılıkları.
Veri Sızıntısı Riski (Known Leakage):
Konuşma ağaçları eğitim ve doğrulama setleri arasında kesin olarak ayrılmıştır.
