> ML_LITERATURE // LIU-2023-VISUAL-INSTRUCTION-TUNING-LLAVA_v1.0
Visual Instruction Tuning (LLaVA)
Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee · Advances in Neural Information Processing Systems (NeurIPS) (2023)
seminal-architecture2023industry-standardthirdPartyReproduced
Temel Katkı (Principal Contribution)
GPT-4 tarafından üretilen çok modlu talimat izleme konuşmaları üzerinde eğitilen basit bir doğrusal projeksiyon matrisi aracılığıyla bir CLIP görsel kodlayıcısını Vicuna LLM'e bağladı.
Operasyonel ve Mühendislik Uygunluğu
Üretim sistemlerinde task-multimodal, task-question-answering uygulaması için yetkili referans olarak hizmet eder.
Temel Varsayımlar (Assumptions)
- Temel uzamsal-zamansal süreklilik ve alan dağılımsal kararlılığı geçerlidir
Kısıtlar ve Sınırlamalar (Limitations)
- Performans ölçekleme ve hesaplama ayak izi algılama alanı derinliğine, dizi uzunluğuna ve çözünürlüğe bağlıdır
Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler
İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler:
