> ML_ALGORITHM // CONTRASTIVE-LANGUAGE-IMAGE-PRETRAINING-CLIP_v1.0
Karşıtsal Dil-Görüntü Ön Eğitimi (CLIP)
Metin ve görsel kavramları sıfır vuruşlu görevler için paylaşılan bir gömme uzayına eşleyen, karşıtsal kayıpla eğitilmiş çift kodlayıcı temel model.
Multimodal Contrastive Learningself-supervisedmoderate-posthocmassive (>10M)
Tüm Algoritmalara DönHesaplama Karmaşıklığı
Eğitim (Training):O(epochs * batch_size^2 * (text_enc + vision_enc))
Çıkarım (Inference):O(text_enc + vision_enc)
Donanım Karakteristiği
CPU Uygunluğu:Hayır
GPU Zorunluluğu:Evet
Bellek Ayak İzi:high
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:moderate-posthoc
Eğitim Verisi İhtiyacı:massive (>10M)
Açıklanabilirlik Değerlendirmesi
Özel eğitim başlıkları olmadan doğal dil istemi kosinüs benzerliği yoluyla sıfır vuruşlu (zero-shot) sınıflandırmayı mümkün kılar.
Uygun Görevler ve Desteklenen Modaliteler
Uygun Görevler:
zero shot classificationimage text retrievalfeature extraction
Desteklenen Modaliteler:
imagetextmultimodal
Uygulayıcı Kütüphaneler
Temel Literatür & Yayınlar
Learning Transferable Visual Models From Natural Language Supervision (CLIP)Alec Radford, Jong Wook Kim (2021) · International Conference on Machine Learning (ICML)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
- Zayıf bileşimsel akıl yürütme ("mavi küre üzerinde kırmızı küp" ile "kırmızı küre üzerinde mavi küp" ayrımında zorlanır)
- Karmaşık sahnelerde zayıf sayma ve uzamsal nitelik kavrayışı
