Skip to main content

> ML_ALGORITHM // CONTRASTIVE-LANGUAGE-IMAGE-PRETRAINING-CLIP_v1.0

Karşıtsal Dil-Görüntü Ön Eğitimi (CLIP)

Metin ve görsel kavramları sıfır vuruşlu görevler için paylaşılan bir gömme uzayına eşleyen, karşıtsal kayıpla eğitilmiş çift kodlayıcı temel model.

Multimodal Contrastive Learningself-supervisedmoderate-posthocmassive (>10M)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(epochs * batch_size^2 * (text_enc + vision_enc))
Çıkarım (Inference):O(text_enc + vision_enc)
Donanım Karakteristiği
CPU Uygunluğu:Hayır
GPU Zorunluluğu:Evet
Bellek Ayak İzi:high
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:moderate-posthoc
Eğitim Verisi İhtiyacı:massive (>10M)

Açıklanabilirlik Değerlendirmesi

Özel eğitim başlıkları olmadan doğal dil istemi kosinüs benzerliği yoluyla sıfır vuruşlu (zero-shot) sınıflandırmayı mümkün kılar.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
zero shot classificationimage text retrievalfeature extraction
Desteklenen Modaliteler:
imagetextmultimodal

Uygulayıcı Kütüphaneler

TransformersHugging Face · v4.44.2
İncele
open-clip
PyTorchLinux Foundation / PyTorch Foundation · v2.4.1
İncele

Temel Literatür & Yayınlar

Learning Transferable Visual Models From Natural Language Supervision (CLIP)Alec Radford, Jong Wook Kim (2021) · International Conference on Machine Learning (ICML)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • Zayıf bileşimsel akıl yürütme ("mavi küre üzerinde kırmızı küp" ile "kırmızı küre üzerinde mavi küp" ayrımında zorlanır)
  • Karmaşık sahnelerde zayıf sayma ve uzamsal nitelik kavrayışı