Skip to main content

> ML_LITERATURE // RADFORD-2021-LEARNING-TRANSFERABLE-VISUAL-MODELS-NATURAL-LANGUAGE-SUPERVISION_v1.0

Learning Transferable Visual Models From Natural Language Supervision (CLIP)

Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, Ilya Sutskever · International Conference on Machine Learning (ICML) (2021)

seminal-architecture2021foundationalthirdPartyReproduced

Temel Katkı (Principal Contribution)

Simetrik InfoNCE karşıtsal kaybıyla 400M internet görüntü-metin çifti üzerinde çift kodlayıcıları önceden eğiterek sağlam sıfır vuruşlu sınıflandırmayı açığa çıkardı.

Operasyonel ve Mühendislik Uygunluğu

Stable Diffusion, Midjourney, vektör çok modlu arama ve sıfır vuruşlu görüntü sınıflandırmasını güçlendiren evrensel görsel-dil köprüsü.

Temel Varsayımlar (Assumptions)

  • Doğal dil açıklamaları görsel kavramları paylaşılan bir gömme uzayına eşleyen zengin ve ölçeklenebilir anlamsal denetim sağlar

Kısıtlar ve Sınırlamalar (Limitations)

  • Zayıf bileşimsel bağlama ve uzamsal sayma; metin etiketlerinin görsel içeriği geçersiz kıldığı tipografik çekişmeli saldırılara karşı savunmasızlık

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: