Skip to main content

> ML_ARCHITECTURE // CLIP-CONTRASTIVE-DUAL-ENCODER_v1.0

Contrastive Dual-Encoder (CLIP / OpenCLIP / SigLIP)

Görüntüleri ve metinleri simetrik çapraz entropi karşıtsal kaybı ile eğitilmiş paylaşılan normalleştirilmiş gömme uzayına yansıtan ikili kodlayıcı mimarisi; görsel arama ve metin-görüntü koşullandırmasının temelidir.

Multimodal Foundation Modelsimagetext
Tüm Mimarilere Dön

Mimari Özeti ve Temel Özellikler

Görüntüleri ve metinleri simetrik çapraz entropi karşıtsal kaybı ile eğitilmiş paylaşılan normalleştirilmiş gömme uzayına yansıtan ikili kodlayıcı mimarisi; görsel arama ve metin-görüntü koşullandırmasının temelidir.

Uygulayıcı Kütüphaneler

TransformersHugging Face · v4.44.2
İncele
PyTorchLinux Foundation / PyTorch Foundation · v2.4.1
İncele
torchvisionPyTorch Foundation / Meta · v0.19.1
İncele

Temel Literatür (Seminal Papers)

Learning Transferable Visual Models From Natural Language Supervision (CLIP)Alec Radford, Jong Wook Kim (2021) · International Conference on Machine Learning (ICML)
Mimari Kısıtlar ve Sınırlamalar
  • Verimli yürütme için uyumlu derin öğrenme çerçevesi ve donanım hızlandırıcısı gerektirir.