Skip to main content

> ML_ALGORITHM // MASKED-LANGUAGE-MODELING_v1.0

Maskelenmiş Dil Modellemesi (MLM / BERT)

Çevreleyen çift yönlü bağlamdan rastgele maskelenmiş belirteçleri tahmin etmek üzere Transformer kodlayıcılarını eğiten çift yönlü temsil öğrenme paradigması.

Denoising Autoencodingself-supervisedblack-boxlarge (>100k)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(epochs * sequences * length^2 * d)
Çıkarım (Inference):O(length^2 * d)
Donanım Karakteristiği
CPU Uygunluğu:Hayır
GPU Zorunluluğu:Evet
Bellek Ayak İzi:high
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:large (>100k)

Açıklanabilirlik Değerlendirmesi

Dikkat haritaları sonradan incelenebilir; dahili çok başlıklı temsiller oldukça dağıtıktır.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
text classificationtoken classificationfeature extraction
Desteklenen Modaliteler:
text

Uygulayıcı Kütüphaneler

TransformersHugging Face · v4.44.2
İncele
PyTorchLinux Foundation / PyTorch Foundation · v2.4.1
İncele
kerashub

Temel Literatür & Yayınlar

BERT: Pre-training of Deep Bidirectional Transformers for Language UnderstandingJacob Devlin, Ming-Wei Chang (2018) · Conference of the North American Chapter of the Association for Computational Linguistics (NAACL)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • [MASK] belirteci ince ayar veya çıkarım sırasında asla görünmez, bu da ön eğitim/ince ayar uyumsuzluğu yaratır
  • Karesel öz dikkat ölçeklemesi özel mimariler olmadan 512 belirtecin ötesine geçmeyi engeller