> ML_LITERATURE // FRANTAR-2022-GPTQ-ACCURATE-POST-TRAINING-QUANTIZATION_v1.0
GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
Elias Frantar, Saleh Ashkboos, Torsten Hoefler, Dan Alistarh · International Conference on Learning Representations (ICLR) (2022)
algorithm2022industry-standardthirdPartyReproduced
Temel Katkı (Principal Contribution)
Ters Hessian matrisi güncellemelerine dayalı ikinci derece hata telafisi algoritması geliştirerek 175B parametreli modelleri yaklaşık 4 GPU saatinde 3-bit veya 4-bit ağırlıklara kuantaladı.
Operasyonel ve Mühendislik Uygunluğu
task-text-generation için mimari kararları, hizalama stratejisini ve sunum altyapısını doğrudan yönlendirir.
Temel Varsayımlar (Assumptions)
- Ampirik dağılım düzenliliği geçerlidir ve hedef alan ön eğitim dilsel/görsel desteğine uygundur
Kısıtlar ve Sınırlamalar (Limitations)
- Kaynak ölçekleme, çıkarım bellek gereksinimleri ve hizalama sağlamlığı model boyutuna ve donanım topolojisine göre değişir
Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler
İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler:
