INT8
Model ağırlık veya aktivasyonlarını 8 bit integer gösterime eşleyerek hesaplama ve bellek maliyetini azaltan inference tekniği.
Teknik Bağlam
Scale ve zero-point gibi parametrelerle gerçek değer aralığı integer koda eşlenir. Matmul kernel'leri INT8 dot-product talimatlarından yararlanabilir.
Sınırlar
Outlier ağırlık/aktivasyonlar quantization error oluşturabilir; per-channel veya mixed precision stratejileri gerekebilir.
İlgili Kavramlar
- Quantization
- BF16
- Calibration
- Inference