Quantization
Model ağırlıklarını, aktivasyonları veya vektörleri daha düşük hassasiyetli sayısal gösterime dönüştürerek bellek ve hesap maliyetini azaltma.
Teknik Bağlam
FP32'den BF16, FP16, INT8 veya daha düşük formatlara geçiş memory bandwidth ve accelerator throughput avantajı sağlayabilir. Calibration, per-channel scale ve quantization-aware training kalite kaybını etkiler.
Sınırlar
Quantization yalnız dosya boyutu küçültme değildir; kernel desteği, accumulator hassasiyeti ve outlier dağılımı gerçek hız kazancını belirler.
İlgili Kavramlar
- BF16
- INT8
- Inference
- Product Quantization