Quantization

Türkçe karşılığı: NicemlemeAlan: Makine Öğrenmesi

Model ağırlıklarını, aktivasyonları veya vektörleri daha düşük hassasiyetli sayısal gösterime dönüştürerek bellek ve hesap maliyetini azaltma.

Teknik Bağlam

FP32'den BF16, FP16, INT8 veya daha düşük formatlara geçiş memory bandwidth ve accelerator throughput avantajı sağlayabilir. Calibration, per-channel scale ve quantization-aware training kalite kaybını etkiler.

Sınırlar

Quantization yalnız dosya boyutu küçültme değildir; kernel desteği, accumulator hassasiyeti ve outlier dağılımı gerçek hız kazancını belirler.

İlgili Kavramlar

  • BF16
  • INT8
  • Inference
  • Product Quantization