Quantization
Model ağırlıklarını, aktivasyonları veya vektörleri daha düşük hassasiyetli sayısal gösterime dönüştürerek bellek ve hesap maliyetini azaltma.
Makine Öğrenmesi Bağlamı
FP32'den BF16, FP16, INT8 veya daha düşük formatlara geçiş memory bandwidth ve accelerator throughput avantajı sağlayabilir. Calibration, per-channel scale ve quantization-aware training kalite kaybını etkiler.
Genelleme ve Ölçüm Sınırı
Quantization yalnız dosya boyutu küçültme değildir; kernel desteği, accumulator hassasiyeti ve outlier dağılımı gerçek hız kazancını belirler.
İlişkili Makine Öğrenmesi Kavramları
- BF16
- INT8
- Inference
- Product Quantization
İlgili teknik yazı: Yapay Zeka: Felsefe, Kuram ve Uygulama.
Doğrudan kaynak: Quantization için kullanılan teknik dayanak yukarıdaki birincil çalışma veya resmî belirtimdir.