KV Cache
Autoregressive transformer inference sırasında önceki tokenlara ait key ve value tensörlerinin yeniden hesaplanmaması için saklandığı önbellek.
Teknik Bağlam
Her yeni token yalnız yeni K/V üretip geçmiş cache ile attention yapabilir; böylece decoding maliyeti ciddi biçimde düşer. Bellek tüketimi layer sayısı, sequence length, batch size, KV head sayısı ve veri tipine bağlı büyür.
Sınırlar
KV cache model ağırlık cache'i değildir. Uzun context ve yüksek concurrency altında bellek kapasitesi throughput'un ana sınırı olabilir.
İlgili Kavramlar
- Context Window
- Multi-Head Attention
- Speculative Decoding
- Quantization