KV Cache

Türkçe karşılığı: Anahtar-değer önbelleğiAlan: Büyük Dil Modelleri

Autoregressive transformer inference sırasında önceki tokenlara ait key ve value tensörlerinin yeniden hesaplanmaması için saklandığı önbellek.

Teknik Bağlam

Her yeni token yalnız yeni K/V üretip geçmiş cache ile attention yapabilir; böylece decoding maliyeti ciddi biçimde düşer. Bellek tüketimi layer sayısı, sequence length, batch size, KV head sayısı ve veri tipine bağlı büyür.

Sınırlar

KV cache model ağırlık cache'i değildir. Uzun context ve yüksek concurrency altında bellek kapasitesi throughput'un ana sınırı olabilir.

İlgili Kavramlar

  • Context Window
  • Multi-Head Attention
  • Speculative Decoding
  • Quantization