KV Cache

Türkçe karşılığı: Anahtar-değer önbelleğiAlan: Büyük Dil Modelleri

Autoregressive transformer inference sırasında önceki tokenlara ait key ve value tensörlerinin yeniden hesaplanmaması için saklandığı önbellek.

Anahtar-değer önbelleği (KV cache), otoregresif Transformer çıkarımında geçmiş tokenlara ait key ve value tensörlerini yeniden hesaplamamak için saklayan çıkarım önbelleğidir.

Büyük Dil Modeli Bağlamı

Her yeni token yalnız yeni K/V üretip geçmiş cache ile attention yapabilir; böylece decoding maliyeti ciddi biçimde düşer. Bellek tüketimi layer sayısı, sequence length, batch size, KV head sayısı ve veri tipine bağlı büyür.

Bağlam ve Çıkarım Sınırı

KV cache model ağırlık cache'i değildir. Uzun context ve yüksek concurrency altında bellek kapasitesi throughput'un ana sınırı olabilir.

İlişkili LLM Kavramları

Bellek İçin Yaklaşık Boyut Formülü

Tam boyut model mimarisine bağlıdır; ancak standart causal attention için kaba kapasite hesabı açık yazılabilir. L katman sayısı, H_kv KV head sayısı, T cache'lenen token sayısı, D_h head boyutu, B batch/eşzamanlı sequence sayısı ve s her öğenin bayt büyüklüğü olsun. K ve V birlikte tutulduğu için yalnız tensör verisi yaklaşık olarak:

M_KV ≈ 2 × L × H_kv × T × D_h × B × s

büyür. Bu formül allocator metadata'sı, padding, fragmentation ve başka runtime buffer'larını içermez; kapasite planlamasında alt düzey bir yaklaşık hesap olarak kullanılmalıdır. Grouped-Query Attention ve MQA, H_kv değerini azaltarak cache boyutunu düşürebilir. KV cache'in autoregressive inference'ta geçmiş K/V tensörlerini yeniden kullanma mantığı Hugging Face Transformers belgelerinde doğrudan açıklanır.

İlgili teknik yazı: Yapay Zeka: Felsefe, Kuram ve Uygulama.