Paged Attention
KV cache bloklarını sanal bellek benzeri sabit boyutlu sayfalarda yöneterek variable-length LLM inference isteklerinde fragmentation ve kopyalama maliyetini azaltan serving tekniği.
Teknik Bağlam
Continuous batching ile birlikte yüksek concurrency altında KV cache capacity kullanımını iyileştirebilir ve request admission kararlarını kolaylaştırabilir.
Sınırlar
Paged attention modelin attention matematiğini zorunlu olarak değiştirmez; esas kazanım serving memory management katmanındadır.
İlgili Kavramlar
- KV Cache
- Continuous Batching
- Memory Bandwidth
- Admission Control