Paged Attention

Türkçe karşılığı: Sayfalı attentionAlan: Makine Öğrenmesi Sistemleri

KV cache bloklarını sanal bellek benzeri sabit boyutlu sayfalarda yöneterek variable-length LLM inference isteklerinde fragmentation ve kopyalama maliyetini azaltan serving tekniği.

Teknik Bağlam

Continuous batching ile birlikte yüksek concurrency altında KV cache capacity kullanımını iyileştirebilir ve request admission kararlarını kolaylaştırabilir.

Sınırlar

Paged attention modelin attention matematiğini zorunlu olarak değiştirmez; esas kazanım serving memory management katmanındadır.

İlgili Kavramlar

  • KV Cache
  • Continuous Batching
  • Memory Bandwidth
  • Admission Control