Paged Attention
KV cache bloklarını sanal bellek benzeri sabit boyutlu sayfalarda yöneterek variable-length LLM inference isteklerinde fragmentation ve kopyalama maliyetini azaltan serving tekniği.
ML Sistemleri Bağlamı
Continuous batching ile birlikte yüksek concurrency altında KV cache capacity kullanımını iyileştirebilir ve request admission kararlarını kolaylaştırabilir.
Model ve Servis Sınırı
Paged attention modelin attention matematiğini zorunlu olarak değiştirmez; esas kazanım serving memory management katmanındadır.
İlişkili ML Sistem Kavramları
Sanal Bellek Benzetiminin Karşılığı
PagedAttention'ın asıl fikri attention formülünü değiştirmek değil, her isteğin KV Cache alanını tek büyük bitişik blok olarak ayırma zorunluluğunu kaldırmaktır. Mantıksal KV blokları fiziksel bellek bloklarına eşlenir; böylece değişken uzunluklu isteklerde iç/dış parçalanma ve gereksiz kopyalama azaltılabilir. Aynı yaklaşım belirli prefix durumlarının kontrollü paylaşımına da imkân verebilir.
Bu kazanım serving katmanına aittir. Modelin logits'i veya attention'ın matematiksel anlamı yalnız PagedAttention kullanıldığı için değişmek zorunda değildir. Kwon ve arkadaşlarının vLLM çalışması, kendi deney koşullarında aynı gecikme düzeyinde önceki sistemlere göre 2–4× throughput artışı raporlar; bu sayı evrensel bir katsayı değil, çalışmanın donanım/model/iş yükü bağlamındaki sonucudur. Kaynak: PagedAttention makalesi.