Prefix Caching
Aynı prompt prefix'ini paylaşan isteklerde daha önce hesaplanmış KV cache bloklarını yeniden kullanarak prefill hesaplamasını azaltma tekniği.
Teknik Bağlam
System prompt veya ortak uzun context kullanan workload'larda time-to-first-token ve GPU compute maliyetini düşürebilir. Cache key'in tokenizer/model/version bağlamını güvenli temsil etmesi gerekir.
Sınırlar
Semantic olarak benzer prompt'lar aynı prefix cache girdisi değildir; token dizisinin eşleşme koşulu implementasyona bağlıdır.
İlgili Kavramlar
- KV Cache
- Context Window
- Paged Attention
- Cache Stampede