Continuous Batching
LLM inference scheduler'ın tamamlanmış sequence'leri batch'ten çıkarıp yeni istekleri decode döngüsüne dinamik olarak ekleyebildiği batching yaklaşımı.
Teknik Bağlam
Request uzunlukları heterojen olduğunda static batch'in en uzun sequence'i bekleme problemini azaltır. Throughput, time-to-first-token ve inter-token latency arasında scheduler trade-off'u oluşturur.
Sınırlar
Batch'i büyütmek her zaman latency'yi iyileştirmez; queueing ve KV cache kapasitesi birlikte sınır koyar.
İlgili Kavramlar
- Paged Attention
- KV Cache
- Throughput
- Tail Latency