Speculative Decoding
Küçük veya daha hızlı bir modelin birden fazla aday token önermesi ve büyük hedef modelin bunları toplu doğrulayarak autoregressive decoding'i hızlandırması.
Teknik Bağlam
Kabul edilen tokenlar tek hedef model adımıyla ilerlemeyi artırabilir; hız kazancı draft model maliyeti, acceptance rate ve target kernel verimliliğine bağlıdır.
Sınırlar
Speculative decoding model cevabının semantiğini değiştirmeden hızlandırmayı hedefler; her kombinasyon aynı kazancı sağlamaz ve memory bandwidth sınırı devam edebilir.
İlgili Kavramlar
- KV Cache
- Inference
- Latency
- Autoregressive Model
Kaynak
- https://arxiv.org/abs/2211.17192