Speculative Decoding
Küçük veya daha hızlı bir modelin birden fazla aday token önermesi ve büyük hedef modelin bunları toplu doğrulayarak autoregressive decoding'i hızlandırması.
Büyük Dil Modeli Bağlamı
Kabul edilen tokenlar tek hedef model adımıyla ilerlemeyi artırabilir; hız kazancı draft model maliyeti, acceptance rate ve target kernel verimliliğine bağlıdır.
Bağlam ve Çıkarım Sınırı
Speculative decoding model cevabının semantiğini değiştirmeden hızlandırmayı hedefler; her kombinasyon aynı kazancı sağlamaz ve memory bandwidth sınırı devam edebilir.
İlişkili LLM Kavramları
Kaynak
- https://arxiv.org/abs/2211.17192