Speculative Decoding

Türkçe karşılığı: Spekülatif çözümlemeAlan: Büyük Dil Modelleri

Küçük veya daha hızlı bir modelin birden fazla aday token önermesi ve büyük hedef modelin bunları toplu doğrulayarak autoregressive decoding'i hızlandırması.

Teknik Bağlam

Kabul edilen tokenlar tek hedef model adımıyla ilerlemeyi artırabilir; hız kazancı draft model maliyeti, acceptance rate ve target kernel verimliliğine bağlıdır.

Sınırlar

Speculative decoding model cevabının semantiğini değiştirmeden hızlandırmayı hedefler; her kombinasyon aynı kazancı sağlamaz ve memory bandwidth sınırı devam edebilir.

İlgili Kavramlar

  • KV Cache
  • Inference
  • Latency
  • Autoregressive Model

Kaynak

  • https://arxiv.org/abs/2211.17192