Grouped-Query Attention

Türkçe karşılığı: Gruplandırılmış sorgu attentionAlan: Yapay Zeka

Birden fazla query head'in daha az sayıda key/value head paylaşarak Multi-Head Attention ile Multi-Query Attention arasında memory-bandwidth trade-off sağlayan attention varyantı.

Teknik Bağlam

Inference sırasında KV cache boyutunu ve memory bandwidth'i azaltırken çok başlı representation kapasitesini büyük ölçüde korumayı hedefler.

Sınırlar

GQA ile Mixture of Experts farklı eksenlerde optimizasyondur; GQA attention head paylaşımı, MoE feed-forward expert seçimiyle ilgilidir.

İlgili Kavramlar

  • Multi-Head Attention
  • KV Cache
  • Transformer
  • Memory Bandwidth