Grouped-Query Attention
Birden fazla query head'in daha az sayıda key/value head paylaşarak Multi-Head Attention ile Multi-Query Attention arasında memory-bandwidth trade-off sağlayan attention varyantı.
Teknik Bağlam
Inference sırasında KV cache boyutunu ve memory bandwidth'i azaltırken çok başlı representation kapasitesini büyük ölçüde korumayı hedefler.
Sınırlar
GQA ile Mixture of Experts farklı eksenlerde optimizasyondur; GQA attention head paylaşımı, MoE feed-forward expert seçimiyle ilgilidir.
İlgili Kavramlar
- Multi-Head Attention
- KV Cache
- Transformer
- Memory Bandwidth