Grouped-Query Attention
Gruplandırılmış sorgu attention (Grouped-Query Attention) — Birden fazla query head'in daha az sayıda key/value head paylaşarak Multi-Head Attention ile Multi-Query Attention arasında memory-bandwidth trade-off sağlayan attention varyantı.
Yapay Zekâ Bağlamı
Inference sırasında KV cache boyutunu ve memory bandwidth'i azaltırken çok başlı representation kapasitesini büyük ölçüde korumayı hedefler.
Model ve Karar Sınırı
GQA ile Mixture of Experts farklı eksenlerde optimizasyondur; GQA attention head paylaşımı, MoE feed-forward expert seçimiyle ilgilidir.
İlişkili Yapay Zekâ Kavramları
MHA ile MQA Arasındaki Yapısal Sınır
GQA'yı yalnız "daha az KV head" olarak değil, iki uç arasındaki yapısal ara nokta olarak okumak daha açıklayıcıdır. H_q query head sayısı ve H_kv key/value head sayısı olsun. Klasik multi-head attention'da H_kv = H_q; multi-query attention'da H_kv = 1; GQA ise 1 < H_kv < H_q bölgesini kullanır. Böylece bir grup query head aynı key/value head'i paylaşır.
Bu paylaşım özellikle autoregressive inference'ta KV Cache boyutunu etkiler: diğer boyutlar sabitken K/V durumunun bellek gereksinimi yaklaşık olarak H_kv ile orantılıdır. Ancak daha az KV head her modelde aynı kalite veya throughput sonucunu garanti etmez; kernel, batch yapısı, sequence length ve donanım bant genişliği de sonuç üzerinde etkilidir. GQA'nın bu ara tasarımı ve MHA checkpoint'lerinden uptraining yaklaşımı Ainslie ve arkadaşları tarafından doğrudan tanımlanmıştır: çalışma.