Grouped-Query Attention

Türkçe karşılığı: Gruplandırılmış sorgu attentionAlan: Yapay Zeka

Gruplandırılmış sorgu attention (Grouped-Query Attention) — Birden fazla query head'in daha az sayıda key/value head paylaşarak Multi-Head Attention ile Multi-Query Attention arasında memory-bandwidth trade-off sağlayan attention varyantı.

Yapay Zekâ Bağlamı

Inference sırasında KV cache boyutunu ve memory bandwidth'i azaltırken çok başlı representation kapasitesini büyük ölçüde korumayı hedefler.

Model ve Karar Sınırı

GQA ile Mixture of Experts farklı eksenlerde optimizasyondur; GQA attention head paylaşımı, MoE feed-forward expert seçimiyle ilgilidir.

İlişkili Yapay Zekâ Kavramları

MHA ile MQA Arasındaki Yapısal Sınır

GQA'yı yalnız "daha az KV head" olarak değil, iki uç arasındaki yapısal ara nokta olarak okumak daha açıklayıcıdır. H_q query head sayısı ve H_kv key/value head sayısı olsun. Klasik multi-head attention'da H_kv = H_q; multi-query attention'da H_kv = 1; GQA ise 1 < H_kv < H_q bölgesini kullanır. Böylece bir grup query head aynı key/value head'i paylaşır.

Bu paylaşım özellikle autoregressive inference'ta KV Cache boyutunu etkiler: diğer boyutlar sabitken K/V durumunun bellek gereksinimi yaklaşık olarak H_kv ile orantılıdır. Ancak daha az KV head her modelde aynı kalite veya throughput sonucunu garanti etmez; kernel, batch yapısı, sequence length ve donanım bant genişliği de sonuç üzerinde etkilidir. GQA'nın bu ara tasarımı ve MHA checkpoint'lerinden uptraining yaklaşımı Ainslie ve arkadaşları tarafından doğrudan tanımlanmıştır: çalışma.