Multi-Head Attention
Attention işlemini farklı öğrenilmiş projeksiyonlarda paralel başlıklar halinde yürüterek farklı ilişki örüntülerini temsil eden mekanizma.
Teknik Bağlam
Her head ayrı query-key-value altuzayında çalışır; sonuçlar birleştirilip yeniden projekte edilir. Başlık sayısı, head dimension ve grouped/multi-query varyantları KV cache maliyetini etkileyebilir.
Sınırlar
Daha fazla head otomatik olarak daha iyi model anlamına gelmez; toplam hidden dimension ve mimari kısıtlarla birlikte değerlendirilir.
İlgili Kavramlar
- Self-Attention
- KV Cache
- Transformer
- Grouped-Query Attention