FlashAttention
Attention hesaplamasını tile/block bazında düzenleyerek HBM ile on-chip memory arasındaki veri hareketini azaltan IO-aware exact attention algoritması ailesi.
Teknik Bağlam
Uzun sequence eğitim ve inference'ında attention kernel'inin memory traffic'ini düşürerek hız ve memory kullanımını iyileştirebilir. Kazanç GPU mimarisi ve sequence shape'e bağlıdır.
Sınırlar
FlashAttention approximate attention değildir; temel softmax attention sonucunu daha I/O-verimli hesaplamayı hedefler.
İlgili Kavramlar
- Attention
- Operator Fusion
- Memory Bandwidth
- Context Window