Transformer
Dizisel veriyi recurrence zorunluluğu olmadan attention mekanizmalarıyla işleyen sinir ağı mimarisi.
Teknik Bağlam
Transformer katmanları self-attention, feed-forward blokları, residual bağlantılar ve normalization bileşenleriyle tokenlar arası bağlamı işler. Paralel eğitim ve uzun menzilli bağımlılık modelleme yeteneği modern dil, görüntü ve çok kipli modellerin temelini oluşturmuştur.
Sınırlar
Transformer tek başına büyük dil modeli değildir; model boyutu, eğitim amacı, tokenizasyon ve decoding stratejisi ayrı tasarım boyutlarıdır.
İlgili Kavramlar
- Self-Attention
- Multi-Head Attention
- Tokenization
- Context Window
Kaynak
- https://arxiv.org/abs/1706.03762