Mixture of Experts
Her token veya örnek için modelin tüm feed-forward kapasitesi yerine seçilen az sayıda uzman alt ağı etkinleştiren sparse model mimarisi.
Teknik Bağlam
Router tokenları top-k expert'e yönlendirir; toplam parametre sayısı yüksekken aktif FLOP daha sınırlı kalabilir. Load balancing ve expert capacity dağıtık training/inference için kritiktir.
Sınırlar
MoE daha düşük latency garantisi vermez; expert routing iletişimi, imbalance ve memory footprint önemli maliyetlerdir.
İlgili Kavramlar
- Transformer
- Router
- Sparse Model
- Load Balancing