Mixture of Experts

Türkçe karşılığı: Uzmanlar karışımıAlan: Makine Öğrenmesi

Her token veya örnek için modelin tüm feed-forward kapasitesi yerine seçilen az sayıda uzman alt ağı etkinleştiren sparse model mimarisi.

Teknik Bağlam

Router tokenları top-k expert'e yönlendirir; toplam parametre sayısı yüksekken aktif FLOP daha sınırlı kalabilir. Load balancing ve expert capacity dağıtık training/inference için kritiktir.

Sınırlar

MoE daha düşük latency garantisi vermez; expert routing iletişimi, imbalance ve memory footprint önemli maliyetlerdir.

İlgili Kavramlar

  • Transformer
  • Router
  • Sparse Model
  • Load Balancing