Tensor Parallelism
Tek bir neural-network katmanının weight veya activation tensorlerini birden fazla accelerator arasında bölerek aynı katman hesabını paralel yürütme tekniği.
ML Sistemleri Bağlamı
Model tek GPU belleğine sığmadığında veya layer compute süresi azaltılmak istendiğinde kullanılır. Collective communication latency ve interconnect bandwidth ölçeklenebilirliği belirler.
Model ve Servis Sınırı
Tensor parallelism data parallelism değildir; aynı sample'ın model hesabı cihazlar arasında parçalanır.
İlişkili ML Sistem Kavramları
Doğrudan kaynak: Tensor Parallelism için kullanılan teknik dayanak yukarıdaki birincil çalışma veya resmî belirtimdir.