Tensor Parallelism
Tek bir neural-network katmanının weight veya activation tensorlerini birden fazla accelerator arasında bölerek aynı katman hesabını paralel yürütme tekniği.
Teknik Bağlam
Model tek GPU belleğine sığmadığında veya layer compute süresi azaltılmak istendiğinde kullanılır. Collective communication latency ve interconnect bandwidth ölçeklenebilirliği belirler.
Sınırlar
Tensor parallelism data parallelism değildir; aynı sample'ın model hesabı cihazlar arasında parçalanır.
İlgili Kavramlar
- Data Parallelism
- Pipeline Parallelism
- Memory Bandwidth
- Inference Engine