Inference Engine

Türkçe karşılığı: Çıkarım motoruAlan: Makine Öğrenmesi Sistemleri

Eğitilmiş model graph'ını hedef CPU/GPU/accelerator üzerinde optimize edip yürüten runtime katmanı.

Teknik Bağlam

Graph optimization, operator fusion, memory planning, quantized kernels ve batching inference throughput/latency'yi belirler. Aynı model farklı engine'lerde farklı numerik ve performans davranışı gösterebilir.

Sınırlar

Model formatı ile inference engine aynı şey değildir; ONNX bir değişim formatı, engine ise execution sistemidir.

İlgili Kavramlar

  • ONNX
  • Operator Fusion
  • Quantization
  • Tensor