Inference Engine
Eğitilmiş model graph'ını hedef CPU/GPU/accelerator üzerinde optimize edip yürüten runtime katmanı.
Teknik Bağlam
Graph optimization, operator fusion, memory planning, quantized kernels ve batching inference throughput/latency'yi belirler. Aynı model farklı engine'lerde farklı numerik ve performans davranışı gösterebilir.
Sınırlar
Model formatı ile inference engine aynı şey değildir; ONNX bir değişim formatı, engine ise execution sistemidir.
İlgili Kavramlar
- ONNX
- Operator Fusion
- Quantization
- Tensor