PyTorch, TensorFlow ve Sklearn modellerini ONNX formatına çevirerek CPU, GPU ve NPU dahil her donanımda yüksek performanslı çalıştıran Microsoft'un çapraz platform çıkarım motoru.

ONNX Runtime, Microsoft tarafından geliştirilen çapraz platform yüksek performanslı makine öğrenmesi çıkarım motorudur. ONNX (Open Neural Network Exchange) formatındaki modelleri CPU, GPU, NPU ve özel hızlandırıcılar dahil çeşitli donanımlar üzerinde optimize biçimde çalıştırır. ONNX Runtime'ın temel değeri, eğitim çerçevesi bağımsızlığıdır. PyTorch, TensorFlow, Keras veya Scikit-learn ile eğitilen modeller ONNX formatına dışa aktarıldıktan sonra ONNX Runtime üzerinde çalıştırılabilir; bu sayede eğitim ve dağıtım çerçeveleri birbirinden ayrışır. Dağıtım ortamı PyTorch veya TensorFlow yüklemek yerine çok daha hafif olan ONNX Runtime kütüphanesini kullanır. Performans optimizasyonu için ONNX Runtime çeşitli yürütme sağlayıcıları (execution providers) destekler: CUDA (NVIDIA GPU), TensorRT (NVIDIA hızlandırması), DirectML (Windows GPU), ROCm (AMD GPU), OpenVINO (Intel donanımları) ve CoreML (Apple Silicon). Hangi sağlayıcının kullanılacağı çalışma zamanında otomatik seçilebilir veya elle belirtilebilir. ONNX Runtime Web bileşeni, modeli tarayıcıda WebAssembly veya WebGPU arka ucu aracılığıyla çalıştırır. Bu özellik Transformers.js gibi istemci tarafı AI kütüphanelerinin altyapısını oluşturur; metin gömme, sınıflandırma veya nesne tespiti gibi görevler tarayıcıdan ayrılmadan gerçekleştirilir. Model optimizasyon araçları, grafik birleştirme (graph fusion), sabit katlama (constant folding) ve kuantizasyon (INT8, FP16) gibi tekniklerle çıkarım hızını artırır ve bellek kullanımını azaltır. Bu özellikler özellikle uç cihaz ve mobil dağıtım senaryolarında kritik önem taşır.