tag ONNXRuntime
Bu sayfada ONNXRuntime etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.
ONNX Runtime, Microsoft tarafından geliştirilen çapraz platform yüksek performanslı makine öğrenmesi çıkarım motorudur. ONNX (Open Neural Network Exchange) formatındaki modelleri CPU, GPU, NPU ve özel hızlandırıcılar dahil çeşitli donanımlar üzerinde optimize biçimde çalıştırır. ONNX Runtime'ın temel değeri, eğitim çerçevesi bağımsızlığıdır. PyTorch, TensorFlow, Keras veya Scikit-learn ile eğitilen modeller ONNX formatına dışa aktarıldıktan sonra ONNX Runtime üzerinde çalıştırılabilir; bu sayede eğitim ve dağıtım çerçeveleri birbirinden ayrışır. Dağıtım ortamı PyTorch veya TensorFlow yüklemek yerine çok daha hafif olan ONNX Runtime kütüphanesini kullanır. Performans optimizasyonu için ONNX Runtime çeşitli yürütme sağlayıcıları (execution providers) destekler: CUDA (NVIDIA GPU), TensorRT (NVIDIA hızlandırması), DirectML (Windows GPU), ROCm (AMD GPU), OpenVINO (Intel donanımları) ve CoreML (Apple Silicon). Hangi sağlayıcının kullanılacağı çalışma zamanında otomatik seçilebilir veya elle belirtilebilir. ONNX Runtime Web bileşeni, modeli tarayıcıda WebAssembly veya WebGPU arka ucu aracılığıyla çalıştırır. Bu özellik Transformers.js gibi istemci tarafı AI kütüphanelerinin altyapısını oluşturur; metin gömme, sınıflandırma veya nesne tespiti gibi görevler tarayıcıdan ayrılmadan gerçekleştirilir. Model optimizasyon araçları, grafik birleştirme (graph fusion), sabit katlama (constant folding) ve kuantizasyon (INT8, FP16) gibi tekniklerle çıkarım hızını artırır ve bellek kullanımını azaltır. Bu özellikler özellikle uç cihaz ve mobil dağıtım senaryolarında kritik önem taşır.
ONNX (Açık Sinir Ağı Değişim Formatı)
ONNX (Open Neural Network Exchange — Açık Sinir Ağı Değişim Formatı), PyTorch, TensorFlow ve JAX gibi farklı derin öğrenme çerçeveleri arasında model taşınabilirliğini sağlayan açık bir endüstri standardıdır. 2017'de Microsoft ve Meta (Facebook) tarafından ortaklaşa geliştirilen format, "bir kez eğit, her yerde çalıştır" felsefesiyle AI model dağıtımının karmaşıklığını ortadan kaldırmayı hedefler. Teknik olarak ONNX, hesaplama grafiğini (computational graph) Protocol Buffers formatında saklar. Model ağırlıkları, katman mimarisi ve tüm operasyonlar platform bağımsız bir .onnx uzantılı dosyada kodlanır. Bu dosya; CPU, GPU, NPU, FPGA veya WebAssembly gibi birbirinden farklı donanım hedeflerinde ONNX Runtime tarafından çalıştırılabilir hale gelir. Opset (operator set) versiyonlama mekanizması, geriye dönük uyumluluğu koruyarak ekosistemi istikrarlı kılar. ONNX Runtime, Microsoft tarafından geliştirilen açık kaynaklı yüksek performanslı çıkarım motorudur. CUDA (NVIDIA GPU), DirectML (Windows AI platformu), CoreML (Apple Silicon), TensorRT ve OpenVINO gibi Execution Provider'lar aracılığıyla aynı model farklı donanım mimarilerinde otomatik optimize edilir. Karşılaştırmalı testler, PyTorch eager mode'a kıyasla ortalama 1,5–3× hızlanma, transformer modellerinde operatör birleştirme (operator fusion) ile daha yüksek kazanım bildirmektedir. Ekosistem açısından PyTorch'tan torch.onnx.export(), TensorFlow'dan tf2onnx veya keras2onnx ile dönüşüm yapılır. Netron aracı model grafiğini görselleştirir; onnxsim gereksiz düğümleri temizler; INT8 ve FP16 nicemleme model boyutunu dörtte bire kadar indirir. Transformers.js ve ONNX Runtime Web, ONNX modellerini doğrudan tarayıcıda WebAssembly ve WebGL aracılığıyla çalıştırır. Phi-3, LLaMA ve Mistral gibi büyük dil modellerinin ONNX sürümleri Hugging Face'te yayınlanmakta; Windows Copilot+ PC'lerde NPU üzerinde, iOS ve Android'de ise internet bağlantısı gerekmeden yerel çıkarım için kullanılmaktadır. AWS SageMaker, Azure ML ve Google Vertex AI gibi büyük bulut platformları ONNX formatını doğrudan desteklemekte, model kayıt defterlerine sorunsuz entegrasyon imkânı sunmaktadır.
ONNX Runtime (ONNX Runtime)
ONNX Runtime, Microsoft tarafından geliştirilen çapraz platform yüksek performanslı makine öğrenmesi çıkarım motorudur. ONNX (Open Neural Network Exchange) formatındaki modelleri CPU, GPU, NPU ve özel hızlandırıcılar dahil çeşitli donanımlar üzerinde optimize biçimde çalıştırır. ONNX Runtime'ın temel değeri, eğitim çerçevesi bağımsızlığıdır. PyTorch, TensorFlow, Keras veya Scikit-learn ile eğitilen modeller ONNX formatına dışa aktarıldıktan sonra ONNX Runtime üzerinde çalıştırılabilir; bu sayede eğitim ve dağıtım çerçeveleri birbirinden ayrışır. Dağıtım ortamı PyTorch veya TensorFlow yüklemek yerine çok daha hafif olan ONNX Runtime kütüphanesini kullanır. Performans optimizasyonu için ONNX Runtime çeşitli yürütme sağlayıcıları (execution providers) destekler: CUDA (NVIDIA GPU), TensorRT (NVIDIA hızlandırması), DirectML (Windows GPU), ROCm (AMD GPU), OpenVINO (Intel donanımları) ve CoreML (Apple Silicon). Hangi sağlayıcının kullanılacağı çalışma zamanında otomatik seçilebilir veya elle belirtilebilir. ONNX Runtime Web bileşeni, modeli tarayıcıda WebAssembly veya WebGPU arka ucu aracılığıyla çalıştırır. Bu özellik Transformers.js gibi istemci tarafı AI kütüphanelerinin altyapısını oluşturur; metin gömme, sınıflandırma veya nesne tespiti gibi görevler tarayıcıdan ayrılmadan gerçekleştirilir. Model optimizasyon araçları, grafik birleştirme (graph fusion), sabit katlama (constant folding) ve kuantizasyon (INT8, FP16) gibi tekniklerle çıkarım hızını artırır ve bellek kullanımını azaltır. Bu özellikler özellikle uç cihaz ve mobil dağıtım senaryolarında kritik önem taşır.