Triton Inference Server (Triton Çıkarım Sunucusu)

NVIDIA'nın açık kaynaklı çıkarım sunucusu; PyTorch, TensorRT, ONNX ve vLLM gibi farklı çerçevelerden modelleri tek sunucu sürecinde paralel olarak yönetir.

Triton Inference Server, NVIDIA tarafından 2018'de açık kaynak olarak yayımlanan, üretim ortamlarında yapay zeka modellerini yüksek verimlilikle sunan bir çıkarım sunucusudur. Mart 2025'te NVIDIA Dynamo platformuyla birleştirilerek NVIDIA Dynamo-Triton adını alan proje, PyTorch, TensorRT, ONNX Runtime, TensorFlow, OpenVINO ve vLLM gibi popüler çerçevelerden gelen modelleri tek bir süreç içinde barındırır. Temel mimarisinde Triton, her arka uç (backend) için ayrı çalışma ortamları açar ve gelen istekleri paralel olarak yönlendirir. Dinamik yığınlama (dynamic batching), birden fazla isteği tek geçişte birleştirerek GPU kullanımını artırır. Ensemble Pipeline özelliği, önişleme, model çıkarımı ve son işleme adımlarını tek uçtan uca akış olarak tanımlamayı mümkün kılar. Desteklediği donanım açısından Triton, NVIDIA GPU, x86 ve ARM tabanlı CPU ile AWS Inferentia üzerinde çalışabilir. Bu durum, bulut, veri merkezi ve uç bilişim (edge) ortamlarına aynı yapılandırmayla dağıtım yapılabilmesini kolaylaştırır. MLOps entegrasyonu açısından Kubernetes ile ölçeklendirme, Prometheus ile izleme ve MLflow ile model kayıt doğrultusunda entegre edilebilir. Model Registry'den yeni sürüm yüklendiğinde Triton, hizmet kesilmesi olmadan güncelleme yapabilir. Büyük dil modellerini (LLM) sunarken vLLM backend'i etkinleştirilebilir; bu bileşen sayfa dikkatini (paged attention) ve KV-cache'i Triton çatısı altında yönetir. Birden fazla modeli, örneğin LLM, görüntü enkoderi ve sınıflandırıcıyı, aynı sunucuda çalıştırmak gerektiğinde Triton devreye girer. 2025-2026 itibarıyla Google Vertex AI, AWS SageMaker ve Azure ML gibi büyük bulut sağlayıcılar Triton'ı birincil çıkarım motoru olarak kullanmaktadır. Aralık 2025 sürümüyle vLLM backend'in ağırlık paylaşımı ve speculative decoding desteği de güçlendirildi.