Inference Server Nedir?
Inference server (çıkarım sunucusu), eğitilmiş bir makine öğrenmesi modelinin tahmin üretme kapasitesini HTTP REST veya gRPC API olarak dışa açan özelleşmiş yazılım katmanıdır. Model eğitiminden farklı olarak inference, gerçek zamanlı kullanıcı isteklerine yanıt verdiğinden düşük gecikme süresi ve yüksek erişilebilirlik bu sistemlerin tasarım önceliğidir. Tek bir inference sunucusu onlarca modeli eş zamanlı barındırabilir, istek hacmine göre dinamik ölçeklenebilir ve model sürümlerini sıfır kesinti ile değiştirebilir.
Temel Bileşenler ve İşlevler
- check_circle Model deposu: Farklı framework'lerden (TensorRT, ONNX, PyTorch) modelleri versiyonlanmış şekilde saklar ve yükler.
- check_circle Request scheduler: Gelen istekleri continuous batching ile gruplandırarak GPU kullanımını maksimize eder.
- check_circle Bellek yöneticisi: KV cache ve PagedAttention ile GPU belleğini parçalanma olmadan tahsis eder.
- check_circle Protokol gateway: HTTP/REST, gRPC ve KFServing v2 gibi standart protokolleri destekler.
- check_circle İzleme ve loglama: Prometheus metrikleri, Grafana dashboardları ve dağıtık izleme için OpenTelemetry entegrasyonu sunar.
Öne Çıkan Inference Sunucuları (2026)
- check_circle NVIDIA Dynamo-Triton: Çok backend destekli genel amaçlı sunucu. TensorRT, ONNX Runtime, vLLM ve PyTorch modellerini aynı instance üzerinde barındırır.
- check_circle vLLM: PagedAttention ile bellek verimliliğini optimize eden LLM odaklı açık kaynak sunucu. Tek pip install ile kurulabilir.
- check_circle TorchServe: PyTorch ekosistemiyle derin entegrasyon. torch.compile() desteğiyle geleneksel sınıflandırma ve tespit modellerine önerilir.
- check_circle ONNX Runtime: Microsoft'un çok platformlu motoru. CUDA, DirectML, CoreML, OpenVINO gibi farklı execution provider'ları destekler.
Performans Optimizasyonu
Inference sunucularında performans optimizasyonu birkaç teknik katmanda gerçekleşir. Continuous batching, farklı uzunluktaki istekleri aynı anda işleyerek sabit batch boyutuna kıyasla %50-70 daha yüksek GPU kullanımı sağlar. Spekülatif kod çözme ise küçük bir taslak modelin sonraki 5-10 token'ı tahmin etmesi, büyük modelin bunu doğrulaması prensibine dayanır; tahmin doğruysa birden fazla token tek adımda üretilir. TensorRT entegrasyonu tek başına 2-3×, kapsamlı optimizasyon ise 10×'e kadar iyileştirme sağlayabilir.
MLOps Entegrasyonu ve Dağıtım
Üretim ortamında inference sunucuları Kubernetes üzerinde konteyner olarak çalışır. Horizontal Pod Autoscaler yük arttığında otomatik ölçekleme yapar. Blue-green deployment yeni model sürümlerini sıfır kesinti ile geçiş yapılmasını, canary release ise trafiğin küçük bir yüzdesini yeni modele yönlendirerek riskin azaltılmasını mümkün kılar. A/B test altyapısı iki model versiyonunun performans ve kullanıcı etkisini paralel olarak karşılaştırır.
Performans Metrikleri
- check_circle P50/P95/P99 gecikme: İsteklerin %50, %95 ve %99'unun ne kadar sürede yanıtlandığını gösterir. SLA genellikle P99 üzerinden tanımlanır.
- check_circle TTFT (Time to First Token): LLM'lerde ilk token'ın üretildiği ana kadar geçen süre; akış yanıtlarda kullanıcı deneyimini doğrudan etkiler.
- check_circle QPS (Queries Per Second): Saniyede işlenen toplam istek sayısı; sistemin genel iş hacmini gösterir.
- check_circle Token/sn iş hacmi: LLM servislerinde saniyede üretilen token sayısı; doğrudan GPU kullanım verimliliğiyle ilişkilidir.
- check_circle GPU bellek kullanımı: KV cache ve model ağırlıklarının kullandığı VRAM miktarı; ölçekleme kararlarını etkiler.
Sık Sorulan Sorular
- check_circle Inference server ile model serving farkı nedir?: Model serving geniş bir kavramı ifade ederken, inference server bu servisi gerçekleştiren yazılım sistemi veya altyapıdır. Inference server, model serving'in teknik implementasyonudur.
- check_circle Küçük projeler için inference server gerekli mi?: Tek model ve düşük trafik için FastAPI veya Flask yeterli olabilir. Birden fazla model, yüksek eşzamanlılık veya SLA gereksinimleri olduğunda inference server zorunlu hale gelir.
- check_circle vLLM ile Triton arasında nasıl seçim yapılır?: Yalnızca LLM servis ediliyorsa vLLM'in kurulumu ve yönetimi daha basittir. Çoklu model tipi, çoklu backend veya kurumsal izleme gereksinimleri için Triton tercih edilmelidir.
- check_circle Inference sunucularında güvenlik nasıl sağlanır?: API gateway üzerinden kimlik doğrulama, TLS şifrelemesi, istek boyutu limitleri ve rate limiting temel güvenlik katmanlarını oluşturur.
- check_circle Inference sunucusu maliyeti nasıl optimize edilir?: Continuous batching ile GPU boşta kalma süresi azaltılır, uygun kuantizasyon ile model boyutu küçültülür, spot instance kullanımıyla altyapı maliyeti düşürülebilir.