tag CikarimSunucu

Bu sayfada CikarimSunucu etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Model serving (model sunucu), eğitilmiş bir makine öğrenimi modelini gerçek dünya kullanıcılarına veya sistemlerine çıkarım (inference) hizmeti verecek biçimde dağıtma ve işletme sürecinin tüm bütününü kapsar. Araştırma ortamında yüksek doğruluk sergileyen bir model, güvenilir bir servis altyapısı kurulmadan iş değerine dönüşemez; model serving bu boşluğu dolduran mühendislik disiplinidir. Bir model serving sistemi gelen HTTP veya gRPC isteklerini alır, modeli bellekte etkin biçimde tutar ve tahmin sonuçlarını olabildiğince kısa gecikmeyle geri döndürür. Büyük ölçekli sistemlerde bu süreç saniyede binlerce isteği karşılar. Başarının üç temel metrikle ölçüldüğü kabul görür: gecikme süresi (latency, tek bir isteğin yanıt süresi), verim (throughput, birim zamanda işlenen istek sayısı) ve kullanılabilirlik (availability, sistemin kesintisiz çalışma oranı). Servis modelleri kullanım senaryosuna göre üçe ayrılır. Çevrimiçi servis (online serving) gerçek zamanlı tahmin gereksinimlerini karşılar ve öneri sistemleri ile dolandırıcılık tespitinde yaygındır. Toplu iş servisi (batch serving) büyük veri kümeleri üzerinde önceden planlanmış tahminler yürütür; gecikme toleransı yüksek, işlem hacmi büyük görevler için uygundur. Akış servisi (stream serving) ise Kafka veya Pub/Sub gibi mesaj kuyrukları üzerinden sürekli veri akışını işler; IoT sensör analizi ve gerçek zamanlı anomali tespiti bu kategoride yer alır. Performans optimizasyonu açısından kuantizasyon (quantization), model ağırlıklarını FP32'den INT8 veya FP16'ya indirerek bellek kullanımını ve gecikmeyi azaltır. Dinamik gruplama (dynamic batching), birden fazla isteği bir arada işleyerek GPU verimliliğini artırır. Model önbellekleme (caching) ise tekrar eden sorguların yeniden hesaplanmasını önler. NVIDIA Triton Inference Server, TorchServe, BentoML ve KServe gibi çıkarım sunucuları bu optimizasyonları yönetilen biçimde sunar. Bulut tarafında AWS SageMaker, Google Vertex AI ve Azure ML, tam yönetilen model serving altyapısı olarak öne çıkar.

cloud_upload

Model Serving (Model Servis (Çıkarım Sunumu))

Model serving (model sunucu), eğitilmiş bir makine öğrenimi modelini gerçek dünya kullanıcılarına veya sistemlerine çıkarım (inference) hizmeti verecek biçimde dağıtma ve işletme sürecinin tüm bütününü kapsar. Araştırma ortamında yüksek doğruluk sergileyen bir model, güvenilir bir servis altyapısı kurulmadan iş değerine dönüşemez; model serving bu boşluğu dolduran mühendislik disiplinidir. Bir model serving sistemi gelen HTTP veya gRPC isteklerini alır, modeli bellekte etkin biçimde tutar ve tahmin sonuçlarını olabildiğince kısa gecikmeyle geri döndürür. Büyük ölçekli sistemlerde bu süreç saniyede binlerce isteği karşılar. Başarının üç temel metrikle ölçüldüğü kabul görür: gecikme süresi (latency, tek bir isteğin yanıt süresi), verim (throughput, birim zamanda işlenen istek sayısı) ve kullanılabilirlik (availability, sistemin kesintisiz çalışma oranı). Servis modelleri kullanım senaryosuna göre üçe ayrılır. Çevrimiçi servis (online serving) gerçek zamanlı tahmin gereksinimlerini karşılar ve öneri sistemleri ile dolandırıcılık tespitinde yaygındır. Toplu iş servisi (batch serving) büyük veri kümeleri üzerinde önceden planlanmış tahminler yürütür; gecikme toleransı yüksek, işlem hacmi büyük görevler için uygundur. Akış servisi (stream serving) ise Kafka veya Pub/Sub gibi mesaj kuyrukları üzerinden sürekli veri akışını işler; IoT sensör analizi ve gerçek zamanlı anomali tespiti bu kategoride yer alır. Performans optimizasyonu açısından kuantizasyon (quantization), model ağırlıklarını FP32'den INT8 veya FP16'ya indirerek bellek kullanımını ve gecikmeyi azaltır. Dinamik gruplama (dynamic batching), birden fazla isteği bir arada işleyerek GPU verimliliğini artırır. Model önbellekleme (caching) ise tekrar eden sorguların yeniden hesaplanmasını önler. NVIDIA Triton Inference Server, TorchServe, BentoML ve KServe gibi çıkarım sunucuları bu optimizasyonları yönetilen biçimde sunar. Bulut tarafında AWS SageMaker, Google Vertex AI ve Azure ML, tam yönetilen model serving altyapısı olarak öne çıkar.

arrow_forward