API Gateway'in Temel İşlevleri
- check_circle Kimlik doğrulama ve yetkilendirme: JWT, API anahtarı veya OAuth 2.0 ile gelen isteklerin meşruiyetini denetler.
- check_circle Hız sınırlama (rate limiting): Dakika veya saat başına istek limitini uygular; LLM sistemlerinde token kotasını denetler.
- check_circle Yük dengeleme (load balancing): İstekleri birden fazla arka uç örneği arasında dağıtarak tek nokta arızasını önler.
- check_circle İstek yönlendirme: URL yoluna veya başlık bilgisine göre farklı mikro hizmetlere ya da model sürümlerine trafik atar.
- check_circle Gözlemlenebilirlik: İstek gecikmesi, hata oranı ve token tüketimini Prometheus ve Grafana gibi izleme sistemlerine aktarır.
LLM API Gateway'leri
Büyük dil modeli ekosisteminde, OpenAI, Anthropic ve Google Gemini gibi farklı sağlayıcıları tek bir uç nokta üzerinden kullanan LLM-özgü gateway araçları yaygınlaşmıştır. LiteLLM, 100'den fazla LLM sağlayıcısını standart OpenAI biçimine çevirerek sağlayıcı geçişlerini şeffaf kılar. Portkey ve Helicone ise istek günlüğü, maliyet izleme ve anlık hata düzeltme (fallback) özelliklerini öne çıkarır. Bu araçlar, token bütçesi aşımını algıladığında otomatik olarak daha ucuz bir modele yönlendirebilir veya isteği bekleme kuyruğuna alabilir.
Yaygın Araçlar ve Platformlar
- check_circle Kong: Açık kaynaklı, eklenti tabanlı API gateway; Kubernetes Ingress denetleyicisi olarak kullanılabilir.
- check_circle AWS API Gateway: Yönetilen bulut servisi; Lambda ve SageMaker Model Endpoint ile doğal entegrasyon.
- check_circle Azure API Management (APIM): Microsoft ekosistemine entegre; Azure OpenAI ile kesintisiz bütünleşme.
- check_circle Nginx / APISIX: Yüksek performanslı ters proxy; ince taneli yönlendirme kuralları ve düşük gecikme.
- check_circle LiteLLM: LLM-özgü; 100'den fazla sağlayıcıyı OpenAI uyumlu tek uç nokta altında birleştirir.
- check_circle Portkey: LLM gözlemlenebilirliği, fallback yönlendirme ve kullanıcı bazlı maliyet yönetimi.
MLOps Altyapısında API Gateway
MLOps bağlamında API Gateway, TensorFlow Serving, Triton Inference Server veya vLLM gibi çıkarım motorlarının önünde yer alır. Kanary dağıtım senaryolarında toplam trafiğin %10'unu yeni model sürümüne yönlendirip kalan %90'ını stabil sürümde tutmak için trafik bölme kuralları tanımlanabilir. Ayrıca istek-yanıt çiftlerini günlükleme altyapısına aktararak veri kayması (data drift) izleme ve model izleme sistemleri için girdi oluşturur.
Güvenlik ve Hız Sınırlama
- check_circle IP bazlı kara liste: Kötü niyetli IP adreslerinden gelen istekleri uç noktada keser, arka uca ulaşmasını engeller.
- check_circle Token bütçesi denetimi: LLM isteklerinde günlük veya aylık token limitini kullanıcı ya da takım bazında izler.
- check_circle TLS sonlandırma: HTTPS şifrelemesini gateway üzerinde çözerek arka uç hizmetlerin işlem yükünü azaltır.
- check_circle İstek doğrulama: Gelen veriyi JSON şema kurallarına göre doğrulayarak hatalı istekleri arka uca iletmeden reddeder.
Sık Sorulan Sorular
- check_circle API Gateway ile reverse proxy arasındaki fark nedir? Reverse proxy yalnızca istek yönlendirme ve önbelleğe alma yapar; API Gateway bunlara ek olarak kimlik doğrulama, hız sınırlama ve API versiyonlama gibi kapsamlı yönetim işlevleri sunar.
- check_circle LLM projelerinde neden LLM-özgü gateway kullanılır? OpenAI, Anthropic ve Gemini API formatları birbirinden farklıdır. LiteLLM gibi araçlar bu farklılıkları soyutlayarak kod değişikliği olmadan sağlayıcı geçişine ve fallback yönlendirmeye olanak tanır.
- check_circle API Gateway Kubernetes ortamında nasıl kullanılır? Kong veya APISIX, Kubernetes Ingress denetleyicisi olarak pod'lar önünde konumlanır. Helm chart'lar aracılığıyla kurulabilir ve pod otomatik ölçeklendirmesiyle uyumlu çalışır.
- check_circle Rate limiting token limiti aşımında ne olur? Yapılandırmaya göre gateway 429 Too Many Requests yanıtı döndürür veya isteği bekleme kuyruğuna alır. LLM gateway'lerde token tüketimi dakika başına (TPM) veya gün başına (TPD) limitine göre izlenir.
- check_circle API Gateway maliyet izleme nasıl yapar? Her LLM isteğindeki kullanılan token sayısını ve model fiyatlandırmasını birleştirerek istek başına maliyet hesaplar; kullanıcı, proje veya takım bazında kümülatif maliyet raporları üretir.