
Bütçe LLM Seçimi Neden Zor?
Büyük dil modelleri artık tek bir fiyat katmanında gelmiyor. Anthropic, Google ve OpenAI’ın her biri farklı güç ve maliyet dengesi sunan “hafif” bir model yayınladı: Claude Haiku 4.5, Gemini 2.5 Flash ve GPT-4o mini. Üçü de API üzerinden milisaniyeler içinde yanıt veriyor. İlk bakışta birbirinden farkı yok gibi görünüyor.
Ama gerçek kullanımda tablonun farklı şekillendiği ortaya çıkıyor. Sınıflandırmada biri, uzun metin işlemede bir diğeri, karmaşık akıl yürütmede üçüncüsü daha tutarlı sonuç veriyor. Yanlış seçimde aynı para harcanırken tam çalışmayan çıktılar üretiliyor.
Token başına fiyatların geniş tablosunu ayrı bir yazıda ele aldık. Burada karar kıstaslarına bakıyoruz: hangi model, hangi görevde daha iyi çalışıyor ve neden.
Claude Haiku 4.5: Talimat Takibi Öne Çıkıyor
Haiku 4.5, Anthropic’in Haiku serisinin 2025 sonunda piyasaya çıkan sürümü. Fiyatı diğer ikisine kıyasla daha yüksek: giriş için 0.80 $/M token, çıkış için 4.00 $/M token. Prompt caching aktifken tekrar eden bağlam maliyeti %90’a kadar düşüyor; uzun sistem talimatları olan uygulamalarda bu fark toplam bütçeyi belirleyici ölçüde etkiliyor.
Bağlam penceresi 200K token. Orta büyüklükte belgelerle çalışan uygulamalar için yeterli; 1M bağlam gerektiren senaryolarda Flash’ın gerisinde kalıyor.
Haiku 4.5’in öne çıktığı yer talimat uyumu. Karmaşık, çok koşullu sistem promptlarını model nadiren yanlış yorumluyor. JSON şemasına uyan yapılandırılmış çıktı üretiminde ve sınıflandırma görevlerinde hata oranı düşük kalıyor. Güvenli içerik politikalarına uygunluk gerektiren uygulamalarda (çocuk platformları, kurumsal deployment) genellikle ilk tercih bu model oluyor.
Zayıf nokta çok adımlı matematik ve karmaşık çıkarım görevleri. Video içeren görsel analiz senaryolarında Flash’ın gerisinde kalıyor.
Gemini 2.5 Flash: 1 Milyon Token ve Thinking Modu
Flash’ın fiyatı üç model arasında en düşük: giriş 0.15 $/M token, çıkış 0.60 $/M token. Aynı bütçeyle Haiku’ya kıyasla yaklaşık 5 kat daha fazla token işlemek mümkün. Thinking modu aktifken düşünme adımları 0.35 $/M token olarak ayrıca hesaplanıyor.
1 milyon token bağlam penceresi Flash’ı diğerlerinden ayıran en belirgin özellik. Tüm bir kod tabanını, yüzlerce sayfalık belge setini ya da çok turlu uzun konuşma geçmişini tek bir çağrıya sığdırmak isteyen uygulamalar için bu kapasite ciddi bir fark yaratıyor.
Teknik görevlerde Flash açıkça öne çıkıyor: kod analizi, veri çıkarma ve adım adım matematik problemleri. Temmuz 2026’da genel erişime açılan Thinking modu, karmaşık akıl yürütme gerektiren görevlerde modelin doğruluğunu belirgin artırıyor; standart modda hız Haiku ile benzer düzeyde kalıyor.
Embedding modeli entegrasyonlarında Vertex AI ekosistemiyle doğal uyum, ekstra adaptör katmanı yazmadan RAG pipeline kurmayı kolaylaştırıyor. Google Cloud altyapısına bağlı kalacak uygulamalar için bu entegrasyon avantajı belirleyici olabiliyor.
Dikkat edilmesi gereken: Yaratıcı yazı veya belirli ton tutarlılığı gerektiren çıktılarda Haiku kadar güvenilir değil. Zaman zaman uzun çıktılarda format kaymaları yaşanabiliyor.
GPT-4o mini: Fine-tuning ve Ekosistem Genişliği
Fiyat açısından Flash ile aynı aralıkta: giriş 0.15 $/M token, çıkış 0.60 $/M token. Fine-tuned versiyonu biraz daha pahalıya geliyor (giriş 0.30 $/M, çıkış 1.20 $/M), ancak Haziran 2026 güncellemesiyle fine-tuning başına maliyet önemli ölçüde düştü.
128K bağlam penceresi üç model arasında en kısa. Uzun belge işleme veya geniş konuşma geçmişi olan uygulamalar bu sınırla erken karşılaşıyor.
GPT-4o mini’yi diğerlerinden ayıran şey fine-tuning desteği. Kendi veri setiyle ince ayar yapılmış bir model, alan spesifik görevlerde jenerik versiyonu hem hız hem doğruluk açısından geçiyor. Müşteri destek botları, belirli bir yazı stilini taklit eden içerik araçları veya dar kapsamlı sınıflandırıcılar için bu yol çoğunlukla en verimli çözüm.
OpenAI Assistants API ile tam entegrasyon, Code Interpreter ve File Search gibi araçlara erişim açıyor. RAG sistemleri inşa edenler için OpenAI embedding modelleriyle aynı ortamda çalışması, ekstra adaptör gerektirmeden pipeline ayağa kalkıyor. Üçüncü taraf kütüphanelerin (LangChain, LlamaIndex) GPT-4o mini için hazır adaptörleri diğer iki modelden daha kapsamlı.
Karşılaştırma Tablosu
| Kriter | Claude Haiku 4.5 | Gemini 2.5 Flash | GPT-4o mini |
|---|---|---|---|
| Giriş fiyatı ($/M token) | 0.80 | 0.15 | 0.15 |
| Çıkış fiyatı ($/M token) | 4.00 | 0.60 | 0.60 |
| Bağlam penceresi | 200K | 1M | 128K |
| Thinking modu | Hayır | Evet (opsiyonel) | Hayır |
| Fine-tuning desteği | Sınırlı | Hayır | Evet |
| Multimodal | Evet | Evet (video dahil) | Evet |
| Ortalama latency (p50) | ~1.5s | ~1.2s | ~1.3s |
| Sınıflandırma doğruluğu | Yüksek | Orta-Yüksek | Orta-Yüksek |
| Kodlama görevleri | İyi | Çok İyi | İyi |
| Güvenlik guardrails | Güçlü | Orta | Orta |
Kaynak: Anthropic fiyatlandırma, Google AI fiyatlandırma, OpenAI fiyatlandırma (Ağustos 2026)
Kod Örnekleri
Aynı sınıflandırma görevini her üç API ile çalıştırmanın minimal yolu:
Claude Haiku 4.5:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-haiku-4-5",
max_tokens=256,
system="Aşağıdaki metni olumlu, olumsuz veya nötr olarak sınıflandır. Sadece kategoriyi döndür.",
messages=[{"role": "user", "content": "Bu ürün beklentilerimi tamamen karşıladı."}]
)
print(response.content[0].text)
Gemini 2.5 Flash:
import google.generativeai as genai
genai.configure(api_key="YOUR_API_KEY")
model = genai.GenerativeModel("gemini-2.5-flash")
response = model.generate_content(
"Şu metni olumlu/olumsuz/nötr sınıflandır. Sadece kategoriyi döndür: 'Bu ürün beklentilerimi tamamen karşıladı.'"
)
print(response.text)
GPT-4o mini:
from openai import OpenAI
client = OpenAI()
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "system", "content": "Metni olumlu, olumsuz veya nötr sınıflandır. Sadece kategoriyi döndür."},
{"role": "user", "content": "Bu ürün beklentilerimi tamamen karşıladı."}
]
)
print(response.choices[0].message.content)
Üçü de bu görevi tamamlıyor. Fark, daha karmaşık sistem promptlarında ve edge case’lerde ortaya çıkıyor. Haiku talimat takibinde daha katı, Flash büyük bağlamlarda avantajlı, GPT-4o mini fine-tuning yapıldığında öne geçiyor.
Hangisini Seçmeli?
Karar büyük ölçüde projenin neye ihtiyaç duyduğuna bağlı.
Talimat takibi kritikse Haiku 4.5 daha güvenilir. Müşteri destek botları, form doldurucu araçlar, içerik moderasyonu gibi senaryolarda model karmaşık sistem promptlarını daha tutarlı takip ediyor. Güvenli içerik politikası gerektiren uygulamalarda da aynı şekilde öne çıkıyor. Prompt caching kullanıyorsanız yüksek giriş fiyatı kısmen dengeleniyor.
Maliyet minimizasyonu öncelikse Flash mantıklı bir başlangıç noktası. Aynı bütçeyle çok daha fazla token işlenebiliyor. STEM ağırlıklı görevler, kod analizi ve veri çıkarma işlerinde de Flash teknik açıdan daha güçlü. 200K’yı aşan bağlam gerektiren senaryolarda zaten başka seçenek yok.
GPT-4o mini’ye yönelmek için en somut neden fine-tuning. Fine-tuning mi yoksa RAG mi yapmalı sorusu burada belirleyici: RAG’ın yetersiz kaldığı alan spesifik görevlerde, kendi veri setiyle ince ayar yapılmış bir model çoğunlukla daha verimli. OpenAI araç ekosistemine bağımlı mevcut bir sisteminiz varsa GPT-4o mini geçişi de en kolay bu model.
2026 Ekosistem Durumu
Anthropic, Mayıs 2026 Haiku güncellemesiyle sınıflandırma doğruluğunu artırdı. Python SDK’sı batch işlem ve streaming tarafında iyileşme aldı. Topluluk büyüyor. (github.com/anthropics)
Google, Thinking modunu Temmuz 2026’da genel erişime açtı. Vertex AI üzerindeki kurumsal sürüm kurumsal müşteriler arasında yayılıyor. Video analizi kapasitesi bu yıl içinde en çok güncellenen özelliklerden biri oldu. (ai.google.dev)
OpenAI’ın Haziran 2026 fine-tuning güncellemesi hem maliyeti düşürdü hem de eğitim süresini kısalttı. GPT-4o mini’nin API kullanıcı tabanı hâlâ en geniş; ekosistem genişliği üçüncü taraf kütüphane ve entegrasyon sayısına yansıyor. (platform.openai.com)
Groq veya Cerebras gibi üçüncü taraf inference sağlayıcıları üzerinden bu modelleri çalıştırmak fiyatı daha aşağı çekebiliyor. Production ortamı için model versiyonu ve SLA güvenilirliği değişkenlik gösterebileceğinden resmi sağlayıcılar genellikle daha güvenli.
Bu yazıdaki rakamlar Ağustos 2026 itibarıyla geçerli. Karar öncesinde resmi fiyatlandırma sayfalarını kontrol etmek en güvenilir yol.



