list_altİçindekilerexpand_more

Ses transkripsiyonu artık neredeyse her uygulamanın bir noktasında çıkıyor karşınıza: toplantı özetleri, müşteri görüşmesi analizi, podcast altyazısı. Bunu yapmak isteyen geliştiriciler için şu anda üç ana seçenek var: OpenAI’ın Whisper’ı, gerçek zamanlı odaklı Deepgram ve ses analitiğine giren AssemblyAI.
Hangisini seçmeniz gerektiği büyük ölçüde ne için kullandığınıza bağlı. Türkçe içerikle çalışıyorsanız tablo oldukça net; İngilizce odaklı üretim sistemleri için seçim biraz daha nüanslı. API fiyatlarını daha geniş bir perspektiften karşılaştırmak istiyorsanız ChatGPT, Claude ve Gemini API Fiyatları yazımıza da bakabilirsiniz; aşağıda yalnızca STT servisleri var.
Hızlı Karşılaştırma Tablosu
| Özellik | Whisper (Hosted) | Deepgram Nova-3 | AssemblyAI Best |
|---|---|---|---|
| Fiyat (dakika başı) | $0.006 | $0.0043 | $0.0170 |
| Türkçe desteği | ✅ Güçlü | ⚠️ Sınırlı | ❌ Yok |
| Gerçek zamanlı streaming | ❌ | ✅ <300ms | ✅ |
| Self-hosted | ✅ Ücretsiz | ❌ | ❌ |
| Diarization (konuşmacı ayrımı) | ⚠️ Üçüncü taraf | ✅ Dahili | ✅ Dahili |
| LLM entegrasyonu | ❌ | ❌ | ✅ LeMUR |
| Max dosya boyutu | 25MB (hosted) | Sınırsız (URL) | 5GB |
Kaynaklar: OpenAI Fiyatlandırma, Deepgram Fiyatlandırma, AssemblyAI Fiyatlandırma
OpenAI Whisper API
Whisper, OpenAI’ın 680.000 saatten fazla çok dilli ses verisiyle eğittiği Transformer tabanlı bir modeldir. İki biçimde kullanılıyor: OpenAI’ın yönettiği hosted API ve kendi sunucunuzda çalıştırabileceğiniz açık kaynak ağırlıklar.
Ne iyi çalışıyor:
- 99 dil desteği; Türkçe bu diller arasında en iyi sonuç verenlerden
- Self-hosted seçeneğiyle API maliyeti tamamen kalkıyor; vLLM gibi çıkarım motorlarıyla büyük ölçekte çalıştırılabiliyor
whisper-large-v3-turbohız-doğruluk dengesinde makul bir nokta
Dikkat edilmesi gerekenler:
- Hosted API gerçek zamanlı streaming yapmıyor; dosya gönderip cevap bekliyorsunuz
- 25MB dosya sınırı uzun kayıtlarda sıkıntı çıkarıyor, parçalara bölmek gerekiyor
- Hosted API yalnızca whisper-1 modelini sunuyor; large-v3 için self-hosted şart
Python Kod Örneği: Whisper Hosted API
from openai import OpenAI
client = OpenAI()
with open("meeting.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
language="tr",
response_format="verbose_json",
timestamp_granularities=["word"]
)
print(transcript.text)
# Her kelimeyle birlikte zaman damgasına erişmek için:
for word in transcript.words:
print(f"{word.start:.2f}s - {word.end:.2f}s: {word.word}")
language="tr" parametresini açıkça belirtmenizi öneririm. Model dili tahmin ediyor ama kısa klipler veya arka planda başka dil konuşulan kayıtlarda tahmin kayabilir. Uzun dosyaları 25MB sınırına takılmadan işlemek için pydub veya ffmpeg ile ses dosyasını 10 dakikalık parçalara bölüp her parçayı ayrı istek olarak gönderebilirsiniz.
Self-Hosted Whisper
import whisper
# GPU varsa otomatik kullanır
model = whisper.load_model("large-v3-turbo")
result = model.transcribe(
"meeting.mp3",
language="tr",
word_timestamps=True,
verbose=False
)
print(result["text"])
Self-hosted yolu fine-tuning seçeneğini de açıyor: alanınıza özgü sözcükleri (tıp terimleri, ürün adları, iç kısaltmalar) yanlış tanıyan modeli kendi verilerinizle düzeltebilirsiniz. Birkaç saat annotated ses verisi çoğu zaman yeterli oluyor.
Donanım tarafında: whisper-large-v3 için minimum 10GB VRAM gerekiyor; whisper-large-v3-turbo 6GB VRAM ile çalışıyor. RTX 3090 veya AWS g4dn.xlarge bu iş için yeterli. Gerçek zamanlı gereksinim yoksa CPU üzerinde de çalışıyor, sadece çok daha yavaş.
Deepgram
Deepgram kendi mimarisini sıfırdan geliştirmiş bir şirket. Nova-3 modeli, gerçek zamanlı transkripsiyon konusunda birçok benchmarklama çalışmasında öne çıktı ve özellikle çağrı merkezi uygulamalarında referans haline geldi.
Ne iyi çalışıyor:
- 300ms altı gecikmeyle canlı transkripsiyona uygun; çağrı merkezi ve sesli asistan için doğru seçenek
- Smart Formatting telefon numaralarını, tarihleri ve para birimlerini otomatik düzenliyor
- Konuşmacı ayrımı (diarization) ek ücret olmadan dahili geliyor
- WebSocket tabanlı streaming API ilk kurulumda daha az kurulum gerektiriyor
- Batch transkripsiyon için URL üzerinden ses dosyası besleyebiliyorsunuz; 25MB sınırı yok
Dikkat edilmesi gerekenler:
- Türkçe resmi dil listesinde yok; Nova modelleri İngilizce ve Batı dillerine göre optimize edilmiş
- Self-hosted seçenek sunmuyor; verileriniz Deepgram sunucularına gidiyor
- Nova-2’den Nova-3’e geçişte fiyat arttı
Python Kod Örneği: Deepgram
from deepgram import DeepgramClient, PrerecordedOptions
DEEPGRAM_API_KEY = "your-api-key"
client = DeepgramClient(DEEPGRAM_API_KEY)
with open("recording.mp3", "rb") as audio:
payload = {"buffer": audio}
options = PrerecordedOptions(
model="nova-3",
language="en",
smart_format=True,
diarize=True,
punctuate=True,
)
response = client.listen.prerecorded.v("1").transcribe_file(
payload, options
)
transcript = response.results.channels[0].alternatives[0].transcript
print(transcript)
# Konuşmacı ayrımı
for word in response.results.channels[0].alternatives[0].words:
print(f"Speaker {word.speaker}: {word.word}")
Streaming için DeepgramClient’ın WebSocket bağlantısını kullanabilirsiniz. Canlı altyazı veya telefon görüşmesi kaydı gibi senaryolarda fark burada beliriyor; 300ms gecikme çoğu durumda kullanıcı tarafında fark edilmiyor.
AssemblyAI
AssemblyAI transkripsiyon ötesine geçiyor. LeMUR özelliği ses içeriğini doğrudan LLM ile sorgulamanıza izin veriyor. Bunun yanı sıra otomatik bölüm özetleri, duygu analizi ve PII maskeleme geliyor.
Ne iyi çalışıyor:
- LeMUR: transkript üstüne doğrudan LLM sorgusu çalıştırıyor; “bu görüşmedeki ana şikayetler neler?” gibi sorular yanıt veriyor
- Auto Chapters uzun içerikleri otomatik bölümlere ayırıyor; podcast veya eğitim videosu arşivi için kullanışlı
- PII redaction kredi kartı, telefon, kimlik numarası gibi hassas verileri otomatik maskeliyor; uyumluluk gereksinimleri olan sektörler için önemli
- 5GB’a kadar dosya desteği; uzun film veya konferans kaydını bölmeden gönderebilirsiniz
Dikkat edilmesi gerekenler:
- Türkçe dil desteği yok; yalnızca İngilizce üzerinde test edilmiş ve belgelenmiş
- En pahalı seçenek: “Best” modeli dakikada $0.017, Nano $0.0125; 1.000 saatlik hacimde fark belirgin
Python Kod Örneği: AssemblyAI
import assemblyai as aai
aai.settings.api_key = "your-api-key"
transcriber = aai.Transcriber()
config = aai.TranscriptionConfig(
speaker_labels=True,
sentiment_analysis=True,
auto_chapters=True,
entity_detection=True,
)
transcript = transcriber.transcribe("meeting.mp3", config)
# Temel metin
print(transcript.text)
# Bölüm özetleri
for chapter in transcript.chapters:
print(f"{chapter.start}ms - {chapter.end}ms: {chapter.headline}")
# LeMUR ile sorgu
result = transcript.lemur.task(
"Bu görüşmede müşterinin ana sorunları neler? Maddeler halinde listele."
)
print(result.response)
LeMUR, uzun görüşmeleri analiz etmek isteyen satış veya müşteri başarı ekipleri için görece pratik bir yol. Transkripti ayrıca bir LLM’ye gönderme katmanı kurmak yerine AssemblyAI bunu tek bir API çağrısında hallediyor. Dezavantajı LeMUR sorgularının ayrıca faturalandırılması; büyük hacimlerde maliyeti sürpriz yapabilir, test aşamasında toplam maliyeti yakından izlemek gerekiyor.
Türkçe Dil Desteği
Türk geliştiriciler için bu bölüm çoğu zaman karar verdirici.
| Servis | Türkçe Durumu | Detay |
|---|---|---|
| Whisper | ✅ Güçlü | 99 dil arasında; Türkçe eğitim verisinde açıkça yer alıyor |
| Deepgram | ⚠️ Desteklenmiyor | Resmi dil listesinde Türkçe yok; İngilizce odaklı |
| AssemblyAI | ❌ Desteklenmiyor | Yalnızca İngilizce |
Whisper’ın Türkçe performansı pratikte fark edilir düzeyde iyi. whisper-large-v3 konuşma dilini, farklı ağız özelliklerini ve teknik terimleri çoğu durumda yakalıyor. language="tr" ayarıyla standart ofis kayıtlarında kelime hata oranı (WER) %8-12 bandında kalıyor. Bu oran yabancı aksan içeren ses veya düşük kaliteli mikrofon kaydında yukarı çıkıyor; bu tür kayıtlar için large-v3 yerine domain-specific ince ayar uygulanmış bir model daha iyi sonuç veriyor.
Deepgram’ı Türkçe ses üzerinde test ettiniz mi? Kısa cümlelerde yüzeysel bir çıktı alabilirsiniz, ama hata oranı oldukça yüksek, özellikle uzun metinlerde anlam kayıyor. AssemblyAI’da Türkçe denememek daha mantıklı; resmi destek olmadan aldığınız çıktı güvenilir değil.
Türkçe konuşma tanıma gerektiren projelerde Whisper açık ara öndedir. Buna ek olarak Whisper’ı fine-tuning ile özelleştirme seçeneği de var: sektöre özgü terimler (hukuk, tıp, finans) veya şirkete özel kısaltmalar için birkaç saat annotated Türkçe ses verisiyle modeli gözle görülür biçimde düzeltebilirsiniz.
Aylık Maliyet: 1.000 Saat Transkripsiyon
1.000 saat = 60.000 dakika üzerinden hesaplanmıştır.
| Servis | Model | Dakika Başı | Aylık Maliyet |
|---|---|---|---|
| Whisper Hosted | whisper-1 | $0.006 | $360 |
| Deepgram | Nova-3 | $0.0043 | $258 |
| AssemblyAI | Nano | $0.0125 | $750 |
| AssemblyAI | Best | $0.0170 | $1.020 |
| Whisper Self-hosted | large-v3 | ~$0 API | GPU maliyeti |
Kaynaklar: OpenAI, Deepgram, AssemblyAI
Self-hosted Whisper yüksek hacimlerde API maliyetini tamamen kesiyor. AWS’de g4dn.xlarge ($0.526/saat) ile 1.000 saatlik transkripsiyon için GPU maliyeti $30-50 dolayında; hosted API’ye kıyasla çok daha az. Öte yandan altyapı kurulum ve bakım yükü gerçek, bu hesaba katılmalı. Küçük takımlar için 500 saatin altında hosted API daha az baş ağrısı getiriyor; üzerinde self-hosted geçiş ciddi tasarruf sağlıyor.
Deepgram fiyat açısından hosted seçenekler arasında en ucuzu. Ama Türkçe desteği olmadığı için bu avantaj Türk geliştiricilere çoğunlukla uygulanamıyor. AssemblyAI ise LeMUR gibi ekstra özellikler kullandığınızda maliyet hızla çıkıyor; bütçe planlaması için sabit transkripsiyon fiyatının ötesinde LLM sorgu maliyetini de hesaba katın.
Hangisini Seçmeli: Karar Rehberi
| Senaryo | Önerilen |
|---|---|
| Türkçe içerik transkripsiyon | Whisper |
| Yüksek hacim, maliyet öncelikli | Deepgram veya Whisper Self-hosted |
| Canlı/gerçek zamanlı streaming | Deepgram |
| Görüşme analizi + LLM sorgulama | AssemblyAI |
| Veri gizliliği / on-prem zorunlu | Whisper Self-hosted |
| Çok sayıda dil desteği | Whisper |
Türk geliştiriciler için pratik kural: prototip veya düşük hacim için Whisper Hosted API kurulumu en az sürüklüyor. Üretim ve yüksek hacimde self-hosted geçiş ciddi maliyet avantajı getiriyor. İngilizce içerikle gerçek zamanlı iş yapıyorsanız Deepgram, görüşme zekasına ihtiyaç duyulan CRM veya satış senaryolarında AssemblyAI daha uygun düşüyor.
Whisper’ın Türkçe yeteneklerine ilişkin ek teknik ayrıntılar için Whisper nedir sayfasına bakabilirsiniz. Ses AI ekosisteminin geri kalanını merak ediyorsanız ses klonlama ve TTS araçları yazısı ilgili bağlamı veriyor.
Sonuç
Üç servisi aynı proje içinde birden kullanmak mantıklı olabilir. Türkçe ses için Whisper, İngilizce gerçek zamanlı toplantı için Deepgram, İngilizce satış görüşmesi analizi için AssemblyAI. Seçim mutlaka tek bir servise kilitlenmeyi gerektirmiyor; kullanım senaryosuna göre yönlendirmek REST API katmanında yapılabilecek görece basit bir iş.
Başlangıç için Whisper’ın hosted API’si en az kurulum gerektiren nokta. Beş satır kodla ilk transkripsiyonu çalışır hale getirebilirsiniz; oradan ölçek ve gereksinim netleştikçe self-hosted veya farklı bir servis değerlendirilebilir.



