Konuşma Tanıma Whisper Deepgram AssemblyAI API Ses Metin Yapay Zeka Araçları

Konuşma Tanıma API: Whisper vs Deepgram vs AssemblyAI (2026)

Orta
person Yapay Zeka Uzmanı
list_altİçindekilerexpand_more
  1. 01Hızlı Karşılaştırma Tablosu
  2. 02OpenAI Whisper API
  3. 03Python Kod Örneği: Whisper Hosted API
  4. 04Self-Hosted Whisper
  5. 05Deepgram
  6. 06Python Kod Örneği: Deepgram
  7. 07AssemblyAI
  8. 08Python Kod Örneği: AssemblyAI
  9. 09Türkçe Dil Desteği
  10. 10Aylık Maliyet: 1.000 Saat Transkripsiyon
  11. 11Hangisini Seçmeli: Karar Rehberi
  12. 12Sonuç
Editorial tech-magazine cover illustration about speech recognition and audio transcription technology, sound waveforms transforming into flowing text streams, microphone with neural network connections emanating outward, abstract artificial-intelligence motifs (glowing neural networks, flowing data, subtle circuitry), sophisticated modern concept art, clean balanced composition, soft cinematic studio lighting, rich depth of field, premium color grading in deep navy blues with cyan and magenta accents, highly detailed, polished editorial 8k. No text, no words, no letters, no captions, no logos, no watermark, no UI.

Whisper, Deepgram ve AssemblyAI konuşma tanıma API karşılaştırması — ses dalgaları ve yapay zeka ağları illüstrasyonu

Ses transkripsiyonu artık neredeyse her uygulamanın bir noktasında çıkıyor karşınıza: toplantı özetleri, müşteri görüşmesi analizi, podcast altyazısı. Bunu yapmak isteyen geliştiriciler için şu anda üç ana seçenek var: OpenAI’ın Whisper’ı, gerçek zamanlı odaklı Deepgram ve ses analitiğine giren AssemblyAI.

Hangisini seçmeniz gerektiği büyük ölçüde ne için kullandığınıza bağlı. Türkçe içerikle çalışıyorsanız tablo oldukça net; İngilizce odaklı üretim sistemleri için seçim biraz daha nüanslı. API fiyatlarını daha geniş bir perspektiften karşılaştırmak istiyorsanız ChatGPT, Claude ve Gemini API Fiyatları yazımıza da bakabilirsiniz; aşağıda yalnızca STT servisleri var.

Hızlı Karşılaştırma Tablosu

ÖzellikWhisper (Hosted)Deepgram Nova-3AssemblyAI Best
Fiyat (dakika başı)$0.006$0.0043$0.0170
Türkçe desteği✅ Güçlü⚠️ Sınırlı❌ Yok
Gerçek zamanlı streaming✅ <300ms
Self-hosted✅ Ücretsiz
Diarization (konuşmacı ayrımı)⚠️ Üçüncü taraf✅ Dahili✅ Dahili
LLM entegrasyonu✅ LeMUR
Max dosya boyutu25MB (hosted)Sınırsız (URL)5GB

Kaynaklar: OpenAI Fiyatlandırma, Deepgram Fiyatlandırma, AssemblyAI Fiyatlandırma

OpenAI Whisper API

Whisper, OpenAI’ın 680.000 saatten fazla çok dilli ses verisiyle eğittiği Transformer tabanlı bir modeldir. İki biçimde kullanılıyor: OpenAI’ın yönettiği hosted API ve kendi sunucunuzda çalıştırabileceğiniz açık kaynak ağırlıklar.

Ne iyi çalışıyor:

  • 99 dil desteği; Türkçe bu diller arasında en iyi sonuç verenlerden
  • Self-hosted seçeneğiyle API maliyeti tamamen kalkıyor; vLLM gibi çıkarım motorlarıyla büyük ölçekte çalıştırılabiliyor
  • whisper-large-v3-turbo hız-doğruluk dengesinde makul bir nokta

Dikkat edilmesi gerekenler:

  • Hosted API gerçek zamanlı streaming yapmıyor; dosya gönderip cevap bekliyorsunuz
  • 25MB dosya sınırı uzun kayıtlarda sıkıntı çıkarıyor, parçalara bölmek gerekiyor
  • Hosted API yalnızca whisper-1 modelini sunuyor; large-v3 için self-hosted şart

Python Kod Örneği: Whisper Hosted API

from openai import OpenAI

client = OpenAI()

with open("meeting.mp3", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="whisper-1",
        file=audio_file,
        language="tr",
        response_format="verbose_json",
        timestamp_granularities=["word"]
    )

print(transcript.text)
# Her kelimeyle birlikte zaman damgasına erişmek için:
for word in transcript.words:
    print(f"{word.start:.2f}s - {word.end:.2f}s: {word.word}")

language="tr" parametresini açıkça belirtmenizi öneririm. Model dili tahmin ediyor ama kısa klipler veya arka planda başka dil konuşulan kayıtlarda tahmin kayabilir. Uzun dosyaları 25MB sınırına takılmadan işlemek için pydub veya ffmpeg ile ses dosyasını 10 dakikalık parçalara bölüp her parçayı ayrı istek olarak gönderebilirsiniz.

Self-Hosted Whisper

import whisper

# GPU varsa otomatik kullanır
model = whisper.load_model("large-v3-turbo")

result = model.transcribe(
    "meeting.mp3",
    language="tr",
    word_timestamps=True,
    verbose=False
)

print(result["text"])

Self-hosted yolu fine-tuning seçeneğini de açıyor: alanınıza özgü sözcükleri (tıp terimleri, ürün adları, iç kısaltmalar) yanlış tanıyan modeli kendi verilerinizle düzeltebilirsiniz. Birkaç saat annotated ses verisi çoğu zaman yeterli oluyor.

Donanım tarafında: whisper-large-v3 için minimum 10GB VRAM gerekiyor; whisper-large-v3-turbo 6GB VRAM ile çalışıyor. RTX 3090 veya AWS g4dn.xlarge bu iş için yeterli. Gerçek zamanlı gereksinim yoksa CPU üzerinde de çalışıyor, sadece çok daha yavaş.

Deepgram

Deepgram kendi mimarisini sıfırdan geliştirmiş bir şirket. Nova-3 modeli, gerçek zamanlı transkripsiyon konusunda birçok benchmarklama çalışmasında öne çıktı ve özellikle çağrı merkezi uygulamalarında referans haline geldi.

Ne iyi çalışıyor:

  • 300ms altı gecikmeyle canlı transkripsiyona uygun; çağrı merkezi ve sesli asistan için doğru seçenek
  • Smart Formatting telefon numaralarını, tarihleri ve para birimlerini otomatik düzenliyor
  • Konuşmacı ayrımı (diarization) ek ücret olmadan dahili geliyor
  • WebSocket tabanlı streaming API ilk kurulumda daha az kurulum gerektiriyor
  • Batch transkripsiyon için URL üzerinden ses dosyası besleyebiliyorsunuz; 25MB sınırı yok

Dikkat edilmesi gerekenler:

  • Türkçe resmi dil listesinde yok; Nova modelleri İngilizce ve Batı dillerine göre optimize edilmiş
  • Self-hosted seçenek sunmuyor; verileriniz Deepgram sunucularına gidiyor
  • Nova-2’den Nova-3’e geçişte fiyat arttı

Python Kod Örneği: Deepgram

from deepgram import DeepgramClient, PrerecordedOptions

DEEPGRAM_API_KEY = "your-api-key"
client = DeepgramClient(DEEPGRAM_API_KEY)

with open("recording.mp3", "rb") as audio:
    payload = {"buffer": audio}
    options = PrerecordedOptions(
        model="nova-3",
        language="en",
        smart_format=True,
        diarize=True,
        punctuate=True,
    )
    response = client.listen.prerecorded.v("1").transcribe_file(
        payload, options
    )

transcript = response.results.channels[0].alternatives[0].transcript
print(transcript)

# Konuşmacı ayrımı
for word in response.results.channels[0].alternatives[0].words:
    print(f"Speaker {word.speaker}: {word.word}")

Streaming için DeepgramClient’ın WebSocket bağlantısını kullanabilirsiniz. Canlı altyazı veya telefon görüşmesi kaydı gibi senaryolarda fark burada beliriyor; 300ms gecikme çoğu durumda kullanıcı tarafında fark edilmiyor.

AssemblyAI

AssemblyAI transkripsiyon ötesine geçiyor. LeMUR özelliği ses içeriğini doğrudan LLM ile sorgulamanıza izin veriyor. Bunun yanı sıra otomatik bölüm özetleri, duygu analizi ve PII maskeleme geliyor.

Ne iyi çalışıyor:

  • LeMUR: transkript üstüne doğrudan LLM sorgusu çalıştırıyor; “bu görüşmedeki ana şikayetler neler?” gibi sorular yanıt veriyor
  • Auto Chapters uzun içerikleri otomatik bölümlere ayırıyor; podcast veya eğitim videosu arşivi için kullanışlı
  • PII redaction kredi kartı, telefon, kimlik numarası gibi hassas verileri otomatik maskeliyor; uyumluluk gereksinimleri olan sektörler için önemli
  • 5GB’a kadar dosya desteği; uzun film veya konferans kaydını bölmeden gönderebilirsiniz

Dikkat edilmesi gerekenler:

  • Türkçe dil desteği yok; yalnızca İngilizce üzerinde test edilmiş ve belgelenmiş
  • En pahalı seçenek: “Best” modeli dakikada $0.017, Nano $0.0125; 1.000 saatlik hacimde fark belirgin

Python Kod Örneği: AssemblyAI

import assemblyai as aai

aai.settings.api_key = "your-api-key"

transcriber = aai.Transcriber()

config = aai.TranscriptionConfig(
    speaker_labels=True,
    sentiment_analysis=True,
    auto_chapters=True,
    entity_detection=True,
)

transcript = transcriber.transcribe("meeting.mp3", config)

# Temel metin
print(transcript.text)

# Bölüm özetleri
for chapter in transcript.chapters:
    print(f"{chapter.start}ms - {chapter.end}ms: {chapter.headline}")

# LeMUR ile sorgu
result = transcript.lemur.task(
    "Bu görüşmede müşterinin ana sorunları neler? Maddeler halinde listele."
)
print(result.response)

LeMUR, uzun görüşmeleri analiz etmek isteyen satış veya müşteri başarı ekipleri için görece pratik bir yol. Transkripti ayrıca bir LLM’ye gönderme katmanı kurmak yerine AssemblyAI bunu tek bir API çağrısında hallediyor. Dezavantajı LeMUR sorgularının ayrıca faturalandırılması; büyük hacimlerde maliyeti sürpriz yapabilir, test aşamasında toplam maliyeti yakından izlemek gerekiyor.

Türkçe Dil Desteği

Türk geliştiriciler için bu bölüm çoğu zaman karar verdirici.

ServisTürkçe DurumuDetay
Whisper✅ Güçlü99 dil arasında; Türkçe eğitim verisinde açıkça yer alıyor
Deepgram⚠️ DesteklenmiyorResmi dil listesinde Türkçe yok; İngilizce odaklı
AssemblyAI❌ DesteklenmiyorYalnızca İngilizce

Whisper’ın Türkçe performansı pratikte fark edilir düzeyde iyi. whisper-large-v3 konuşma dilini, farklı ağız özelliklerini ve teknik terimleri çoğu durumda yakalıyor. language="tr" ayarıyla standart ofis kayıtlarında kelime hata oranı (WER) %8-12 bandında kalıyor. Bu oran yabancı aksan içeren ses veya düşük kaliteli mikrofon kaydında yukarı çıkıyor; bu tür kayıtlar için large-v3 yerine domain-specific ince ayar uygulanmış bir model daha iyi sonuç veriyor.

Deepgram’ı Türkçe ses üzerinde test ettiniz mi? Kısa cümlelerde yüzeysel bir çıktı alabilirsiniz, ama hata oranı oldukça yüksek, özellikle uzun metinlerde anlam kayıyor. AssemblyAI’da Türkçe denememek daha mantıklı; resmi destek olmadan aldığınız çıktı güvenilir değil.

Türkçe konuşma tanıma gerektiren projelerde Whisper açık ara öndedir. Buna ek olarak Whisper’ı fine-tuning ile özelleştirme seçeneği de var: sektöre özgü terimler (hukuk, tıp, finans) veya şirkete özel kısaltmalar için birkaç saat annotated Türkçe ses verisiyle modeli gözle görülür biçimde düzeltebilirsiniz.

Aylık Maliyet: 1.000 Saat Transkripsiyon

1.000 saat = 60.000 dakika üzerinden hesaplanmıştır.

ServisModelDakika BaşıAylık Maliyet
Whisper Hostedwhisper-1$0.006$360
DeepgramNova-3$0.0043$258
AssemblyAINano$0.0125$750
AssemblyAIBest$0.0170$1.020
Whisper Self-hostedlarge-v3~$0 APIGPU maliyeti

Kaynaklar: OpenAI, Deepgram, AssemblyAI

Self-hosted Whisper yüksek hacimlerde API maliyetini tamamen kesiyor. AWS’de g4dn.xlarge ($0.526/saat) ile 1.000 saatlik transkripsiyon için GPU maliyeti $30-50 dolayında; hosted API’ye kıyasla çok daha az. Öte yandan altyapı kurulum ve bakım yükü gerçek, bu hesaba katılmalı. Küçük takımlar için 500 saatin altında hosted API daha az baş ağrısı getiriyor; üzerinde self-hosted geçiş ciddi tasarruf sağlıyor.

Deepgram fiyat açısından hosted seçenekler arasında en ucuzu. Ama Türkçe desteği olmadığı için bu avantaj Türk geliştiricilere çoğunlukla uygulanamıyor. AssemblyAI ise LeMUR gibi ekstra özellikler kullandığınızda maliyet hızla çıkıyor; bütçe planlaması için sabit transkripsiyon fiyatının ötesinde LLM sorgu maliyetini de hesaba katın.

Hangisini Seçmeli: Karar Rehberi

SenaryoÖnerilen
Türkçe içerik transkripsiyonWhisper
Yüksek hacim, maliyet öncelikliDeepgram veya Whisper Self-hosted
Canlı/gerçek zamanlı streamingDeepgram
Görüşme analizi + LLM sorgulamaAssemblyAI
Veri gizliliği / on-prem zorunluWhisper Self-hosted
Çok sayıda dil desteğiWhisper

Türk geliştiriciler için pratik kural: prototip veya düşük hacim için Whisper Hosted API kurulumu en az sürüklüyor. Üretim ve yüksek hacimde self-hosted geçiş ciddi maliyet avantajı getiriyor. İngilizce içerikle gerçek zamanlı iş yapıyorsanız Deepgram, görüşme zekasına ihtiyaç duyulan CRM veya satış senaryolarında AssemblyAI daha uygun düşüyor.

Whisper’ın Türkçe yeteneklerine ilişkin ek teknik ayrıntılar için Whisper nedir sayfasına bakabilirsiniz. Ses AI ekosisteminin geri kalanını merak ediyorsanız ses klonlama ve TTS araçları yazısı ilgili bağlamı veriyor.

Sonuç

Üç servisi aynı proje içinde birden kullanmak mantıklı olabilir. Türkçe ses için Whisper, İngilizce gerçek zamanlı toplantı için Deepgram, İngilizce satış görüşmesi analizi için AssemblyAI. Seçim mutlaka tek bir servise kilitlenmeyi gerektirmiyor; kullanım senaryosuna göre yönlendirmek REST API katmanında yapılabilecek görece basit bir iş.

Başlangıç için Whisper’ın hosted API’si en az kurulum gerektiren nokta. Beş satır kodla ilk transkripsiyonu çalışır hale getirebilirsiniz; oradan ölçek ve gereksinim netleştikçe self-hosted veya farklı bir servis değerlendirilebilir.

auto_stories İlgili Makaleler