Speech-to-Text (ASR) (Sesten Metne (Otomatik Konuşma Tanıma))

Konuşulan dili gerçek zamanlı olarak yazıya dönüştüren, Transformer tabanlı akustik ve dil modellerini birleştiren yapay zeka teknolojisi.

Speech-to-Text (STT) veya Otomatik Konuşma Tanıma (ASR — Automatic Speech Recognition), mikrofondan ya da ses dosyasından gelen konuşulmuş dili analiz ederek yazıya dönüştüren yapay zeka teknolojisidir. Siri, Google Asistan ve otomatik YouTube altyazılarının temelinde bu teknoloji yatar. Modern STT sistemlerinin mimarisi birkaç katmandan oluşur. Akustik model, ham ses sinyallerindeki konuşma birimlerini (fonemleri) tanır; dil modeli ise tanınan ses örüntülerini anlamlı kelime ve cümlelere dönüştürür. 2015 yılından itibaren bu iki ayrı bileşen, uçtan uca (end-to-end) derin öğrenme mimarileriyle tek bir modelde birleştirilmeye başlandı. Günümüzde en yaygın yaklaşım Transformer tabanlı modeller olan Wav2Vec 2.0 (Meta) ve Whisper (OpenAI) gibi sistemlerdir. Whisper, 2022'de OpenAI tarafından piyasaya sürülen ve 680.000 saat ses verisiyle eğitilen çok dilli bir STT modelidir. Açık kaynaklı yapısı geliştiricilerin özgürce kullanımına imkân tanır; Türkçe dahil 99 dili destekler. Google'ın USM (Universal Speech Model) modeli ise 300'den fazla dili kapsayan kurumsal ölçekli bir ASR altyapısı sunar. Kalite ölçütü olarak WER (Word Error Rate — Kelime Hata Oranı) kullanılır: üretilen metin ile referans metin arasındaki kelime düzeyindeki hatalar normalleştirilerek hesaplanır. İnsan seviyesi İngilizce konuşma tanımada WER %5 civarındayken modern sistemler bu eşiğe ulaşmış ya da geçmiştir. Türkiye'de STT teknolojisi müşteri hizmetleri çağrı merkezi analitiği, tıbbi dikte sistemleri ve dil öğrenme uygulamalarında giderek yaygınlaşmaktadır. Türkçenin aglütinatif yapısı (çok ekli sözcük biçimleri) sözcük dağarcığı büyüklüğü açısından STT modellerine ek zorluk çıkarmaktadır; bu nedenle Türkçeye özgü ince ayarlı modeller standart modellere kıyasla daha yüksek doğruluk sunar. Gerçek zamanlı STT uygulamalarında gecikme (latency) kritik bir tasarım parametresidir: çevrimiçi konferans altyazıları için 200 ms altı gecikme hedeflenir. Streaming ASR mimarileri, konuşmacı konuşmaya devam ederken kısmi transkriptler üretir ve sonucu iteratif olarak günceller. Bu yaklaşım, Conformer mimarisi gibi yerel dikkat (local attention) mekanizmalarını kullanan modellerle verimli biçimde uygulanır.

graphic_eq Nasıl Çalışır?

Sistem önce havadaki ses dalgalarını dijital frekanslara (spektrogram) çevirir. Akustik bir yapay sinir ağı, bu frekansların hangi fonemlere (ses birimlerine) denk geldiğini tahmin eder. Ancak asıl sihir Dil Modelinde (Language Model) yaşanır. Model 'Kar yağdı' ile 'Kar yandı' gibi sesteş ifadeleri birbirinden ayırmak için cümlenin genel mantığına bakar ve en anlamlı olanı metne döker.

Günümüzdeki Başarıları

mic OpenAI Whisper

680.000 saatlik veriyle eğitilen, arka plan gürültüsü olsa bile şiveleri, aksanları ve hızlı konuşmayı insan seviyesinde (hatta daha iyi) yazıya dökebilen açık kaynak model.

translate Eşzamanlı Çeviri

ASR sistemi duyduğu Fransızca sesi anında metne döker, LLM onu İngilizceye çevirir ve TTS sistemi kulaklıktan İngilizce okur. Babil balığı gerçeğe dönüşmüştür.

Önemli STT Modelleri ve Mimarileri

  • check_circle OpenAI Whisper: 680 saatlik çok dilli ses verisiyle eğitilen Whisper, 100'den fazla dili tanıyabilen ve gürültüye dayanıklı açık kaynaklı bir konuşma tanıma modelidir. Encoder-decoder transformer mimarisini kullanır; otomatik dil algılama ve konuşmacı ayrıştırma özellikleri sunar.
  • check_circle Wav2Vec 2.0 (Meta AI): Denetimsiz ön eğitim (self-supervised pre-training) ile konuşma örüntülerini öğrenen Wav2Vec 2.0, az etiketli veriyle yüksek doğruluk sağlar. 10 dakika etiketli veriyle kullanışlı bir model üretebilmesi az kaynaklı diller için büyük avantajdır.
  • check_circle DeepSpeech ve CTC Mimarileri: Mozilla DeepSpeech ve CTC (Connectionist Temporal Classification) tabanlı modeller, uçtan uca (end-to-end) konuşma tanımayı yaygınlaştırdı. Geleneksel akustik + dil modeli ikilisini tek sinir ağına entegre ederek sistem karmaşıklığını azalttı.
  • check_circle Streaming STT: Gerçek Zamanlı Transkripsiyon: Canlı altyazı (gerçek zamanlı toplantı transkripti) ve sesli komut sistemleri için ses akışını parça parça işleyen streaming modeller kullanılır. Gecikme (latency) ve doğruluk arasındaki denge bu uygulamaların kritik tasarım parametresidir.

Konuşmadan Metne Dönüştürmenin Kullanım Alanları

Konuşmadan metne dönüştürme (speech-to-text / automatic speech recognition, ASR), modern insan-bilgisayar etkileşiminin temel bileşeni haline geldi. Sesli asistanlarda (Siri, Google Asistan, Alexa) anlık komut tanıma; toplantı ve görüşmelerin otomatik transkripte edilmesi (Otter.ai, Whisper); çağrı merkezi konuşmalarının analizi ve kalite kontrolü; kısa video içeriklerinin otomatik altyazı üretimi (YouTube, TikTok) ve tıbbi konuşma kayıtlarının klinik notlara dönüştürülmesi (sağlıkta dijitalleşme) başlıca uygulama alanlarıdır. Türkçe gibi düşük kaynaklı diller için Whisper ve wav2vec tabanlı modeller son yıllarda önemli ilerleme sağladı.

Speech-to-Text Teknolojileri ve Modelleri

  • check_circle OpenAI Whisper: 680.000 saatlik çok dilli ses verisiyle eğitilmiş açık kaynak model. 99 dili destekler; güçlü gürültü dayanıklılığı. Large-v3 modeli Türkçe dahil pek çok dilde piyasanın en iyileri arasında. WhisperX gibi araçlar konuşmacı ayrıştırma ve kelime düzeyinde zaman damgası ekler.
  • check_circle Google Speech-to-Text ve Cloud STT API'leri: Gerçek zamanlı transkripsiyon için optimize edilmiş; 125 dil destekler, özel sözcük listeleri ve otomatik noktalama sunar. Amazon Transcribe, Microsoft Azure Speech ve AssemblyAI rekabetçi bulut alternatifleridir; konuşmacı etiketi, duygu analizi gibi ek özellikler sunulur.
  • check_circle Uç Cihaz (On-Device) STT: Gizlilik için bulut yerine yerel çalışan modeller tercih edilir. Apple'ın Core ML tabanlı STT, Android'in yerel konuşma tanıma API'si. Whisper.cpp ve faster-whisper: optimize edilmiş yerel çalıştırma. Wav2Vec2 ve XTTS gibi açık kaynak modeller özelleştirilebilir.

STT Kalite Metrikleri ve Zorlukları

Temel metrik: Word Error Rate (WER) = (ekleme + silme + ikame) / referans kelime sayısı. İyi STT sistemi %5 altı WER hedefler; genel ortamda %3-8 tipik aralıktır. Zorluklar: aksan ve lehçe çeşitliliği, üst üste konuşma (diarization sorunu), arka plan gürültüsü, teknik terminoloji ve özel isimler. Alan uyarlaması: sağlık, hukuk veya teknik alanlara özgü sözlüklerle model performansı önemli ölçüde artırılabilir. Gerçek zamanlı vs. toplu transkripsiyon: streaming API'ler gecikmeye, toplu işleme doğruluğa optimize edilir.

Sıkça Sorulan Sorular

  • check_circle Speech-to-text nedir?: Konuşmadan metne dönüştürme (speech-to-text / ASR — Automatic Speech Recognition), insan sesini bilgisayar tarafından yazılı metne çeviren yapay zeka teknolojisidir. Ses sinyalini fonem (ses birimi) dizisine, ardından kelimelere dönüştürür. OpenAI Whisper, Google Speech-to-Text ve Azure Speech bu alanın öne çıkan servis ve modelleridir.
  • check_circle Whisper modeli ne kadar iyi?: OpenAI Whisper, geniş dil desteği (100+ dil), gürültüye dayanıklılığı ve açık kaynak olması nedeniyle konuşma tanıma alanında referans model statüsüne ulaştı. Özellikle Türkçe gibi az kaynaklı dillerde daha önceki modellere göre belirgin doğruluk artışı sağlar. Large-v3 versiyonu en yüksek doğruluğu sunarken Turbo versiyonu hız/doğruluk dengesini optimize etmiştir.
  • check_circle STT ile TTS arasındaki fark nedir?: STT (Speech-to-Text): sesi metne çevirir — konuşma tanıma. TTS (Text-to-Speech): metni sese çevirir — konuşma sentezi. Tam bir sesli diyalog sistemi (conversational AI) her ikisini birlikte kullanır: kullanıcının sesi STT ile metne çevrilir, LLM metin yanıt üretir, TTS yanıtı sese dönüştürür.
  • check_circle En iyi speech-to-text modeli hangisidir?: Kullanım senaryosuna göre değişir. Çevrimdışı/açık kaynak: OpenAI Whisper large-v3. Gerçek zamanlı bulut: Google STT veya AssemblyAI. Özel alan: Whisper'ı alan verisiyle fine-tune edilmiş model.
  • check_circle Türkçe speech-to-text için hangi çözüm önerilir?: OpenAI Whisper large-v3 Türkçe'de güçlü performans gösterir. Google Cloud STT Türkçeyi destekler. Yerli alternatif: Sestek ve Unitech gibi Türk firmalarının çözümleri kurumsal kullanım için mevcuttur.