ASR (Automatic Speech Recognition) (ASR — Otomatik Konuşma Tanıma)

Konuşulan sesi otomatik olarak yazıya çeviren yapay zeka teknolojisi.

ASR (Automatic Speech Recognition — Otomatik Konuşma Tanıma), insan sesini gerçek zamanlı olarak metne dönüştüren yapay zeka alt dalıdır. Mikrofon gibi bir ses girişinden alınan ham ses dalgaları; akustik model, dil modeli ve çözümleme (decoding) katmanı üçlüsü aracılığıyla işlenerek yazılı çıktıya dönüştürülür. Teknolojinin kökeni 1950'lerin ilkel rakam tanıma sistemlerine dayanır; ancak derin öğrenme devriminden sonra sıçrama yaşandı. 2014'te CTC (Connectionist Temporal Classification) kaybı ve end-to-end sinir ağları, HMM (Hidden Markov Model) tabanlı geleneksel akışın yerini almaya başladı. 2022'de OpenAI'ın açık kaynaklı Whisper modeli 680.000 saatlik çok dilli veriyle eğitildi; Türkçe dahil 99 dilde yüksek doğruluk sergiledi. Bir ASR sistemi üç temel bileşenden oluşur: Akustik Model ses özelliklerini (MFCCs, mel spektrogramları) fonem olasılıklarına eşler; Dil Modeli kelime dizileri arasında en olası olanı seçer; Decoder ise ışın araması (beam search) gibi algoritmalarla en yüksek skorlu transkripti bulur. Modern transformatör tabanlı sistemlerde bu üç katman tek bir uçtan uca mimaride birleşmiştir. ASR'ın başarımı Kelime Hata Oranı (Word Error Rate — WER) ile ölçülür: %5 WER'in altı insan düzeyine yakın kabul edilir. İngilizce için önde gelen modeller %3–6 WER aralığında yer alırken, Türkçe gibi zengin çekimli dillerde veri azlığı ve morfolojik karmaşıklık nedeniyle WER daha yüksek seyredebilir. Uygulama alanları geniştir: sesli asistanlar (Siri, Google Assistant), gerçek zamanlı altyazı, çağrı merkezi analizi, tıbbi dikte sistemleri, toplantı transkripti ve erişilebilirlik araçları. Gürültülü ortam, aksan çeşitliliği ve konuşmacıya özgü kalıplar hâlâ temel zorluklar olmaya devam etmekte; bu alanda konuşmacı ayrıştırma (speaker diarization) ve gürültü bastırma ön işleme adımları kritik rol üstlenir.

ASR Nasıl Çalışır?

Ham ses sinyali önce özellik çıkarımına tabi tutulur: 25 ms'lik pencerelerle kesimlere ayrılan dalga formu, MFCC veya mel spektrogram vektörlerine dönüştürülür. Akustik model bu vektörleri fonem olasılıklarına eşler; dil modeli ise fonem dizisini anlamlı kelime öbeklerine çevirir. Geleneksel sistemlerde bu iki adım ayrı ayrı optimize edilirken modern end-to-end mimariler (Whisper, wav2vec 2.0) tüm akışı tek bir transformatörde birleştirir. Dekoder aşamasında beam search gibi algoritmalar en olası transkripti seçerken sözdizimsel tutarlılığı da gözetir.

Tarihsel Gelişim

1952'de Bell Labs'in 'Audrey' sistemi yalnızca 10 rakamı tanıyabiliyordu. 1980'lerde HMM (Hidden Markov Model) tabanlı istatistiksel yaklaşım standart hâle geldi; CMU Sphinx ve IBM ViaVoice bu dönemin sembolik ürünleridir. 2012–2014 arasında LSTM ve GRU ağları sahneye çıktı; Deep Speech (Baidu) ve CTC kaybı geleneksel sistemlerin önüne geçti. 2017'deki Attention Is All You Need makalesi transformatör mimarisini kamuoyuyla paylaştı; 2020'de wav2vec 2.0 öz-denetimli ön-eğitimle az etiketli veriden yüksek doğruluk elde etti. 2022'de OpenAI'ın Whisper modeli açık kaynak yayınlanarak sektörü demokratikleştirdi.

Başarım Metrikleri ve Zorluklar

WER = (S + D + I) / N formülüyle hesaplanır; S ikame, D silme, I ekleme, N referans kelime sayısıdır. %5 altı WER insan düzeyine yakın kabul edilir. Türkçe gibi eklemeli dillerde morfolojik çeşitlilik WER'i yükseltir; 'gidebilecekmiş' tek kelimesi Türkçe'de yüzlerce forma bürünebilir. Konuşma hızı, gürültü, ağız farklılıkları ve örtüşen konuşmacılar (diarization sorunu) diğer başlıca zorluklardır. Alana özgü jargon (tıbbi, hukuki) da genel amaçlı modellerin hatasını artırır; bu nedenle ince ayar (fine-tuning) kaçınılmazdır.

Uygulama Alanları

Tüketici elektroniğinde sesli asistanlar (Siri, Google Assistant, Alexa) ASR'ın en görünür örneğidir. Medya erişilebilirliğinde canlı altyazı ve video transkripti üretimi milyonlarca kullanıcının içeriğe erişimini kolaylaştırır. Sağlıkta hekimler, klinik görüşmeyi gerçek zamanlı metne dönüştürerek belgeleme yükünü azaltır. Çağrı merkezi analitiğinde konuşmalar otomatik transkript edilerek duygu analizi ve kalite denetiminde kullanılır. Toplantı asistanları (Otter.ai, Fireflies) gerçek zamanlı alıntı ve özet üretir.

Sık Sorulan Sorular

  • check_circle ASR ile NLP arasındaki fark nedir?: ASR ses sinyalini metne çevirir; NLP ise o metni anlayıp yorumlar. İkisi birbirini tamamlayan katmanlardır: sesli asistanlar önce ASR, ardından NLP kullanır.
  • check_circle Whisper modelini ücretsiz kullanabilir miyim?: Evet. OpenAI Whisper açık kaynak (MIT lisanslı) olarak GitHub'da mevcuttur; yerel olarak çalıştırabilir veya Hugging Face Transformers kütüphanesiyle entegre edebilirsiniz.
  • check_circle Türkçe ASR için hangi modeller önerilir?: Whisper large-v3 Türkçe'de iyi performans verir. Sınırlı veri ortamları için wav2vec 2.0 veya HuBERT tabanlı Türkçe ince ayarlı modeller Hugging Face'te mevcuttur.
  • check_circle Gerçek zamanlı ASR ile toplu (batch) ASR arasındaki fark nedir?: Gerçek zamanlı ASR düşük gecikme önceliklidir; sıklıkla çevrimiçi (streaming) decoder kullanır. Toplu ASR ise tüm kaydı işleyip daha yüksek doğruluk sunar; canlı transkript gerekmeyen durumlarda tercih edilir.