ASR Nasıl Çalışır?
Ham ses sinyali önce özellik çıkarımına tabi tutulur: 25 ms'lik pencerelerle kesimlere ayrılan dalga formu, MFCC veya mel spektrogram vektörlerine dönüştürülür. Akustik model bu vektörleri fonem olasılıklarına eşler; dil modeli ise fonem dizisini anlamlı kelime öbeklerine çevirir. Geleneksel sistemlerde bu iki adım ayrı ayrı optimize edilirken modern end-to-end mimariler (Whisper, wav2vec 2.0) tüm akışı tek bir transformatörde birleştirir. Dekoder aşamasında beam search gibi algoritmalar en olası transkripti seçerken sözdizimsel tutarlılığı da gözetir.
Tarihsel Gelişim
1952'de Bell Labs'in 'Audrey' sistemi yalnızca 10 rakamı tanıyabiliyordu. 1980'lerde HMM (Hidden Markov Model) tabanlı istatistiksel yaklaşım standart hâle geldi; CMU Sphinx ve IBM ViaVoice bu dönemin sembolik ürünleridir. 2012–2014 arasında LSTM ve GRU ağları sahneye çıktı; Deep Speech (Baidu) ve CTC kaybı geleneksel sistemlerin önüne geçti. 2017'deki Attention Is All You Need makalesi transformatör mimarisini kamuoyuyla paylaştı; 2020'de wav2vec 2.0 öz-denetimli ön-eğitimle az etiketli veriden yüksek doğruluk elde etti. 2022'de OpenAI'ın Whisper modeli açık kaynak yayınlanarak sektörü demokratikleştirdi.
Başarım Metrikleri ve Zorluklar
WER = (S + D + I) / N formülüyle hesaplanır; S ikame, D silme, I ekleme, N referans kelime sayısıdır. %5 altı WER insan düzeyine yakın kabul edilir. Türkçe gibi eklemeli dillerde morfolojik çeşitlilik WER'i yükseltir; 'gidebilecekmiş' tek kelimesi Türkçe'de yüzlerce forma bürünebilir. Konuşma hızı, gürültü, ağız farklılıkları ve örtüşen konuşmacılar (diarization sorunu) diğer başlıca zorluklardır. Alana özgü jargon (tıbbi, hukuki) da genel amaçlı modellerin hatasını artırır; bu nedenle ince ayar (fine-tuning) kaçınılmazdır.
Uygulama Alanları
Tüketici elektroniğinde sesli asistanlar (Siri, Google Assistant, Alexa) ASR'ın en görünür örneğidir. Medya erişilebilirliğinde canlı altyazı ve video transkripti üretimi milyonlarca kullanıcının içeriğe erişimini kolaylaştırır. Sağlıkta hekimler, klinik görüşmeyi gerçek zamanlı metne dönüştürerek belgeleme yükünü azaltır. Çağrı merkezi analitiğinde konuşmalar otomatik transkript edilerek duygu analizi ve kalite denetiminde kullanılır. Toplantı asistanları (Otter.ai, Fireflies) gerçek zamanlı alıntı ve özet üretir.
Sık Sorulan Sorular
- check_circle ASR ile NLP arasındaki fark nedir?: ASR ses sinyalini metne çevirir; NLP ise o metni anlayıp yorumlar. İkisi birbirini tamamlayan katmanlardır: sesli asistanlar önce ASR, ardından NLP kullanır.
- check_circle Whisper modelini ücretsiz kullanabilir miyim?: Evet. OpenAI Whisper açık kaynak (MIT lisanslı) olarak GitHub'da mevcuttur; yerel olarak çalıştırabilir veya Hugging Face Transformers kütüphanesiyle entegre edebilirsiniz.
- check_circle Türkçe ASR için hangi modeller önerilir?: Whisper large-v3 Türkçe'de iyi performans verir. Sınırlı veri ortamları için wav2vec 2.0 veya HuBERT tabanlı Türkçe ince ayarlı modeller Hugging Face'te mevcuttur.
- check_circle Gerçek zamanlı ASR ile toplu (batch) ASR arasındaki fark nedir?: Gerçek zamanlı ASR düşük gecikme önceliklidir; sıklıkla çevrimiçi (streaming) decoder kullanır. Toplu ASR ise tüm kaydı işleyip daha yüksek doğruluk sunar; canlı transkript gerekmeyen durumlarda tercih edilir.