Speech Recognition (Konuşma Tanıma (ASR))

Ses dalgalarını metne dönüştüren otomatik konuşma tanıma teknolojisi; sesli asistanlar, transkripsiyon yazılımları ve erişilebilirlik araçlarının temel bileşeni.

Konuşma tanıma (Speech Recognition), insan sesini makine tarafından otomatik olarak yazılı metne dönüştüren teknoloji ve araştırma alanıdır. Otomatik Konuşma Tanıma (Automatic Speech Recognition, ASR) olarak da anılan bu alan, akustik sinyalleri önce sayısal özellik vektörlerine, ardından kelime veya karakter dizilerine dönüştürür. Temel işlem hattı üç ana aşamadan oluşur: ses ön işleme (gürültü azaltma, ses normalizasyonu ve ses etkinlik tespiti), özellik çıkarma (Mel Frekans Kepstral Katsayıları, MFCC veya mel-spektrogram hesaplama) ve dil modeli tabanlı kod çözme aşaması. Tarihsel gelişim açısından değerlendirildiğinde Hidden Markov Model (HMM) ve Gaussian Mixture Model (GMM) kombinasyonları bu alanda uzun yıllar boyunca endüstri standardı olmuştur. 2010lu yıllarda derin öğrenmenin hızlı yükselişiyle birlikte tekrarlayan sinir ağları (RNN, LSTM) ve ardından Transformer mimarisi sahneye girmiştir. OpenAI tarafından 2022 yılında kamuoyuyla paylaşılan Whisper modeli, 680.000 saatlik çok dilli ses verisiyle eğitilmiş olup düşük kaynaklı diller dahil pek çok dilde yüksek tanıma doğruluğu göstermektedir. Meta tarafından geliştirilen MMS (Massively Multilingual Speech) projesi ise 1.100 den fazla dili kapsayan veri kümesiyle az kaynaklı dil araştırmalarına önemli bir katkı sunmuştur. Modern ASR sistemleri Kelime Hata Oranı (Word Error Rate, WER) metriğiyle karşılaştırılır. Temiz stüdyo ortamında en iyi sistemler yüzde üç ile beş arasında WER elde edebilirken gürültülü ortam, aksan çeşitliliği ve alan jargonu bu oranı ciddi biçimde yükseltebilmektedir. Gerçek zamanlı akış (streaming) sistemleri düşük gecikme için optimize edilmiş küçük modeller kullanırken toplu sistemler daha yüksek doğruluk için büyük modellerden yararlanır. Konuşma tanıma; sesli asistanlar, otomatik altyazı üretimi, çağrı merkezi kalite analizi, tıbbi dikte yazılımları ve motor engelli bireyler için geliştirilen erişilebilirlik araçlarında kilit bir teknoloji konumundadır. Yüksek çekimli ve eklemeli bir dil yapısına sahip olan Türkçe, sözcük biçimbilimi (morfoloji) açısından İngilizceye kıyasla ASR sistemleri için ek güçlükler barındırmaktadır.

ASR Nasıl Çalışır? Ses'ten Metne Zinciri

Ham ses dalgası önce çerçevelere (frame) bölünür; her çerçeve için mel frekans kepstral katsayıları (MFCC) ya da mel-spektrogram hesaplanır. Bu özellik dizisi bir encoder ağına (CNN, Conformer veya Transformer) verilir. Encoder çıktısı CTC (Connectionist Temporal Classification) kaybıyla doğrudan metin üretmek için kullanılır ya da bir decoder ile birlikte seq2seq biçiminde çalışır. Dil modeli entegrasyonu, fonetik olarak benzer kelimelerin bağlama uygun seçilmesini kolaylaştırır.

Tarihsel Gelişim: HMM'den Transformer'a

1970lerde Carnegie Mellon Üniversitesi'nde geliştirilen ilk sistemler yalnızca sınırlı kelime haznesiyle çalışıyordu. 1990larda HMM-GMM modelleri ticari ürünlere zemin hazırladı. 2012 sonrası derin sinir ağları WER'i dramatik biçimde düşürdü. 2017'de yayımlanan Attention Is All You Need makalesi Transformer mimarisini tanıttı; 2020'den itibaren wav2vec 2.0, HuBERT ve Whisper gibi öz-denetimli modeller mevcut ölçütleri yeniden şekillendirdi.

Whisper ve Modern Modeller

OpenAI Whisper, çok görevli (transkripsiyon, çeviri, dil tanımlama) ve çok dilli bir modeldir. Encoder-decoder Transformer mimarisi kullanan model 99 dili desteklemektedir. Meta'nın MMS projesi 1.100'den fazla dili kapsayan veri setiyle özellikle az kaynaklı diller için çığır açmıştır. Google'ın Universal Speech Model (USM) ise 300'ü aşkın dilde eğitilmiştir.

Zorluklar ve Çözüm Yöntemleri

Ortam gürültüsü, beamforming ve spectral subtraction teknikleriyle azaltılır. Aksan çeşitliliği için konuşmacıya özgü ince ayar (speaker adaptation) ve çok aksan veri artırma kullanılır. Alan jargonu için özel dil modeli adaptasyonu ya da prompt tabanlı yönlendirme tercih edilir. Gerçek zamanlı sistemlerde gecikme (latency) ile doğruluk arasındaki denge, streaming ASR mimarileriyle yönetilir.

Konuşma Tanıma Geliştirme Stratejileri

Whisper İnce Ayarı

Alana özgü Türkçe ses verisiyle Whisper üzerinde ince ayar; aksan ve terminoloji uyumu.

Gürültü Sağlamlığı

Ses veri artırma; gürültü ekleme, zaman germe ve frekans maskeleme ile robustness artırılır.

Akış Modu

Çevrimiçi ses akışı için küçük parçalar halinde çıkarım; gecikme ve doğruluk dengesi kritiktir.

Dil Model Entegrasyonu

Akustik modelin çıktısı dil modeli yeniden puanlama ile bağlamlara uygun hale getirilir.

Sık Sorulan Sorular

  • check_circle WER nedir ve iyi bir değer ne kadardır? Kelime Hata Oranı (WER), yanlış tanınan kelimelerin toplam kelime sayısına oranıdır. Temiz stüdyo sesi için yüzde 3-5 ulaşılabilir bir hedeftir; gürültülü telefon görüşmelerinde yüzde 15-25 daha yaygındır.
  • check_circle Konuşma tanıma ile ses tanıma arasındaki fark nedir? Konuşma tanıma söylenenleri metne çevirirken ses tanıma (speaker recognition) kişinin kimliğini belirler. İkisi çoğunlukla karıştırılır ancak farklı modeller ve hedefler gerektirir.
  • check_circle Türkçe için hangi ASR modelleri önerilir? Whisper large-v3 Türkçe'de güçlü sonuçlar vermektedir. Bunun yanı sıra Facebook MMS ve çeşitli Türkçe wav2vec 2.0 ince ayar modelleri Hugging Face üzerinden erişilebilir durumdadır.
  • check_circle Gerçek zamanlı ASR ile toplu ASR arasındaki temel fark nedir? Gerçek zamanlı sistemler düşük gecikme için daha küçük modeller ve streaming dekodlama kullanır. Toplu sistemler ise daha yüksek doğruluk için büyük modeller ve tam bağlam analizi yapabilir.