tag SesDerin
Speech Recognition (Konuşma Tanıma (ASR))
Bu sayfada SesDerin (Speech Recognition (Konuşma Tanıma (ASR))) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
Konuşma tanıma (Speech Recognition), insan sesini makine tarafından otomatik olarak yazılı metne dönüştüren teknoloji ve araştırma alanıdır. Otomatik Konuşma Tanıma (Automatic Speech Recognition, ASR) olarak da anılan bu alan, akustik sinyalleri önce sayısal özellik vektörlerine, ardından kelime veya karakter dizilerine dönüştürür. Temel işlem hattı üç ana aşamadan oluşur: ses ön işleme (gürültü azaltma, ses normalizasyonu ve ses etkinlik tespiti), özellik çıkarma (Mel Frekans Kepstral Katsayıları, MFCC veya mel-spektrogram hesaplama) ve dil modeli tabanlı kod çözme aşaması. Tarihsel gelişim açısından değerlendirildiğinde Hidden Markov Model (HMM) ve Gaussian Mixture Model (GMM) kombinasyonları bu alanda uzun yıllar boyunca endüstri standardı olmuştur. 2010lu yıllarda derin öğrenmenin hızlı yükselişiyle birlikte tekrarlayan sinir ağları (RNN, LSTM) ve ardından Transformer mimarisi sahneye girmiştir. OpenAI tarafından 2022 yılında kamuoyuyla paylaşılan Whisper modeli, 680.000 saatlik çok dilli ses verisiyle eğitilmiş olup düşük kaynaklı diller dahil pek çok dilde yüksek tanıma doğruluğu göstermektedir. Meta tarafından geliştirilen MMS (Massively Multilingual Speech) projesi ise 1.100 den fazla dili kapsayan veri kümesiyle az kaynaklı dil araştırmalarına önemli bir katkı sunmuştur. Modern ASR sistemleri Kelime Hata Oranı (Word Error Rate, WER) metriğiyle karşılaştırılır. Temiz stüdyo ortamında en iyi sistemler yüzde üç ile beş arasında WER elde edebilirken gürültülü ortam, aksan çeşitliliği ve alan jargonu bu oranı ciddi biçimde yükseltebilmektedir. Gerçek zamanlı akış (streaming) sistemleri düşük gecikme için optimize edilmiş küçük modeller kullanırken toplu sistemler daha yüksek doğruluk için büyük modellerden yararlanır. Konuşma tanıma; sesli asistanlar, otomatik altyazı üretimi, çağrı merkezi kalite analizi, tıbbi dikte yazılımları ve motor engelli bireyler için geliştirilen erişilebilirlik araçlarında kilit bir teknoloji konumundadır. Yüksek çekimli ve eklemeli bir dil yapısına sahip olan Türkçe, sözcük biçimbilimi (morfoloji) açısından İngilizceye kıyasla ASR sistemleri için ek güçlükler barındırmaktadır.