tag Whisper

Speech Recognition (Konuşma Tanıma (ASR))

Bu sayfada Whisper (Speech Recognition (Konuşma Tanıma (ASR))) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

Konuşma tanıma (Automatic Speech Recognition — ASR), insan sesini işleyerek metne dönüştüren yapay zeka teknolojisidir. Ses dalgaları dijital sinyale çevrilir, akustik özellikler (MFCCs — Mel Frekans Kepstrum Katsayıları gibi) çıkarılır ve derin öğrenme modelleri bu özellikleri fonem, kelime ve cümle dizilerine eşler. Tarihsel gelişim açısından ilk ASR sistemleri 1950'lerde Bell Labs'ta gizli Markov modelleri (HMM) ve n-gram dil modelleriyle kuruldu. 2012 sonrasında derin sinir ağları (özellikle LSTM ve CTC — Connectionist Temporal Classification kaybı) bu modellerin yerini aldı. 2023'te OpenAI'nin Whisper modeli ile transformer tabanlı uçtan uca ASR ana akıma girdi; Whisper large-v3 100'den fazla dilde yüksek doğruluk sunmaktadır. Modern ASR mimarileri iki yaklaşıma ayrılmaktadır: Hibrit HMM-DNN sistemleri (Kaldi, ESPnet gibi frameworkler) ve uçtan uca transformer modelleri (Whisper, Wav2Vec 2.0, Conformer). Uçtan uca modeller dil modelini ayrı tutma zorunluluğunu ortadan kaldırarak daha basit sistem mimarisine olanak tanır. Conformer mimarisi, ses için özelleştirilmiş conv katmanlarını transformer ile birleştirerek akustik özelliklerin yerel ve küresel bağlamını birlikte yakalamaktadır. Türkçe konuşma tanıma alanında Whisper large-v3, standart konuşma koşullarında çok yüksek doğruluk sunan erişilebilir en iyi modeldir. Google Cloud Speech-to-Text ve AWS Transcribe kurumsal düzeyde Türkçe desteği sağlar. Gerçek zamanlı uygulamalarda faster-whisper kütüphanesi CPU ve GPU üzerinde optimize edilmiş çıkarım sunarak gecikmeyi minimize eder. ASR'nin zorlu senaryoları arasında arka plan gürültüsü, çakışan konuşmacılar, teknik jargon ve aksan çeşitliliği sayılabilir. Bu sorunlar için gürültü giderme (noise suppression), hoparlör ayrıştırma (speaker diarization) ve alan bazlı ince ayar (domain-specific fine-tuning) teknikleri kullanılır. Erişilebilirlik, gerçek zamanlı altyazı, çağrı merkezi analizi ve tıbbi transkripsiyon başlıca uygulama alanlarıdır.

code_blocks

Speech Recognition (Konuşma Tanıma (ASR))

Konuşma tanıma (Automatic Speech Recognition — ASR), insan sesini işleyerek metne dönüştüren yapay zeka teknolojisidir. Ses dalgaları dijital sinyale çevrilir, akustik özellikler (MFCCs — Mel Frekans Kepstrum Katsayıları gibi) çıkarılır ve derin öğrenme modelleri bu özellikleri fonem, kelime ve cümle dizilerine eşler. Tarihsel gelişim açısından ilk ASR sistemleri 1950'lerde Bell Labs'ta gizli Markov modelleri (HMM) ve n-gram dil modelleriyle kuruldu. 2012 sonrasında derin sinir ağları (özellikle LSTM ve CTC — Connectionist Temporal Classification kaybı) bu modellerin yerini aldı. 2023'te OpenAI'nin Whisper modeli ile transformer tabanlı uçtan uca ASR ana akıma girdi; Whisper large-v3 100'den fazla dilde yüksek doğruluk sunmaktadır. Modern ASR mimarileri iki yaklaşıma ayrılmaktadır: Hibrit HMM-DNN sistemleri (Kaldi, ESPnet gibi frameworkler) ve uçtan uca transformer modelleri (Whisper, Wav2Vec 2.0, Conformer). Uçtan uca modeller dil modelini ayrı tutma zorunluluğunu ortadan kaldırarak daha basit sistem mimarisine olanak tanır. Conformer mimarisi, ses için özelleştirilmiş conv katmanlarını transformer ile birleştirerek akustik özelliklerin yerel ve küresel bağlamını birlikte yakalamaktadır. Türkçe konuşma tanıma alanında Whisper large-v3, standart konuşma koşullarında çok yüksek doğruluk sunan erişilebilir en iyi modeldir. Google Cloud Speech-to-Text ve AWS Transcribe kurumsal düzeyde Türkçe desteği sağlar. Gerçek zamanlı uygulamalarda faster-whisper kütüphanesi CPU ve GPU üzerinde optimize edilmiş çıkarım sunarak gecikmeyi minimize eder. ASR'nin zorlu senaryoları arasında arka plan gürültüsü, çakışan konuşmacılar, teknik jargon ve aksan çeşitliliği sayılabilir. Bu sorunlar için gürültü giderme (noise suppression), hoparlör ayrıştırma (speaker diarization) ve alan bazlı ince ayar (domain-specific fine-tuning) teknikleri kullanılır. Erişilebilirlik, gerçek zamanlı altyazı, çağrı merkezi analizi ve tıbbi transkripsiyon başlıca uygulama alanlarıdır.

arrow_forward
mic

Speech-to-Text (ASR) (Sesten Metne (Otomatik Konuşma Tanıma))

Speech-to-Text (STT) veya Otomatik Konuşma Tanıma (ASR — Automatic Speech Recognition), mikrofondan ya da ses dosyasından gelen konuşulmuş dili analiz ederek yazıya dönüştüren yapay zeka teknolojisidir. Siri, Google Asistan ve otomatik YouTube altyazılarının temelinde bu teknoloji yatar. Modern STT sistemlerinin mimarisi birkaç katmandan oluşur. Akustik model, ham ses sinyallerindeki konuşma birimlerini (fonemleri) tanır; dil modeli ise tanınan ses örüntülerini anlamlı kelime ve cümlelere dönüştürür. 2015 yılından itibaren bu iki ayrı bileşen, uçtan uca (end-to-end) derin öğrenme mimarileriyle tek bir modelde birleştirilmeye başlandı. Günümüzde en yaygın yaklaşım Transformer tabanlı modeller olan Wav2Vec 2.0 (Meta) ve Whisper (OpenAI) gibi sistemlerdir. Whisper, 2022'de OpenAI tarafından piyasaya sürülen ve 680.000 saat ses verisiyle eğitilen çok dilli bir STT modelidir. Açık kaynaklı yapısı geliştiricilerin özgürce kullanımına imkân tanır; Türkçe dahil 99 dili destekler. Google'ın USM (Universal Speech Model) modeli ise 300'den fazla dili kapsayan kurumsal ölçekli bir ASR altyapısı sunar. Kalite ölçütü olarak WER (Word Error Rate — Kelime Hata Oranı) kullanılır: üretilen metin ile referans metin arasındaki kelime düzeyindeki hatalar normalleştirilerek hesaplanır. İnsan seviyesi İngilizce konuşma tanımada WER %5 civarındayken modern sistemler bu eşiğe ulaşmış ya da geçmiştir. Türkiye'de STT teknolojisi müşteri hizmetleri çağrı merkezi analitiği, tıbbi dikte sistemleri ve dil öğrenme uygulamalarında giderek yaygınlaşmaktadır. Türkçenin aglütinatif yapısı (çok ekli sözcük biçimleri) sözcük dağarcığı büyüklüğü açısından STT modellerine ek zorluk çıkarmaktadır; bu nedenle Türkçeye özgü ince ayarlı modeller standart modellere kıyasla daha yüksek doğruluk sunar. Gerçek zamanlı STT uygulamalarında gecikme (latency) kritik bir tasarım parametresidir: çevrimiçi konferans altyazıları için 200 ms altı gecikme hedeflenir. Streaming ASR mimarileri, konuşmacı konuşmaya devam ederken kısmi transkriptler üretir ve sonucu iteratif olarak günceller. Bu yaklaşım, Conformer mimarisi gibi yerel dikkat (local attention) mekanizmalarını kullanan modellerle verimli biçimde uygulanır.

arrow_forward