tag ASR
Acoustic Model (Akustik Model)
Bu sayfada ASR (Acoustic Model (Akustik Model)) etiketi ile işaretlenmiş 8 yapay zeka kavramını bulabilirsiniz.
Akustik Model, otomatik konuşma tanıma (ASR) sistemlerinin temel bileşenidir ve ses sinyalleri ile dilbilimsel birimler (fonemler, seslemler veya sözcükler) arasındaki istatistiksel ilişkiyi temsil eden bir modeldir. Konuşma işlemenin çekirdeğinde yer alan bu yapı, ham ses dalgalarını sayısal özelliklere (genellikle MFCC — Mel Frekansı Kepstral Katsayıları) dönüştürerek hangi sesbirime ya da sözcüğe karşılık geldiğini olasılıksal olarak tahmin eder. Tarihsel olarak akustik modeller, Gizli Markov Modelleri (Hidden Markov Models — HMM) ve Gauss Karışım Modelleri (GMM) üzerine inşa edilmiştir. Bu klasik yaklaşımda her fonem ayrı bir durum makinesiyle temsil edilir ve gözlem olasılıkları Gauss dağılımlarıyla hesaplanır. 1970'lerden 2000'lerin başına kadar konuşma tanımanın baskın paradigması olan bu yöntem, sınırlı veri ve hesaplama gücüyle bile kabul edilebilir sonuçlar vermiştir. Derin öğrenmenin yükselişiyle birlikte akustik modeller köklü bir dönüşüm geçirmiştir. Günümüz sistemlerinde Derin Sinir Ağları (DNN), Tekrarlayan Sinir Ağları (RNN), LSTM ve Transformer mimarileri, HMM ile hibrit ya da tamamen uçtan uca (end-to-end) biçimde kullanılmaktadır. OpenAI'nin Whisper modeli, dil modelini ve akustik modeli tek bir Transformer mimarisi altında birleştirerek son derece yüksek doğruluk oranları elde etmektedir. Akustik modelin eğitimi için yüzlerce hatta binlerce saat etiketlenmiş ses kaydı gerekmektedir. Çevre gürültüsü, farklı aksanlar, mikrofon kalitesi ve konuşma hızı tanıma doğruluğunu doğrudan etkiler. Transfer learning ve self-supervised learning yaklaşımları (wav2vec 2.0, HuBERT gibi modeller) etiketli veri ihtiyacını önemli ölçüde azaltmıştır. CTC (Connectionist Temporal Classification) kaybı veya dikkat tabanlı kod çözme mekanizmaları, sürekli ses sinyalinden ayrık sembol dizisine geçişi mümkün kılar. Akustik model çıkışı genellikle fonem olasılıkları dizisidir; bu olasılıklar dil modeliyle birleştirilerek nihai kelime transkripti üretilir. Türkçe gibi çekimli diller için akustik modellerin morfolojik çeşitliliği kapsayacak biçimde eğitilmesi, model kalitesi açısından kritik bir gereklilik olmaya devam etmektedir.
Acoustic Model (Akustik Model)
Akustik Model, otomatik konuşma tanıma (ASR) sistemlerinin temel bileşenidir ve ses sinyalleri ile dilbilimsel birimler (fonemler, seslemler veya sözcükler) arasındaki istatistiksel ilişkiyi temsil eden bir modeldir. Konuşma işlemenin çekirdeğinde yer alan bu yapı, ham ses dalgalarını sayısal özelliklere (genellikle MFCC — Mel Frekansı Kepstral Katsayıları) dönüştürerek hangi sesbirime ya da sözcüğe karşılık geldiğini olasılıksal olarak tahmin eder. Tarihsel olarak akustik modeller, Gizli Markov Modelleri (Hidden Markov Models — HMM) ve Gauss Karışım Modelleri (GMM) üzerine inşa edilmiştir. Bu klasik yaklaşımda her fonem ayrı bir durum makinesiyle temsil edilir ve gözlem olasılıkları Gauss dağılımlarıyla hesaplanır. 1970'lerden 2000'lerin başına kadar konuşma tanımanın baskın paradigması olan bu yöntem, sınırlı veri ve hesaplama gücüyle bile kabul edilebilir sonuçlar vermiştir. Derin öğrenmenin yükselişiyle birlikte akustik modeller köklü bir dönüşüm geçirmiştir. Günümüz sistemlerinde Derin Sinir Ağları (DNN), Tekrarlayan Sinir Ağları (RNN), LSTM ve Transformer mimarileri, HMM ile hibrit ya da tamamen uçtan uca (end-to-end) biçimde kullanılmaktadır. OpenAI'nin Whisper modeli, dil modelini ve akustik modeli tek bir Transformer mimarisi altında birleştirerek son derece yüksek doğruluk oranları elde etmektedir. Akustik modelin eğitimi için yüzlerce hatta binlerce saat etiketlenmiş ses kaydı gerekmektedir. Çevre gürültüsü, farklı aksanlar, mikrofon kalitesi ve konuşma hızı tanıma doğruluğunu doğrudan etkiler. Transfer learning ve self-supervised learning yaklaşımları (wav2vec 2.0, HuBERT gibi modeller) etiketli veri ihtiyacını önemli ölçüde azaltmıştır. CTC (Connectionist Temporal Classification) kaybı veya dikkat tabanlı kod çözme mekanizmaları, sürekli ses sinyalinden ayrık sembol dizisine geçişi mümkün kılar. Akustik model çıkışı genellikle fonem olasılıkları dizisidir; bu olasılıklar dil modeliyle birleştirilerek nihai kelime transkripti üretilir. Türkçe gibi çekimli diller için akustik modellerin morfolojik çeşitliliği kapsayacak biçimde eğitilmesi, model kalitesi açısından kritik bir gereklilik olmaya devam etmektedir.
Fonem (Phoneme)
Fonem (İng. phoneme), bir dilde anlam ayırt etme işlevi gören en küçük soyut ses birimidir. 'Bal' ve 'kal' sözcüklerini birbirinden ayıran /b/ ve /k/ birer fonemdir: bu seslerden birinin değişmesi doğrudan anlam değişikliği yaratır. Fonem soyut bir kavramdır; fiziksel olarak üretilen somut sesler ise **allofon** adını alır. Türkçedeki /l/ fonemi 'lale' sözcüğünde ön damakta, 'al' sözcüğünde arka damakta üretilir, ancak bu fark anlam ayırt etmediği için ikisi de aynı fonemin allofonu sayılır. Bir dilin fonem envanteri, o dildeki tüm anlam ayırt edici seslerin kümesidir. Türkçede bu küme yaklaşık 29 fonemden oluşur (8 ünlü + 21 ünsüz); İngilizcede aksana göre ~44, Hawaii dilinde 13, Güney Afrika'daki !Xũ dilinde ise 141 fonem vardır. Fonemleri evrensel biçimde yazıya dökmek için 1888'den beri kullanılan Uluslararası Fonetik Alfabe (IPA) standarttır: Türkçe 'şeker' sözcüğü IPA ile /ˈʃe.ceɾ/ olarak gösterilir. Yapay zeka açısından fonem, konuşma teknolojilerinin ortak paydasıdır. Otomatik konuşma tanıma (ASR) sistemleri ham ses dalgasını önce mel spektrogram gibi akustik özelliklere, ardından fonem dizilerine, son adımda sözcüklere dönüştürür. Metin-ses (TTS) sistemleri ters yönde çalışır: metin, grafem-fonem (G2P) dönüşümüyle fonem dizisine, oradan akustik özelliklere ve ses dalgasına çevrilir. VITS, FastSpeech 2 ve StyleTTS 2 gibi modern sinirsel TTS modelleri girdilerini fonem dizisi olarak alır; bu yaklaşım homograf belirsizliklerini büyük ölçüde ortadan kaldırır. Whisper large-v3 veya Seamless gibi uçtan uca modeller açık bir fonem katmanı üretmese de, fonemik ayrımları gizli temsillerinde örtük olarak öğrendikleri sonda (probing) çalışmalarıyla gösterilmiştir. Türkçe gibi eklemeli dillerde tek bir kök yüzlerce farklı kelime formu üretebildiğinden, sözcük tabanlı modeller sözlük patlaması yaşar. Sabit ve küçük bir küme olan fonemler (~29 birim) üzerinden modelleme, Türkçe ASR ve TTS sistemlerinde bu yüzden özellikle verimlidir. Mozilla Common Voice'un Türkçe alt kümesi ve OpenSLR veri setleri, fonemik hizalamadan geçirilerek akustik model eğitiminde kullanılır.
Mel Spectrogram (Mel Spektrogramı)
Mel Spektrogramı, sesin zaman-frekans temsilini insan işitme algısını taklit eden mel ölçeğinde sunan bir ses özellik çıkarma yöntemidir. "Mel" adı, 1937 yılında Stevens, Volkmann ve Newman tarafından geliştirilen ve insan kulağının farklı frekanslara nasıl tepki verdiğini modelleyen mel ölçeğinden (mel scale) gelir. İnsan kulağı düşük frekanslarda ince ayrımlar yaparken yüksek frekanslarda daha az hassastır; mel ölçeği bu işitsel özelliği matematiksel olarak yaklaşık olarak ifade eder. Mel spektrogramı üretmek için önce ses sinyali kısa pencereler (genellikle 25 ms) hâlinde Kısa Süreli Fourier Dönüşümü (STFT) ile spektrograma çevrilir. Bu işlem her pencerede frekans bileşenlerini ortaya koyar. Ardından bu spektrogram, mel filtre bankasından geçirilerek doğrusal frekans ekseni mel ölçeğine dönüştürülür; düşük frekanslarda sık, yüksek frekanslarda seyrek yerleştirilmiş üçgen filtreler kullanılır. Son adımda logaritmik ölçekleme (log-mel) uygulanarak insan işitme duyarlılığına benzer bir dinamik aralık elde edilir. Mel spektrogramları modern ses işleme ve konuşma tanıma sistemlerinde temel girdi formatı olarak kabul görür. OpenAI Whisper, 80 adet mel filtresi kullanan 25 ms pencerelere sahip log-mel spektrogramlarını ASR (Automatic Speech Recognition) için standart girdi biçimi olarak benimser. TTS (Text-to-Speech) sistemleri de mel spektrogramlarını ara temsil olarak kullanır; önce metinden mel spektrogramı tahmin edilir, ardından WaveGlow veya HiFi-GAN gibi bir vocoder bu spektrogramu ham ses dalgasına çevirir. Ses sınıflandırma, duygu tanıma, müzik türü tespiti ve konuşmacı kimlik doğrulama gibi görevlerde CNN, LSTM ve Transformer modelleri mel spektrogramlarını görsel girdi gibi işler. Bu yaklaşım, ses görevlerini bilgisayarlı görü tekniklerine taşıyarak ImageNet üzerinde önceden eğitilmiş modellerin aktarım öğrenimi (transfer learning) yoluyla ses uygulamalarında kullanılmasına olanak tanır. Mel spektrogramı, ham dalga formu işlemeye kıyasla daha az hesaplama gerektirirken yüksek doğruluk üretir ve günümüzde ses yapay zekasının temel taşlarından biri olarak kabul edilmektedir.
Speaker Diarization (Konuşmacı Ayrıştırma)
Konuşmacı Ayrıştırma (Speaker Diarization), bir ses kaydındaki farklı konuşmacıları otomatik olarak tanıyıp birbirinden ayıran ve her konuşmacının konuştuğu zaman dilimlerini etiketleyen yapay zeka teknolojisidir. Latince'de 'günlük' anlamına gelen 'diarize' kelimesinden türeyen bu terim, çok kişili ses kayıtlarını 'Kim ne zaman konuştu?' sorusunu yanıtlayacak biçimde bölümlere ayırmayı amaçlar. Teknik olarak sistem üç temel aşamadan oluşur: Önce Ses Etkinlik Tespiti (Voice Activity Detection — VAD) ile sessizlik ve konuşma bölgeleri ayrılır. Ardından her konuşma bölümünden konuşmacı gömme vektörü (speaker embedding) çıkarılır; bu vektör, o bölümün kimin sesi olduğunu temsil eden kompakt bir sayısal imzadır. ECAPA-TDNN, x-vector ve d-vector gibi nöral gömme modelleri modern sistemlerin omurgasını oluştururken son aşamada spektral kümeleme veya aglomeratif hiyerarşik kümeleme (AHC) algoritmaları benzer vektörlü bölümleri aynı konuşmacı altında gruplar. Sistem, konuşmacı sayısını önceden bilmeden çalışabilir — kaç kişi olduğunu veriden kendisi tahmin eder. Bu özellik, katılımcı sayısının değişken olduğu toplantı ve çağrı merkezi senaryolarında kritik avantaj sağlar. Bilindiği durumlarda ise sabit sayıda kümeye bölünerek hata oranı azaltılabilir. Whisper gibi ASR modellerine entegre edilen speaker diarization, ham transkripsiyon çıktılarını yapılandırılmış, konuşmacı etiketli belgelere dönüştürür. pyannote.audio, NVIDIA NeMo ve AssemblyAI bu alanda öne çıkan açık kaynaklı ve ticari araçlardır. Hata ölçütü olarak DER (Diarization Error Rate) ve JER (Jaccard Error Rate) kullanılır; sektörde %5-15 DER aralığı iyi performans, %5 altı ise mükemmel performans olarak kabul edilir. Üst üste binen konuşmalar (overlapping speech) ve kısa konuşmacı geçişleri sistemlerin en önemli hata kaynakları olmaya devam etmektedir. Son yıllarda uçtan uca eğitilen diarization modelleri ve büyük konuşma modellerinin entegrasyonu bu sınırları önemli ölçüde daraltmış; gerçek zamanlı ve çok dilli diarization giderek olgunlaşmaktadır.
Speech Enhancement (Konuşma İyileştirme)
Konuşma İyileştirme (Speech Enhancement), gürültülü ortamlarda kaydedilen ya da iletilen ses sinyallerinin kalitesini yapay zeka ve derin öğrenme yöntemleriyle artırma sürecidir. Geleneksel istatistiksel yaklaşımlar (Wiener filtresi, MMSE gibi) sabit gürültü modellerini varsayarken, derin öğrenme tabanlı modeller değişken ve karmaşık gürültü koşullarında da etkili biçimde çalışabilmektedir. Modern sistemler; evrişimli sinir ağları (CNN), tekrarlayan sinir ağları (RNN, LSTM), üretken çekişmeli ağlar (GAN) ve Transformer mimarilerini tek başına ya da hibrit olarak kullanmaktadır. Bu ağlar, eğitim aşamasında binlerce gürültülü ve temiz ses çifti üzerinde optimize edilen bir dönüşüm fonksiyonunu öğrenerek gerçek zamanlı gürültü giderme yapabilmektedir. Tipik bir işlem hattında ses sinyali kısa zamanlı Fourier dönüşümüyle (STFT) frekans-zaman bölgesine aktarılır, sinir ağı tarafından işlenir ve ters dönüşümle (iSTFT) yeniden zaman bölgesine döndürülür. Kalite değerlendirmesi için standart metrikler kullanılmaktadır: PESQ (Perceptual Evaluation of Speech Quality) genel ses kalitesini, STOI (Short-Time Objective Intelligibility) anlaşılırlığı, CSIG ve CBAK ise arka plan gürültüsünün müdahalesini ve konuşma bozulmasını ölçer. DeepFilterNet gibi ileri düzey modeller PESQ skorunu 3.17 seviyesine çıkarırken işlem yükünü mobil cihazlarda kullanılabilir düzeyde tutmaktadır. Uygulama alanları son derece geniştir: video konferans yazılımları, akıllı hoparlörler ve sesli asistanlar, işitme cihazları, otomatik altyazı sistemleri, radyo yayıncılığı ve sağlık kayıt sistemleri bu teknolojiden yoğun olarak yararlanmaktadır. Konuşma tanıma (ASR) sistemlerinin ön işleme adımı olarak kullanılması, gürültülü ortamlarda tanıma doğruluğunu belirgin biçimde artırmaktadır. Telefon görüşmelerinde, sesli asistan wake-word algılamada ve tele-tıp uygulamalarında gerçek zamanlı konuşma iyileştirme artık standart bir bileşen olarak yerini almaktadır. Veri kümesi açısından ise VoiceBank-DEMAND ve DNS Challenge gibi kamuya açık benchmark veri setleri, model karşılaştırmaları için araştırma topluluğunun referans noktası hâline gelmiştir. Bu rekabetçi ortam, hem akademik hem de ticari konuşma iyileştirme modellerinin hızla olgunlaşmasını sağlamaktadır.
Speech Recognition (Konuşma Tanıma (ASR))
Konuşma tanıma (Speech Recognition), insan sesini makine tarafından otomatik olarak yazılı metne dönüştüren teknoloji ve araştırma alanıdır. Otomatik Konuşma Tanıma (Automatic Speech Recognition, ASR) olarak da anılan bu alan, akustik sinyalleri önce sayısal özellik vektörlerine, ardından kelime veya karakter dizilerine dönüştürür. Temel işlem hattı üç ana aşamadan oluşur: ses ön işleme (gürültü azaltma, ses normalizasyonu ve ses etkinlik tespiti), özellik çıkarma (Mel Frekans Kepstral Katsayıları, MFCC veya mel-spektrogram hesaplama) ve dil modeli tabanlı kod çözme aşaması. Tarihsel gelişim açısından değerlendirildiğinde Hidden Markov Model (HMM) ve Gaussian Mixture Model (GMM) kombinasyonları bu alanda uzun yıllar boyunca endüstri standardı olmuştur. 2010lu yıllarda derin öğrenmenin hızlı yükselişiyle birlikte tekrarlayan sinir ağları (RNN, LSTM) ve ardından Transformer mimarisi sahneye girmiştir. OpenAI tarafından 2022 yılında kamuoyuyla paylaşılan Whisper modeli, 680.000 saatlik çok dilli ses verisiyle eğitilmiş olup düşük kaynaklı diller dahil pek çok dilde yüksek tanıma doğruluğu göstermektedir. Meta tarafından geliştirilen MMS (Massively Multilingual Speech) projesi ise 1.100 den fazla dili kapsayan veri kümesiyle az kaynaklı dil araştırmalarına önemli bir katkı sunmuştur. Modern ASR sistemleri Kelime Hata Oranı (Word Error Rate, WER) metriğiyle karşılaştırılır. Temiz stüdyo ortamında en iyi sistemler yüzde üç ile beş arasında WER elde edebilirken gürültülü ortam, aksan çeşitliliği ve alan jargonu bu oranı ciddi biçimde yükseltebilmektedir. Gerçek zamanlı akış (streaming) sistemleri düşük gecikme için optimize edilmiş küçük modeller kullanırken toplu sistemler daha yüksek doğruluk için büyük modellerden yararlanır. Konuşma tanıma; sesli asistanlar, otomatik altyazı üretimi, çağrı merkezi kalite analizi, tıbbi dikte yazılımları ve motor engelli bireyler için geliştirilen erişilebilirlik araçlarında kilit bir teknoloji konumundadır. Yüksek çekimli ve eklemeli bir dil yapısına sahip olan Türkçe, sözcük biçimbilimi (morfoloji) açısından İngilizceye kıyasla ASR sistemleri için ek güçlükler barındırmaktadır.
Whisper (OpenAI Konuşma Tanıma)
Whisper, OpenAI tarafından Eylül 2022 tarihinde açık kaynak olarak yayımlanan bir otomatik konuşma tanıma modelidir. Sistem, ASR yani Automatic Speech Recognition alanında önemli bir referans nokta haline gelmiştir. İnternetin en kapsamlı çok dilli ses derlemlerinden biri üzerinde eğitilen model 680.000 saatlik denetimli ses verisini kullanmaktadır. Bu geniş eğitim kümesi modelin yüksek gürültü ortamlarında farklı aksan ve lehçelerde ve teknik jargon içeren konuşmalarda dahi güçlü performans sergilemesini mümkün kılmaktadır. Model ham ses dosyasını otuz saniyelik parçalara böler ve her parçayı log-mel spektrogramına dönüştürür. Konvolüsyonel katmanlardan oluşan bir kodlayıcı bu spektrogramdan anlam taşıyan özellikler çıkarır; Transformer tabanlı çözücü ise bu özellikleri kelime parçalarına yani token'lara dönüştürür. Whisper transkripsiyon yabancı dilden İngilizceye çeviri ve dil tanımlama görevlerini tek bir model çatısı altında yürütür. Ses segmentasyonu otomatik gerçekleştiğinden uzun kayıtlar ek ön işlem gerektirmeksizin doğrudan işlenebilir. Tiny Base Small Medium ve Large-v3 olmak üzere beş boyutta sunulan model kaynak kısıtlı uç cihazlardan büyük veri merkezlerine kadar geniş bir kullanım yelpazesine hitap eder. Açık kaynak yapısı araştırmacı ve geliştiricilerin modeli kendi veri setleriyle ince ayar yaparak alana özgü terminolojiye veya daha önce desteklenmeyen dillere uyarlamasına olanak tanır. Türkçe dahil doksan dokuz dili destekleyen Whisper; medya arşivleme toplantı transkripti oluşturma erişilebilirlik çözümleri ve tıbbi dikte uygulamalarında yaygın biçimde kullanılmaktadır. Faster-whisper gibi topluluk kütüphaneleri CTranslate2 motoru üzerinde çalışarak çıkarım hızını ve bellek verimliliğini önemli ölçüde iyileştirir; bu da düşük gecikmeli ve gerçek zamanlı transkripsiyon senaryolarını mümkün kılar. Large-v3 modeli yaklaşık on gigabayt GPU belleği gerektirirken float16 hassasiyeti veya sekiz bitlik niceleme bu gereksinimi belirgin biçimde azaltır. Model başarımı kelime hata oranı yani WER metriği ile ölçülür ve popüler akademik kıyaslamalarda sektörün önde gelen sistemlerini geride bırakmaktadır.
Language Identification (LID) (Dil Tanıma)
Language Identification (LID), kısaca dil tanıma, bir konuşma kaydının ya da metin parçasının hangi dile ait olduğunu insan müdahalesi olmadan otomatik olarak belirleyen yapay zeka görevidir. Çok dilli sistemlerin olmazsa olmaz bir ön işlem katmanı olan LID, gelen sesi veya metni önce tanımlayarak doğru ASR modeline, çeviri motoruna ya da içerik denetim sistemine yönlendirir. İki ana kolu bulunmaktadır: konuşma tabanlı LID ve metin tabanlı LID. Konuşma tabanlı LID'de sistem, sesten log-mel spektrogram veya MFCC gibi akustik öznitelikler çıkarır ve bunları sabit uzunluklu bir gömmeye (embedding) dönüştürür. Klasik yaklaşımlarda i-vektörler kullanılırken modern sistemler ECAPA-TDNN, x-vektör veya Whisper gibi derin sinir ağı mimarilerini tercih etmektedir. SpeechBrain'in VoxLingua107 üzerinde eğitilmiş ECAPA-TDNN modeli 107 dilde %93,3 doğruluk sağlarken OpenAI Whisper'ın large-v3 sürümü FLEURS kıyaslamasında %94,6 oranına ulaşmaktadır. 2025-2026 itibarıyla FireRedLID bu kıyaslamada %97,18 ile en yüksek doğruluğa ulaşmıştır. Meta'nın MMS-LID-4017 modeli ise 4.017 dili tanıyabilen en geniş kapsama sahip sistemdir. Metin tabanlı LID'de karakter n-gramları, kelime embeddingleri ve kural tabanlı yöntemler kullanılır. Meta'nın fastText tabanlı modeli 176 dili, GlotLID ise 600'den fazla düşük kaynaklı dili desteklemektedir. LID; çok dilli çağrı merkezi yönlendirme, makine çevirisi, içerik denetimi ve konuşucu diyarizasyonu gibi alanlarda yaygın biçimde kullanılmaktadır. Tek konuşmada birden fazla dilin kullanıldığı kod değiştirme (code-switching) senaryoları, sistem tasarımında önemli bir zorluk oluşturmaktadır. Ayrıca 3 saniyenin altındaki kısa ses parçalarında doğruluk belirgin biçimde düşer ve aksanlı konuşmalar bazı modellerin yanlış sınıflandırmasına yol açabilir. Türkçe, hem VoxLingua107 hem MMS-LID hem de Whisper'ın dil listeleri arasında yer almaktadır. Türkçenin sondan eklemeli (agglutinative) yapısı kısa metin parçalarında dil tanımayı güçleştirirken, TurkicNLP projesi Türk dili ailesi için ortak eğitimle kelime hata oranını %54 oranında azaltmayı başarmıştır.