tag SinyalIsleme
Bu sayfada SinyalIsleme etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
MFCC (Mel Frequency Cepstral Coefficients — Mel Frekans Kepstral Katsayıları), konuşma ve ses sinyallerinden makine öğrenimi modellerine uygun kompakt özellik vektörleri çıkarmak için kullanılan en köklü ve yaygın tekniklerden biridir. 1980'lerin başında Davis ve Mermelstein tarafından konuşma tanıma için geliştirilen bu yöntem, günümüz derin öğrenme sistemlerinde bile ön işleme adımı olarak yaygın biçimde kullanılmaktadır. MFCC'nin temelinde, insan kulağının frekansları doğrusal değil logaritmik bir ölçekte algıladığı gerçeği yatar. Mel ölçeği bu psikoakustik gerçeği matematiksel olarak modelleyen bir dönüşümdür: düşük frekanslarda (1 kHz altında) hassas ayrım yapılırken yüksek frekanslarda daha kaba bir çözünürlük benimsenip kabul edilir. Bu biyolojik modele göre yapılan kodlama, makine öğrenimi sistemlerinin konuşma verilerini çok daha az sayıda katsayıyla verimli temsil etmesine olanak tanır. Hesaplama süreci altı temel adımdan oluşur. Birincisi, ham ses sinyaline ön vurgu (pre-emphasis) filtresi uygulanarak yüksek frekans bileşenleri güçlendirilir (tipik katsayı: 0.97). İkincisi, sinyal 20–40 milisaniyelik örtüşen çerçevelere bölünür ve her çerçeve spektral sızıntıyı azaltmak için bir Hamming penceresiyle çarpılır. Üçüncüsü, her çerçeveye Hızlı Fourier Dönüşümü (FFT) uygulanarak güç spektrumu elde edilir. Dördüncüsü, bu spektrum Mel ölçeğine yerleştirilmiş 26 bant geçiren filtreden geçirilip logaritmik enerji değerleri hesaplanır. Beşincisi, 26 log-enerji değerine Ayrık Kosinüs Dönüşümü (DCT) uygulanarak katsayılar dekorelasyona tabi tutulur; genellikle ilk 12–13 katsayı korunur. Altıncısı ise zaman boyutundaki değişimleri yakalamak için birinci türev (delta) ve ikinci türev (delta-delta) katsayılar eklenir; bu şekilde tipik vektör boyutu 39'a ulaşır. MFCC başlangıçta Gizli Markov Modelleri (HMM-GMM) tabanlı konuşma tanıma sistemlerinde birincil giriş özelliği olarak kullanılmıştır. Zaman içinde konuşmacı tanıma, ses duygu analizi, müzik türü sınıflandırma ve çevre sesi tespiti gibi geniş bir uygulama yelpazesine yayılmıştır. Wav2vec 2.0 ve Whisper gibi modern end-to-end sistemler ham dalga biçimlerini (raw waveform) doğrudan işlese de gömülü sistemler, az veriyle çalışan senaryolar ve açıklanabilirlik gerektiren uygulamalar MFCC'yi güncel ve geçerli bir seçenek olarak korumaktadır.