MFCC (Mel Frekans Kepstral Katsayıları)

Konuşma tanıma ve ses işlemede kullanılan, insan kulağının frekans algısını modelleyen standart özellik çıkarma yöntemi.

MFCC (Mel Frequency Cepstral Coefficients — Mel Frekans Kepstral Katsayıları), konuşma ve ses sinyallerinden anlamlı özellikler çıkarmak için kullanılan en köklü yöntemlerden biridir. 1980'lerin başında Davis ve Mermelstein tarafından geliştirilen bu teknik, günümüz derin öğrenme sistemlerinde bile ön işleme adımı olarak varlığını sürdürmektedir. MFCC'nin temelinde, insan kulağının frekansları doğrusal değil logaritmik bir ölçekte algıladığı gerçeği yatar. Mel ölçeği bu algıyı matematiksel olarak modelleyen bir dönüşümdür: düşük frekanslarda hassas ayrım sağlanırken yüksek frekanslarda daha kaba bir çözünürlük kabul edilir. Ses sinyalinin bu biyolojik modele göre kodlanması, makine öğrenimi sistemlerinin konuşma verilerini çok daha verimli işlemesine olanak tanır. Hesaplama süreci birkaç adımdan oluşur. Önce ham ses sinyaline ön vurgu (pre-emphasis) filtresi uygulanarak yüksek frekans bileşenleri güçlendirilir. Ardından sinyal 20–40 milisaniyelik örtüşen çerçevelere bölünür ve her çerçeve bir Hamming penceresiyle çarpılır. Çerçevelere Hızlı Fourier Dönüşümü (FFT) uygulanarak güç spektrumu elde edilir. Bu spektrum, Mel ölçeğine yerleştirilmiş bant geçiren filtreler üzerinden geçirilerek logaritmik enerji değerleri hesaplanır. Son adımda Ayrık Kosinüs Dönüşümü (DCT) dekorelasyonu sağlar ve genellikle 12–13 katsayı seçilir; bu katsayılara zaman içindeki değişimleri yakalamak için türev (delta) ve ikinci türev (delta-delta) katsayılar eklenir. MFCC, geleneksel Gizli Markov Modellerinden (HMM) modern derin sinir ağlarına kadar geniş bir yelpazede kullanılmıştır. Whisper, wav2vec ve benzeri modern ASR sistemleri kendi özellik çıkarma yöntemlerini kullansa da pek çok üretim sistemi hâlâ MFCC'ye dayanan boru hatlarıyla çalışmaktadır.