tag MelOlcegi

Mel Spectrogram (Mel Spektrogramı)

Bu sayfada MelOlcegi (Mel Spectrogram (Mel Spektrogramı)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Mel Spektrogramı, sesin zaman-frekans temsilini insan işitme algısını taklit eden mel ölçeğinde sunan bir ses özellik çıkarma yöntemidir. "Mel" adı, 1937 yılında Stevens, Volkmann ve Newman tarafından geliştirilen ve insan kulağının farklı frekanslara nasıl tepki verdiğini modelleyen mel ölçeğinden (mel scale) gelir. İnsan kulağı düşük frekanslarda ince ayrımlar yaparken yüksek frekanslarda daha az hassastır; mel ölçeği bu işitsel özelliği matematiksel olarak yaklaşık olarak ifade eder. Mel spektrogramı üretmek için önce ses sinyali kısa pencereler (genellikle 25 ms) hâlinde Kısa Süreli Fourier Dönüşümü (STFT) ile spektrograma çevrilir. Bu işlem her pencerede frekans bileşenlerini ortaya koyar. Ardından bu spektrogram, mel filtre bankasından geçirilerek doğrusal frekans ekseni mel ölçeğine dönüştürülür; düşük frekanslarda sık, yüksek frekanslarda seyrek yerleştirilmiş üçgen filtreler kullanılır. Son adımda logaritmik ölçekleme (log-mel) uygulanarak insan işitme duyarlılığına benzer bir dinamik aralık elde edilir. Mel spektrogramları modern ses işleme ve konuşma tanıma sistemlerinde temel girdi formatı olarak kabul görür. OpenAI Whisper, 80 adet mel filtresi kullanan 25 ms pencerelere sahip log-mel spektrogramlarını ASR (Automatic Speech Recognition) için standart girdi biçimi olarak benimser. TTS (Text-to-Speech) sistemleri de mel spektrogramlarını ara temsil olarak kullanır; önce metinden mel spektrogramı tahmin edilir, ardından WaveGlow veya HiFi-GAN gibi bir vocoder bu spektrogramu ham ses dalgasına çevirir. Ses sınıflandırma, duygu tanıma, müzik türü tespiti ve konuşmacı kimlik doğrulama gibi görevlerde CNN, LSTM ve Transformer modelleri mel spektrogramlarını görsel girdi gibi işler. Bu yaklaşım, ses görevlerini bilgisayarlı görü tekniklerine taşıyarak ImageNet üzerinde önceden eğitilmiş modellerin aktarım öğrenimi (transfer learning) yoluyla ses uygulamalarında kullanılmasına olanak tanır. Mel spektrogramı, ham dalga formu işlemeye kıyasla daha az hesaplama gerektirirken yüksek doğruluk üretir ve günümüzde ses yapay zekasının temel taşlarından biri olarak kabul edilmektedir.

graphic_eq

Mel Spectrogram (Mel Spektrogramı)

Mel Spektrogramı, sesin zaman-frekans temsilini insan işitme algısını taklit eden mel ölçeğinde sunan bir ses özellik çıkarma yöntemidir. "Mel" adı, 1937 yılında Stevens, Volkmann ve Newman tarafından geliştirilen ve insan kulağının farklı frekanslara nasıl tepki verdiğini modelleyen mel ölçeğinden (mel scale) gelir. İnsan kulağı düşük frekanslarda ince ayrımlar yaparken yüksek frekanslarda daha az hassastır; mel ölçeği bu işitsel özelliği matematiksel olarak yaklaşık olarak ifade eder. Mel spektrogramı üretmek için önce ses sinyali kısa pencereler (genellikle 25 ms) hâlinde Kısa Süreli Fourier Dönüşümü (STFT) ile spektrograma çevrilir. Bu işlem her pencerede frekans bileşenlerini ortaya koyar. Ardından bu spektrogram, mel filtre bankasından geçirilerek doğrusal frekans ekseni mel ölçeğine dönüştürülür; düşük frekanslarda sık, yüksek frekanslarda seyrek yerleştirilmiş üçgen filtreler kullanılır. Son adımda logaritmik ölçekleme (log-mel) uygulanarak insan işitme duyarlılığına benzer bir dinamik aralık elde edilir. Mel spektrogramları modern ses işleme ve konuşma tanıma sistemlerinde temel girdi formatı olarak kabul görür. OpenAI Whisper, 80 adet mel filtresi kullanan 25 ms pencerelere sahip log-mel spektrogramlarını ASR (Automatic Speech Recognition) için standart girdi biçimi olarak benimser. TTS (Text-to-Speech) sistemleri de mel spektrogramlarını ara temsil olarak kullanır; önce metinden mel spektrogramı tahmin edilir, ardından WaveGlow veya HiFi-GAN gibi bir vocoder bu spektrogramu ham ses dalgasına çevirir. Ses sınıflandırma, duygu tanıma, müzik türü tespiti ve konuşmacı kimlik doğrulama gibi görevlerde CNN, LSTM ve Transformer modelleri mel spektrogramlarını görsel girdi gibi işler. Bu yaklaşım, ses görevlerini bilgisayarlı görü tekniklerine taşıyarak ImageNet üzerinde önceden eğitilmiş modellerin aktarım öğrenimi (transfer learning) yoluyla ses uygulamalarında kullanılmasına olanak tanır. Mel spektrogramı, ham dalga formu işlemeye kıyasla daha az hesaplama gerektirirken yüksek doğruluk üretir ve günümüzde ses yapay zekasının temel taşlarından biri olarak kabul edilmektedir.

arrow_forward