tag SinyalIsleme
Mel Spectrogram (Mel Spektrogramı)
Bu sayfada SinyalIsleme (Mel Spectrogram (Mel Spektrogramı)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
Mel Spektrogramı, bir ses sinyalinin frekans içeriğini zamanla birlikte görselleştiren ve insan işitme sisteminin algısını taklit eden bir ses temsil yöntemidir. "Mel" adı, müzikal aralıkların algısal eşdeğerliğini ölçen mel ölçeğinden gelir: insan kulağı düşük frekanslardaki farkları yüksek frekanslara göre çok daha hassas algılar ve mel ölçeği bu logaritmik ilişkiyi matematiksel olarak modeller. Mel Spektrogramı oluşturma süreci birkaç adımdan oluşur. İlk olarak ham ses sinyaline Kısa Zamanlı Fourier Dönüşümü (STFT — Short-Time Fourier Transform) uygulanır; bu işlem, sinyali birbiriyle örtüşen kısa pencereler hâlinde analiz ederek her pencere için frekans bileşenlerini ortaya koyar. Elde edilen güç spektrumu ardından mel filtre bankasından geçirilir: insan işitmesinin frekansları algılama biçimini yansıtan üçgen filtrelerden oluşan bu banka, düşük frekansları ince, yüksek frekansları ise kaba bir çözünürlükte gruplar. Son olarak her filtre çıkışının logaritması alınır; bu adım, insan işitmesinin ses gücünü logaritmik olarak algılaması gerçeğine dayanır ve modelin dinamik aralığını daraltarak öğrenmeyi kolaylaştırır. Mel Spektrogramları derin öğrenme tabanlı ses uygulamalarında standart bir giriş temsili hâline gelmiştir. Konuşma tanıma sistemleri (ASR — Automatic Speech Recognition), metinden konuşmaya sentezi (TTS), ses sınıflandırması, müzik analizi ve ses kaynak ayrıştırma gibi görevlerde model mimarileri ham dalga biçimi yerine mel spektrogramları işler. Bunun temel nedeni, spektrogramın bir görüntü olarak temsil edilebilmesi ve böylece başarısı kanıtlanmış 2D evrişimli sinir ağlarının (CNN) bu göreve uygulanabilmesidir. OpenAI'ın Whisper modeli ve Google'ın TTS altyapısı, mel spektrogramları ara gösterim olarak kullanır. WaveNet gibi ses üretim modelleri mel spektrogramları hedef koşul olarak alabilir. Popüler ses sınıflandırma yarışmalarında (ESC-50, UrbanSound8K) mel spektrogram tabanlı CNN mimarileri referans çözümler arasında yer alır. Temel hiperparametreler arasında örnekleme oranı (genellikle 16 kHz veya 22.05 kHz), pencere boyutu (512 veya 1024 örnek), atlama miktarı (hop length) ve mel filtre sayısı (80 veya 128) bulunur.