tag Ses
Mel Spectrogram (Mel Spektrogramı)
Bu sayfada Ses (Mel Spectrogram (Mel Spektrogramı)) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.
Mel Spektrogramı, bir ses sinyalinin frekans içeriğini zamanla birlikte görselleştiren ve insan işitme sisteminin algısını taklit eden bir ses temsil yöntemidir. "Mel" adı, müzikal aralıkların algısal eşdeğerliğini ölçen mel ölçeğinden gelir: insan kulağı düşük frekanslardaki farkları yüksek frekanslara göre çok daha hassas algılar ve mel ölçeği bu logaritmik ilişkiyi matematiksel olarak modeller. Mel Spektrogramı oluşturma süreci birkaç adımdan oluşur. İlk olarak ham ses sinyaline Kısa Zamanlı Fourier Dönüşümü (STFT — Short-Time Fourier Transform) uygulanır; bu işlem, sinyali birbiriyle örtüşen kısa pencereler hâlinde analiz ederek her pencere için frekans bileşenlerini ortaya koyar. Elde edilen güç spektrumu ardından mel filtre bankasından geçirilir: insan işitmesinin frekansları algılama biçimini yansıtan üçgen filtrelerden oluşan bu banka, düşük frekansları ince, yüksek frekansları ise kaba bir çözünürlükte gruplar. Son olarak her filtre çıkışının logaritması alınır; bu adım, insan işitmesinin ses gücünü logaritmik olarak algılaması gerçeğine dayanır ve modelin dinamik aralığını daraltarak öğrenmeyi kolaylaştırır. Mel Spektrogramları derin öğrenme tabanlı ses uygulamalarında standart bir giriş temsili hâline gelmiştir. Konuşma tanıma sistemleri (ASR — Automatic Speech Recognition), metinden konuşmaya sentezi (TTS), ses sınıflandırması, müzik analizi ve ses kaynak ayrıştırma gibi görevlerde model mimarileri ham dalga biçimi yerine mel spektrogramları işler. Bunun temel nedeni, spektrogramın bir görüntü olarak temsil edilebilmesi ve böylece başarısı kanıtlanmış 2D evrişimli sinir ağlarının (CNN) bu göreve uygulanabilmesidir. OpenAI'ın Whisper modeli ve Google'ın TTS altyapısı, mel spektrogramları ara gösterim olarak kullanır. WaveNet gibi ses üretim modelleri mel spektrogramları hedef koşul olarak alabilir. Popüler ses sınıflandırma yarışmalarında (ESC-50, UrbanSound8K) mel spektrogram tabanlı CNN mimarileri referans çözümler arasında yer alır. Temel hiperparametreler arasında örnekleme oranı (genellikle 16 kHz veya 22.05 kHz), pencere boyutu (512 veya 1024 örnek), atlama miktarı (hop length) ve mel filtre sayısı (80 veya 128) bulunur.
Mel Spectrogram (Mel Spektrogramı)
Mel Spektrogramı, bir ses sinyalinin frekans içeriğini zamanla birlikte görselleştiren ve insan işitme sisteminin algısını taklit eden bir ses temsil yöntemidir. "Mel" adı, müzikal aralıkların algısal eşdeğerliğini ölçen mel ölçeğinden gelir: insan kulağı düşük frekanslardaki farkları yüksek frekanslara göre çok daha hassas algılar ve mel ölçeği bu logaritmik ilişkiyi matematiksel olarak modeller. Mel Spektrogramı oluşturma süreci birkaç adımdan oluşur. İlk olarak ham ses sinyaline Kısa Zamanlı Fourier Dönüşümü (STFT — Short-Time Fourier Transform) uygulanır; bu işlem, sinyali birbiriyle örtüşen kısa pencereler hâlinde analiz ederek her pencere için frekans bileşenlerini ortaya koyar. Elde edilen güç spektrumu ardından mel filtre bankasından geçirilir: insan işitmesinin frekansları algılama biçimini yansıtan üçgen filtrelerden oluşan bu banka, düşük frekansları ince, yüksek frekansları ise kaba bir çözünürlükte gruplar. Son olarak her filtre çıkışının logaritması alınır; bu adım, insan işitmesinin ses gücünü logaritmik olarak algılaması gerçeğine dayanır ve modelin dinamik aralığını daraltarak öğrenmeyi kolaylaştırır. Mel Spektrogramları derin öğrenme tabanlı ses uygulamalarında standart bir giriş temsili hâline gelmiştir. Konuşma tanıma sistemleri (ASR — Automatic Speech Recognition), metinden konuşmaya sentezi (TTS), ses sınıflandırması, müzik analizi ve ses kaynak ayrıştırma gibi görevlerde model mimarileri ham dalga biçimi yerine mel spektrogramları işler. Bunun temel nedeni, spektrogramın bir görüntü olarak temsil edilebilmesi ve böylece başarısı kanıtlanmış 2D evrişimli sinir ağlarının (CNN) bu göreve uygulanabilmesidir. OpenAI'ın Whisper modeli ve Google'ın TTS altyapısı, mel spektrogramları ara gösterim olarak kullanır. WaveNet gibi ses üretim modelleri mel spektrogramları hedef koşul olarak alabilir. Popüler ses sınıflandırma yarışmalarında (ESC-50, UrbanSound8K) mel spektrogram tabanlı CNN mimarileri referans çözümler arasında yer alır. Temel hiperparametreler arasında örnekleme oranı (genellikle 16 kHz veya 22.05 kHz), pencere boyutu (512 veya 1024 örnek), atlama miktarı (hop length) ve mel filtre sayısı (80 veya 128) bulunur.
MIDI Sentezi (MIDI Sentezi)
MIDI sentezi (MIDI synthesis), yapay zeka modellerinin büyük MIDI veri kümelerinden müzikal örüntüleri öğrenerek orijinal sembolik müzik dizileri ürettiği üretken AI teknolojisidir. Sembolik müzik temsili olan MIDI, ses dalgalarını değil; nota adı, başlama zamanı, süre ve hız (velocity) gibi müzikal olayları kodlar. Bu yapılandırılmış temsil, MIDI'yi ses sentezine kıyasla çok daha analiz edilebilir ve üretilebilir kılar. OpenAI'ın 2019'da tanıttığı MuseNet, transformer mimarisini sembolik müziğe uyarlayan öncü modeldir: 4 dakikaya kadar uzanan, piyano, keman ve flüt başta olmak üzere ondan fazla enstrümanı kapsayan çok sesli eserler üretebilir; Bach'tan Chopin'e, Mozart'tan modern pop'a 10 farklı besteci stilini taklit eder. Google Magenta projesinin Music Transformer modeli, uzun vadeli yapıyı korumak için görece dikkat (relative attention) mekanizmasını kullanır; bu sayede yüzlerce adım önceki müzikal motiflere tutarlı biçimde atıfta bulunabilir. 2021'de Microsoft Research tarafından geliştirilen MusicBERT, BERT'in çift yönlü kodlama yaklaşımını sembolik müziğe taşır; bar, beat ve enstrüman bilgisini ayrı token akışları olarak temsil ederek tür sınıflandırma, melodi çıkarma ve hız tahmini gibi çok görevli müzik anlama problemleri için güçlü temel model işlevi görür. Mimari açıdan MIDI sentezi üç temel yaklaşımda gelişmiştir. LSTM ve GRU tabanlı yinelemeli ağlar, kısa vadeli melodic bağımlılıkları yakalamak için erken dönemde yaygınlaştı. Transformer tabanlı modeller uzun vadeli müzikal yapıyı çok daha iyi modelleyerek baskın mimari konumuna yükseldi. Diffusion modelleri ise son yıllarda sembolik alana taşınmaya başlandı; gürültüden nota düzeyine adım adım geri çekilme yaklaşımı stil çeşitliliğini artırıyor. Eğitim veri setleri arasında Lakh MIDI Dataset (170.000+ parça), GiantMIDI-Piano ve MAESTRO (piyano yarışması kayıtları) öne çıkmaktadır. Endüstri uygulamaları; oyun motorları için anlık çevre müziği üretimi, film ön-taslak (mockup) skorlama, DAW (Digital Audio Workstation) eklentileri ve müzik eğitim araçlarını kapsamaktadır. MuseScore, Hooktheory ve Amper Music bu teknolojiyi üretim iş akışlarına entegre etmiştir.