tag Ses

MFCC (Mel Frekans Kepstral Katsayıları)

Bu sayfada Ses (MFCC (Mel Frekans Kepstral Katsayıları)) etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.

MFCC (Mel Frequency Cepstral Coefficients — Mel Frekans Kepstral Katsayıları), konuşma ve ses sinyallerinden makine öğrenimi modellerine uygun kompakt özellik vektörleri çıkarmak için kullanılan en köklü ve yaygın tekniklerden biridir. 1980'lerin başında Davis ve Mermelstein tarafından konuşma tanıma için geliştirilen bu yöntem, günümüz derin öğrenme sistemlerinde bile ön işleme adımı olarak yaygın biçimde kullanılmaktadır. MFCC'nin temelinde, insan kulağının frekansları doğrusal değil logaritmik bir ölçekte algıladığı gerçeği yatar. Mel ölçeği bu psikoakustik gerçeği matematiksel olarak modelleyen bir dönüşümdür: düşük frekanslarda (1 kHz altında) hassas ayrım yapılırken yüksek frekanslarda daha kaba bir çözünürlük benimsenip kabul edilir. Bu biyolojik modele göre yapılan kodlama, makine öğrenimi sistemlerinin konuşma verilerini çok daha az sayıda katsayıyla verimli temsil etmesine olanak tanır. Hesaplama süreci altı temel adımdan oluşur. Birincisi, ham ses sinyaline ön vurgu (pre-emphasis) filtresi uygulanarak yüksek frekans bileşenleri güçlendirilir (tipik katsayı: 0.97). İkincisi, sinyal 20–40 milisaniyelik örtüşen çerçevelere bölünür ve her çerçeve spektral sızıntıyı azaltmak için bir Hamming penceresiyle çarpılır. Üçüncüsü, her çerçeveye Hızlı Fourier Dönüşümü (FFT) uygulanarak güç spektrumu elde edilir. Dördüncüsü, bu spektrum Mel ölçeğine yerleştirilmiş 26 bant geçiren filtreden geçirilip logaritmik enerji değerleri hesaplanır. Beşincisi, 26 log-enerji değerine Ayrık Kosinüs Dönüşümü (DCT) uygulanarak katsayılar dekorelasyona tabi tutulur; genellikle ilk 12–13 katsayı korunur. Altıncısı ise zaman boyutundaki değişimleri yakalamak için birinci türev (delta) ve ikinci türev (delta-delta) katsayılar eklenir; bu şekilde tipik vektör boyutu 39'a ulaşır. MFCC başlangıçta Gizli Markov Modelleri (HMM-GMM) tabanlı konuşma tanıma sistemlerinde birincil giriş özelliği olarak kullanılmıştır. Zaman içinde konuşmacı tanıma, ses duygu analizi, müzik türü sınıflandırma ve çevre sesi tespiti gibi geniş bir uygulama yelpazesine yayılmıştır. Wav2vec 2.0 ve Whisper gibi modern end-to-end sistemler ham dalga biçimlerini (raw waveform) doğrudan işlese de gömülü sistemler, az veriyle çalışan senaryolar ve açıklanabilirlik gerektiren uygulamalar MFCC'yi güncel ve geçerli bir seçenek olarak korumaktadır.

code_blocks

MFCC (Mel Frekans Kepstral Katsayıları)

MFCC (Mel Frequency Cepstral Coefficients — Mel Frekans Kepstral Katsayıları), konuşma ve ses sinyallerinden makine öğrenimi modellerine uygun kompakt özellik vektörleri çıkarmak için kullanılan en köklü ve yaygın tekniklerden biridir. 1980'lerin başında Davis ve Mermelstein tarafından konuşma tanıma için geliştirilen bu yöntem, günümüz derin öğrenme sistemlerinde bile ön işleme adımı olarak yaygın biçimde kullanılmaktadır. MFCC'nin temelinde, insan kulağının frekansları doğrusal değil logaritmik bir ölçekte algıladığı gerçeği yatar. Mel ölçeği bu psikoakustik gerçeği matematiksel olarak modelleyen bir dönüşümdür: düşük frekanslarda (1 kHz altında) hassas ayrım yapılırken yüksek frekanslarda daha kaba bir çözünürlük benimsenip kabul edilir. Bu biyolojik modele göre yapılan kodlama, makine öğrenimi sistemlerinin konuşma verilerini çok daha az sayıda katsayıyla verimli temsil etmesine olanak tanır. Hesaplama süreci altı temel adımdan oluşur. Birincisi, ham ses sinyaline ön vurgu (pre-emphasis) filtresi uygulanarak yüksek frekans bileşenleri güçlendirilir (tipik katsayı: 0.97). İkincisi, sinyal 20–40 milisaniyelik örtüşen çerçevelere bölünür ve her çerçeve spektral sızıntıyı azaltmak için bir Hamming penceresiyle çarpılır. Üçüncüsü, her çerçeveye Hızlı Fourier Dönüşümü (FFT) uygulanarak güç spektrumu elde edilir. Dördüncüsü, bu spektrum Mel ölçeğine yerleştirilmiş 26 bant geçiren filtreden geçirilip logaritmik enerji değerleri hesaplanır. Beşincisi, 26 log-enerji değerine Ayrık Kosinüs Dönüşümü (DCT) uygulanarak katsayılar dekorelasyona tabi tutulur; genellikle ilk 12–13 katsayı korunur. Altıncısı ise zaman boyutundaki değişimleri yakalamak için birinci türev (delta) ve ikinci türev (delta-delta) katsayılar eklenir; bu şekilde tipik vektör boyutu 39'a ulaşır. MFCC başlangıçta Gizli Markov Modelleri (HMM-GMM) tabanlı konuşma tanıma sistemlerinde birincil giriş özelliği olarak kullanılmıştır. Zaman içinde konuşmacı tanıma, ses duygu analizi, müzik türü sınıflandırma ve çevre sesi tespiti gibi geniş bir uygulama yelpazesine yayılmıştır. Wav2vec 2.0 ve Whisper gibi modern end-to-end sistemler ham dalga biçimlerini (raw waveform) doğrudan işlese de gömülü sistemler, az veriyle çalışan senaryolar ve açıklanabilirlik gerektiren uygulamalar MFCC'yi güncel ve geçerli bir seçenek olarak korumaktadır.

arrow_forward
🎹

MIDI Sentezi (MIDI Sentezi)

MIDI sentezi (MIDI synthesis), yapay zeka modellerinin büyük MIDI veri kümelerinden müzikal örüntüleri öğrenerek orijinal sembolik müzik dizileri ürettiği üretken AI teknolojisidir. Sembolik müzik temsili olan MIDI, ses dalgalarını değil; nota adı, başlama zamanı, süre ve hız (velocity) gibi müzikal olayları kodlar. Bu yapılandırılmış temsil, MIDI'yi ses sentezine kıyasla çok daha analiz edilebilir ve üretilebilir kılar. OpenAI'ın 2019'da tanıttığı MuseNet, transformer mimarisini sembolik müziğe uyarlayan öncü modeldir: 4 dakikaya kadar uzanan, piyano, keman ve flüt başta olmak üzere ondan fazla enstrümanı kapsayan çok sesli eserler üretebilir; Bach'tan Chopin'e, Mozart'tan modern pop'a 10 farklı besteci stilini taklit eder. Google Magenta projesinin Music Transformer modeli, uzun vadeli yapıyı korumak için görece dikkat (relative attention) mekanizmasını kullanır; bu sayede yüzlerce adım önceki müzikal motiflere tutarlı biçimde atıfta bulunabilir. 2021'de Microsoft Research tarafından geliştirilen MusicBERT, BERT'in çift yönlü kodlama yaklaşımını sembolik müziğe taşır; bar, beat ve enstrüman bilgisini ayrı token akışları olarak temsil ederek tür sınıflandırma, melodi çıkarma ve hız tahmini gibi çok görevli müzik anlama problemleri için güçlü temel model işlevi görür. Mimari açıdan MIDI sentezi üç temel yaklaşımda gelişmiştir. LSTM ve GRU tabanlı yinelemeli ağlar, kısa vadeli melodic bağımlılıkları yakalamak için erken dönemde yaygınlaştı. Transformer tabanlı modeller uzun vadeli müzikal yapıyı çok daha iyi modelleyerek baskın mimari konumuna yükseldi. Diffusion modelleri ise son yıllarda sembolik alana taşınmaya başlandı; gürültüden nota düzeyine adım adım geri çekilme yaklaşımı stil çeşitliliğini artırıyor. Eğitim veri setleri arasında Lakh MIDI Dataset (170.000+ parça), GiantMIDI-Piano ve MAESTRO (piyano yarışması kayıtları) öne çıkmaktadır. Endüstri uygulamaları; oyun motorları için anlık çevre müziği üretimi, film ön-taslak (mockup) skorlama, DAW (Digital Audio Workstation) eklentileri ve müzik eğitim araçlarını kapsamaktadır. MuseScore, Hooktheory ve Amper Music bu teknolojiyi üretim iş akışlarına entegre etmiştir.

arrow_forward
code_blocks

Vocoder (Vocodör)

Vocoder (Voice Coder — ses kodlayıcı), insan sesini analiz ederek parametrik bir temsile dönüştüren ve bu parametrelerden sesi yeniden sentezleyen sinyal işleme sistemidir. Bell Laboratuvarları'nda mühendis Homer Dudley tarafından 1939 yılında patent alınan kanal vokoderi, sesi birden fazla frekans bandına böler; her bant için enerji düzeyini kodlayarak dar bant iletişim kanallarında veri miktarını azaltır. 1943'te ABD ve İngiltere arasındaki en üst düzey şifreli ses iletişiminde kullanılan SIGSALY sistemi, vocoder teknolojisinin ilk operasyonel büyük ölçekli uygulamasıdır. Teorik temel olan kaynak-filtre modeli, konuşma üretimini iki bileşene ayırır: ses tellerinin belirli bir frekansta titreşimiyle oluşan glottal nabız (kaynak) ve vokal traktının bu kaynağı rezonanslarıyla biçimlendirdiği spektral zarf (filtre). Doğrusal Öngörücü Kodlama (LPC), bu ayrışımı matematiksel olarak gerçekleştirir; analiz aşamasında konuşma sinyalinden temel frekans ve spektral zarf parametreleri çıkarılır, sentez aşamasında bu parametrelerden ses yeniden oluşturulur. LPC tabanlı vocoderlar 1980-90'larda GSM gibi mobil ses sıkıştırma standartlarında yaygın biçimde kullanılmıştır. 1960-70'lerde Moog sentezleyicilerinin yaygınlaşmasıyla vocoder müzik endüstrisinde bir efekt aracına dönüşmüş; Kraftwerk ve Daft Punk gibi gruplar vocoderi ikonik bir ses rengi olarak kullanmıştır. 2016'da DeepMind'ın WaveNet modelini yayımlamasıyla nöral vocoderlar dönemi başlamıştır. WaveNet, dilated causal convolution mimarisiyle her ses örneğini önceki tüm örneklere bakarak üretir; bu otoregresif yapı yüksek doğallık sunarken gerçek zamanlı kullanımı güçleştirir. WaveGlow normalizing flow yöntemlerini kullanarak paralel örnekleme yapar ve gerçek zamanlı çıkarımı mümkün kılar. HiFi-GAN ise çoklu-periyot ayrıştırıcı ve çoklu-ölçek ayrıştırıcı mimarisiyle ses kalitesi ile hızı dengeleyen GAN tabanlı vocoder olarak üretim sistemlerinde standart haline gelmiştir. Modern metin-konuşma (TTS) sistemlerinde vocoder, akustik modelin (Tacotron 2, FastSpeech 2) ürettiği mel-spektrogramı gerçek ses dalga formuna çeviren kritik bileşendir. Ses klonlama, ses dönüştürme ve konuşma geliştirme gibi alanlarda da nöral vocoder mimarileri belirleyici rol üstlenmektedir.

arrow_forward