wav2vec (wav2vec (Ses Temsil Öğrenimi))

Meta AI tarafından geliştirilen, ses verilerinden etiket gerektirmeden anlamlı konuşma temsilleri öğrenen öz-denetimli derin öğrenme modelidir.

wav2vec, Meta AI Research (eski adıyla Facebook AI) tarafından geliştirilen ve konuşma tanıma görevleri için etiketlenmemiş ses verilerinden güçlü temsiller öğrenen öz-denetimli (self-supervised) bir derin öğrenme modelidir. 2019'da tanıtılan ilk wav2vec, ham ses dalgalarını doğrudan girdi olarak alarak gelecekteki ses çerçevelerini tahmin etmek üzere bir CNN mimarisi kullanır. 2020'de yayımlanan wav2vec 2.0, bu çerçeveyi transformatör mimarisi ve kuantizasyon mekanizmasıyla geliştirerek öz-denetimli öğrenmeyi ses alanında doruk noktasına taşıdı. wav2vec 2.0'ın temel yeniliği, kontrastif öğrenme (contrastive learning) yaklaşımıdır: model, ses girdisinin bazı bölümlerini maskeler ve maskelenen bölümlerin doğru kuantize temsillerini yanlış adaylar arasından seçmeyi öğrenir. Bu sayede insan tarafından etiketlenmemiş binlerce saatlik ses verisi, eğitim malzemesi olarak kullanılabilir hâle gelir. wav2vec 2.0, yalnızca 10 dakika etiketli sesle dünyanın en iyi otomatik konuşma tanıma (ASR) sistemleriyle rekabet edebilir hâle gelebildiğini göstermiştir. Bu sonuç, etiketli veri kıtlığının büyük sorun oluşturduğu az kaynaklı diller için devrim niteliği taşır. Türkçe dahil onlarca dil için ön eğitilmiş wav2vec 2.0 modelleri Hugging Face üzerinden serbestçe erişilebilir durumdadır. MIMI, HuBERT ve XLS-R gibi sonraki ses modelleri wav2vec 2.0 mimarisinden ilham alarak geliştirilmiştir. Günümüzde ses klonlama, duygu tanıma, konuşmacı doğrulama ve çok dilli ASR sistemlerinin omurgasında wav2vec tabanlı temsil öğrenimi yaygın biçimde kullanılmaktadır.

wav2vec Nasıl Çalışır?

wav2vec 2.0, ham ses dalgasını (PCM) girdi olarak alır ve üç aşamada işler. İlk olarak evrişimli sinir ağı (CNN) katmanları, sesi yerel özelliklere dönüştürür. Ardından bu özellikler kuantizasyon modülüne gönderilir; burada ses birimleri sonlu bir kitaplıktan (codebook) seçilen ayrık temsillere dönüştürülür. Son aşamada bir Transformer, sinyalin bazı bölümleri maskelenerek kontrastif bir hedefle eğitilir: model, maskelenen bölümlerin doğru kuantize temsilini, yanlış adaylar arasından seçmeyi öğrenir. Etiket gerektirmeyen bu süreç, milyonlarca saatlik ses verisinin gözetimsiz olarak kullanılmasına olanak tanır.

wav2vec 2.0 ile Az Kaynaklı Diller

Geleneksel konuşma tanıma sistemleri, güçlü bir model eğitmek için binlerce saat transkripte edilmiş ses verisine ihtiyaç duyar. Bu yük, dünya dillerinin büyük çoğunluğunu pratikte kapsanamaz hâle getirir. wav2vec 2.0, bu denklemi tersine çevirir: model önce etiketsiz ses verisiyle ön eğitim (pre-training) görür, ardından yalnızca birkaç dakika etiketli örnekle ince ayar (fine-tuning) yapılır. Meta AI'ın yayımladığı sonuçlara göre 10 dakika etiketli veri ve 53 saat etiketsiz veriyle LibriSpeech veri kümesinde %5,2 kelime hata oranı (WER) elde edilmiştir — o tarihte denetimli yöntemlerle rekabet edebilecek ilk öz-denetimli ses modelidir.

wav2vec Ailesi

wav2vec (2019)

İlk sürüm: CNN tabanlı, gelecek çerçeve tahmini hedefiyle eğitilen temel model.

wav2vec 2.0 (2020)

Transformer + kuantizasyon + kontrastif öğrenme; az kaynaklı ASR için kırılım noktası.

XLS-R (2021)

128 dilde ön eğitilmiş çok dilli wav2vec 2.0; 436M parametreyle çok dilli ASR devini.

MMS (2023)

1100+ dili destekleyen Massively Multilingual Speech; wav2vec 2.0 çerçevesinin en geniş ölçekli uygulaması.

Uygulama Alanları

  • check_circle Otomatik Konuşma Tanıma (ASR): wav2vec 2.0 tabanlı modeller, düşük kaynaklı diller dahil konuşma metnine dönüştürme sistemlerinde yaygın kullanılır.
  • check_circle Konuşmacı Doğrulama: wav2vec temsilleri, kimlik doğrulama ve konuşmacı tanıma görevlerinde özellik çıkarıcı olarak kullanılır.
  • check_circle Duygu Tanıma: Ses temsillerinden konuşmacının duygusal durumunu sınıflandırmak için wav2vec özellikleri ince ayarlı modellere beslenir.
  • check_circle Ses Klonlama ve TTS: Metin-ses dönüşüm sistemleri, konuşmacı özelliklerini kodlamak için wav2vec tabanlı kodlayıcılar kullanır.

Sık Sorulan Sorular

  • check_circle wav2vec ile Whisper arasındaki fark nedir?: wav2vec 2.0 öz-denetimli bir temsil öğrenici modeldir; ince ayarla ASR görevi yapılır. Whisper ise denetimli olarak 680.000 saat web sesine eğitilmiş uçtan uca bir ASR modelidir. wav2vec az veri senaryolarında üstünken, Whisper yüksek veri ortamlarında daha kullanışlıdır.
  • check_circle Türkçe için wav2vec modeli var mı?: Evet. Hugging Face'te Türkçe dahil onlarca dilde ön eğitilmiş wav2vec 2.0 modelleri ve ince ayarlı ASR modelleri mevcuttur. XLS-R ve MMS modelleri de Türkçe destekler.
  • check_circle wav2vec hangi çerçevelerle kullanılır?: Hugging Face Transformers kütüphanesi wav2vec 2.0 modellerini tam destek eder. PyTorch tabanlı fairseq kütüphanesi Meta AI'ın orijinal implementasyonunu barındırır.
  • check_circle HuBERT ile farkı nedir?: HuBERT (Hidden-Unit BERT), wav2vec 2.0'ın kontrastif hedefini yinelemeli kümeleme tabanlı bir hedefle değiştirir. Genellikle downstream görevlerde wav2vec 2.0'dan daha yüksek başarım gösterir.
  • check_circle wav2vec 2.0 eğitmek ne kadar kaynak ister?: Büyük ön eğitim modelleri (örn. 300M parametre) onlarca GPU ile birkaç gün gerektirir. Ancak Hugging Face'teki hazır modeller fine-tuning için tek GPU ile birkaç saatte kullanılabilir.