Google DeepMind'ın geliştirdiği, ses dalgalarını örnek bazında üreten derin konvolüsyonel sinir ağı.
WaveNet, Google DeepMind tarafından 2016 yılında geliştirilen ve ham ses dalgalarını doğrudan üreten çığır açıcı bir derin sinir ağı modelidir. Geleneksel metin-okuma (TTS) sistemlerinin aksine, WaveNet sesi fonem veya melodik bileşenler düzeyinde değil, dalga formunun her tek örnek noktasında üretir; bu sayede çıktı, gerçek insan sesine çok daha yakın bir doğallık ve ifade zenginliği kazanır. Modelin temel mimarisi, seyreltilmiş nedensel konvolüsyonlar (dilated causal convolutions) üzerine kuruludur. 'Nedensel' yapı, modelin yalnızca geçmiş örnekleri kullanarak bir sonraki örneği tahmin etmesini sağlar; bu da kausalitenin korunmasını ve gerçek zamanlı konuşma üretimine uygun bir yapı elde edilmesini olanaklı kılar. 'Seyreltme' faktörü ise üstel şekilde büyüyen bir receptive field sağlar — model az parametre ile geniş bir bağlamı görebilir ve uzun vadeli bağımlılıkları yakalayabilir. Saniyede 16.000 ila 24.000 ses örneği üreten WaveNet, İngilizce ve Mandarin Çincesi testlerinde dönemin en iyi TTS sistemlerini açık ara geride bıraktı. Modelin en önemli dezavantajı, örnekleri tek tek (otoregresif) üretmesiydi; bu durum çıkarımı son derece yavaşlatıyordu, saniyeler süren üretim dakikalarca bekletebiliyordu. Bu sorunu aşmak için DeepMind, 2017'de Parallel WaveNet'i tanıttı. Olasılık yoğunluğu damıtma tekniğini kullanan bu model, orijinalin 1.000 kat üzerinde hızda ses üretebiliyor ve gerçek zamanlı kullanımı mümkün kılıyordu. Google Asistan'ın TTS altyapısı bu Parallel WaveNet modeliyle güçlendirildi ve milyonlarca kullanıcıya sunuldu. WaveNet yalnızca metin-okuma alanıyla sınırlı kalmadı; müzik üretimi, piyano müziği sentezi ve ses kodlaması gibi alanlara da başarıyla uyarlandı. Tacotron 2, WaveRNN ve SoundStream gibi günümüz ses üretim modellerinin büyük çoğunluğu WaveNet mimarisinden ilham almıştır. Bu yönüyle WaveNet, modern yapay zeka ses teknolojilerinin temel taşlarından biri olarak tarihe geçmiştir.