Text-to-Speech (TTS) (Metinden Sese)
Yazılı metni doğal duyulan insan sesi kalitesinde ses sinyaline dönüştüren; prozodi, duygusal ifade ve ses klonlama gibi kapasiteler içeren yapay zeka teknolojisi.
Metinden konuşmaya dönüştürme (text-to-speech, TTS), yazılı metni doğal duyulan insan sesi kalitesinde ses sinyaline dönüştüren yapay zeka teknolojisidir. Ekran okuyucudan sesli kitap üretimine, dijital asistandan multimedya içerik üretimine kadar geniş bir uygulama yelpazesine hitap eder. Modern TTS sistemleri iki ana bileşenden oluşur: akustik model ve vocoderdir. Akustik model metni fonetik temsillerden mel-spektrogram gibi ara ses gösterimlerine dönüştürür; vocoder bu gösterimi ham ses dalgasına çevirir. Tacotron 2 ve FastSpeech akustik model alanında; WaveNet, HiFi-GAN ve BigVGAN vocoder alanında öncü çalışmalardır. Güçlü TTS sistemlerini diğerlerinden ayıran unsurlar prozodi (vurgu, ton, ritim), duygusal ifade ve zero-shot ses klonlamadır. ElevenLabs ve OpenAI TTS, yalnızca birkaç saniyelik kayıt örneğiyle hedef konuşmacının sesini taklit edebilmektedir; bu özellik hem yaratıcı medyada hem de derin sahte (deepfake) ses risklerinde yankısını bulmaktadır. SSML (Speech Synthesis Markup Language), TTS çıktısının vurgu, hız, ses yüksekliği ve duraklama gibi özelliklerini programatik olarak kontrol etmek için kullanılan XML tabanlı standarttır. Google Cloud, Amazon Polly ve Microsoft Azure gibi bulut TTS servisleri SSML desteğiyle birlikte gelir. Erişilebilirlik açısından TTS, görme ve okuma güçlüğü yaşayan bireyler için dijital içeriğe erişimin kilit teknolojisidir. Düşük bant genişlikli dil kaynakları için de TTS, konuşma verisi kıt dillere ses kazandırmanın pratik yolunu sunar.