Prosodinin Dört Akustik Bileşeni
Prosodi dört ölçülebilir özelliğin bileşimidir. (1) **Temel frekans (F0 / pitch):** Ses tellerinin saniyedeki titreşim sayısıdır; yetişkin erkeklerde tipik olarak 85-180 Hz, kadınlarda 165-255 Hz aralığındadır. Cümle sonunda yükselen kontur soru, düşen kontur bildirme algısı yaratır. (2) **Süre (duration):** Her fonemin ve hecenin uzunluğudur; vurgulu heceler uzar, hızlı konuşmada süreler kısalır. (3) **Enerji (loudness):** Ses basıncı seviyesidir; vurgulanan sözcükleri öne çıkarır. (4) **Sessizlikler (pauses):** Anlam gruplarını ayıran duraklamalardır; 200-500 ms'lik bir duraklama virgül veya nokta algısı üretir. TTS modellerinde bu dört parametre ya açık öngörücülerle (FastSpeech 2'nin pitch/duration/energy predictor'ları) ya da uçtan uca öğrenilen gizli temsillerle üretilir.
Prosodi Kontrol Yöntemleri
tune Açık Parametre Öngörüsü
FastSpeech 2 tarzı modeller pitch, süre ve enerjiyi ayrı öngörücülerle tahmin eder; SSML etiketleriyle (rate, pitch, volume) elle ayar yapılabilir.
style Stil Vektörleri (GST/VAE)
Global Style Tokens ve VAE, referans bir kayıttaki tonlamayı gizli vektöre kodlar; ses klonlamada prosody transfer bu vektörle yapılır.
chat Doğal Dil Yönergesi
ElevenLabs v3'te [whispers], [excited] gibi audio tag'ler; gpt-4o tabanlı seste "üzgün bir tonda oku" komutu prosodiyi doğrudan yönlendirir.
flow Akış Eşleştirme (Flow Matching)
F5-TTS ve CosyVoice 2 gibi 2024-2025 modelleri, prosodi dahil tüm akustik detayı flow matching ile tek aşamada üretir; ayrı prosodi modülü gerekmez.
Modern TTS Modellerinde Prosodi (2026 Görünümü)
2017-2021 döneminde Tacotron 2, FastSpeech 2 ve VITS prosodi parametrelerini metin-ses eşleşmesinden öğrenen standart mimarilerdi. 2023 sonrası dil modeli tabanlı sistemler (VALL-E, Bark, XTTS-v2) sesi ayrık token dizisi olarak üretmeye geçti; prosodi bu token dağılımının içinde örtük olarak modellenir. 2025-2026'da öne çıkan yaklaşım, konuşma-LLM'lerin metnin anlamını kavrayarak tonlamayı bağlama göre üretmesidir: OpenAI Realtime API'nin sesli modu, Google Gemini 2.5'in native-audio çıkışı ve ElevenLabs v3 duygu, tempo ve vurguyu yönergeyle kontrol edilebilir hale getirdi. Açık kaynakta CosyVoice 2 ve F5-TTS sıfır örnekle (zero-shot) prosodi kopyalama yaparken, 82 milyon parametrelik Kokoro küçük boyutuna rağmen dengeli tonlamayla uç cihazlarda çalışabildiğini gösterdi. Değerlendirmede MOS testlerinin yanında prosodi odaklı F0-RMSE ve süre hatası metrikleri kullanılır.
Türkçe için Prosodi
Türkçe, sondan eklemeli yapısı ve genellikle son heceye düşen sözcük vurgusuyla İngilizce eğitimli prosodi modellerinden farklı davranır. Soru anlamı çoğu dilde olduğu gibi yalnızca tonlamayla değil, -mı/-mi/-mu/-mü soru ekiyle kurulur; bu ek vurguyu kendinden önceki heceye çeker ("geldi Mİ" değil "gelDİ mi"). Yer adlarında ve bazı zarflarda vurgu öne kayar (AN-kara, ŞİM-di). Bu örüntüleri öğrenmemiş bir TTS modeli, sözcükleri doğru sesletse bile yabancı aksanlı duyulur. Türkçeye özgü prosodi kurallarının sisteme eklenmesinin sentez doğallığını dinleyici testlerinde belirgin biçimde iyileştirdiği raporlanmıştır. 2026 itibarıyla ElevenLabs, Azure AI Speech ve Google Cloud TTS Türkçe için nöral sesler sunar; açık kaynak tarafında Coqui XTTS-v2 ve Piper Türkçe destekler, ancak uzun bileşik cümlelerde duraklama yerleşimi hâlâ en sık görülen hata sınıfıdır.
Prosodinin Uygulama Alanları
- check_circle Sesli Asistanlar ve Konuşma Ajanları: Gerçek zamanlı diyalogda doğal turn-taking ve bağlama uygun tonlama, kullanıcı memnuniyetini doğrudan etkiler; OpenAI Realtime API ve Gemini Live bu alanda yarışır.
- check_circle Sesli Kitap ve Dublaj: Karakter başına farklı duygu ve tempo üretimi prosodi kontrolü gerektirir; ElevenLabs v3'ün audio tag'leri bu iş akışını hedefler.
- check_circle Ses Klonlama: Zero-shot klonlamada yalnızca tını değil, kişinin ritmi ve vurgu alışkanlıkları da (prosody transfer) kopyalanır; 3-10 saniyelik referans yeterlidir.
- check_circle Konuşma Tanıma ve Analiz: Prosodik ipuçları noktalama tahmini, konuşmacı duygusu tespiti (SER) ve depresyon/Parkinson taraması gibi klinik analizlerde özellik olarak kullanılır.
- check_circle Dil Öğrenme Uygulamaları: Telaffuz koçları, öğrencinin pitch konturunu ana dil konuşucusuyla karşılaştırarak tonlama geri bildirimi verir.
Sık Sorulan Sorular
- check_circle Prosodi ile fonem arasındaki fark nedir?: Fonem, konuşmanın en küçük anlam ayırıcı ses birimidir (/p/, /a/ gibi) ve "ne" söylendiğini taşır. Prosodi ise fonemlerin üzerine binen ton, süre ve enerji örüntüsüdür; konuşmanın melodisi ve ritmi olarak "nasıl" söylendiğini belirler.
- check_circle Prosodi kontrolü TTS kalitesi için neden kritiktir?: Prosodi zayıfsa sentezlenen ses doğru sesletilse bile tek düze ve robotik duyulur. İyi prosodi modeli cümle tonlamasını, duygusal vurguyu ve duraklamaları doğru yerleştirerek MOS puanını insan kaydına yaklaştırır.
- check_circle TTS'te prosodi nasıl kontrol edilir?: Üç ana yol vardır: SSML etiketleriyle pitch/hız/vurgu ayarı, referans ses üzerinden stil vektörü aktarımı (GST/VAE) ve modern modellerde doğal dil yönergeleri veya [excited] gibi audio tag'ler.
- check_circle Prosody transfer (prosodi aktarımı) nedir?: Bir referans kayıttaki tonlama, ritim ve vurgu örüntüsünün başka bir metne veya başka bir konuşmacının sesine taşınmasıdır; ses klonlama ve dublajda kimliğin doğal duyulması için kullanılır.
- check_circle Türkçe TTS'te prosodi neden daha zordur?: Türkçe sondan eklemelidir, soru anlamı -mı/-mi ekiyle kurulur ve vurgu bu ekin öncesindeki heceye kayar. İngilizce ağırlıklı veriyle eğitilen modeller bu örüntüleri kaçırdığında ses yabancı aksanlı duyulur.
- check_circle Hangi modeller prosodi açısından en gelişmiştir (2026)?: Kapalı kaynakta ElevenLabs v3, OpenAI gpt-4o tabanlı Realtime sesi ve Google Gemini 2.5 native-audio; açık kaynakta StyleTTS 2, CosyVoice 2, F5-TTS ve hafif model sınıfında Kokoro öne çıkar.