Prosodi Nedir? Konuşma Sentezinde Ton ve Ritim Kontrolü (Prosodi)

Prosodi, konuşmadaki ton (pitch), süre, vurgu ve ritim gibi dil-üstü özelliklerin bütünüdür; TTS'te doğallığın temel belirleyicisidir.

Prosodi (İngilizce: prosody), konuşmadaki ton yüksekliği (pitch/F0), fonem süresi, ses enerjisi, vurgu ve duraklamalar gibi dil-üstü (suprasegmental) özelliklerin bütünüdür. Fonemler "ne söylendiğini" taşırken prosodi "nasıl söylendiğini" taşır: aynı cümle, pitch konturu değiştirildiğinde soru, ironi veya öfke anlamı kazanabilir. Yapay zeka tabanlı konuşma sentezinde (TTS) prosodi modellemesi, üretilen sesin insan konuşmasına yakınlığını belirleyen en kritik bileşendir; prosodi zayıfsa ses tek düze ve robotik duyulur. Teknik olarak prosodi dört ölçülebilir akustik parametreye dayanır: temel frekans (F0) konturu, fonem/hece süreleri, enerji (loudness) dağılımı ve sessizlik yerleşimi. Erken dönem birleştirmeli (concatenative) TTS sistemleri bu parametreleri elle yazılmış kurallarla üretirken, Tacotron 2 (2017) ve FastSpeech 2 (2020) gibi nöral modeller pitch, süre ve enerjiyi doğrudan veriden öğrenen açık öngörücüler (variance adaptors) kullandı. VITS ve StyleTTS 2 uçtan uca olasılıksal modellemeyle bu çizgiyi ileri taşıdı. 2024-2026 dalgasında ise ağırlık büyük dil modeli tabanlı ses üretimine kaydı: OpenAI'nin gpt-4o tabanlı Realtime sesi, ElevenLabs v3, Google'ın Gemini 2.5 native-audio çıkışı ve açık kaynak tarafında CosyVoice 2, F5-TTS ve Kokoro gibi modeller, metnin anlamsal ve duygusal bağlamından prosodi kararlarını örtük biçimde üretir; kullanıcı "fısıldayarak söyle" veya "[excited]" gibi doğal dil ve etiket yönergeleriyle tonlamayı yönlendirebilir. Prosodi yalnızca sentezin değil, konuşma tanımanın (ASR) ve konuşma-LLM etkileşiminin de konusudur: Whisper gibi modeller noktalama ve cümle sınırı kararlarında prosodik ipuçlarından örtük olarak yararlanır; sesli asistanlarda konuşma sırası (turn-taking) tespiti büyük ölçüde prosodiye dayanır. Türkçe gibi sondan eklemeli ve soru ekiyle (-mı/-mi) çalışan dillerde, dile özgü vurgu ve tonlama örüntülerinin modellenmesi sentez doğallığını belirgin biçimde artırır; akademik çalışmalar dile özgü prosodi kurallarının algılanan doğallıkta ölçülebilir iyileşme getirdiğini gösterir.

Prosodinin Dört Akustik Bileşeni

Prosodi dört ölçülebilir özelliğin bileşimidir. (1) **Temel frekans (F0 / pitch):** Ses tellerinin saniyedeki titreşim sayısıdır; yetişkin erkeklerde tipik olarak 85-180 Hz, kadınlarda 165-255 Hz aralığındadır. Cümle sonunda yükselen kontur soru, düşen kontur bildirme algısı yaratır. (2) **Süre (duration):** Her fonemin ve hecenin uzunluğudur; vurgulu heceler uzar, hızlı konuşmada süreler kısalır. (3) **Enerji (loudness):** Ses basıncı seviyesidir; vurgulanan sözcükleri öne çıkarır. (4) **Sessizlikler (pauses):** Anlam gruplarını ayıran duraklamalardır; 200-500 ms'lik bir duraklama virgül veya nokta algısı üretir. TTS modellerinde bu dört parametre ya açık öngörücülerle (FastSpeech 2'nin pitch/duration/energy predictor'ları) ya da uçtan uca öğrenilen gizli temsillerle üretilir.

Prosodi Kontrol Yöntemleri

tune Açık Parametre Öngörüsü

FastSpeech 2 tarzı modeller pitch, süre ve enerjiyi ayrı öngörücülerle tahmin eder; SSML etiketleriyle (rate, pitch, volume) elle ayar yapılabilir.

style Stil Vektörleri (GST/VAE)

Global Style Tokens ve VAE, referans bir kayıttaki tonlamayı gizli vektöre kodlar; ses klonlamada prosody transfer bu vektörle yapılır.

chat Doğal Dil Yönergesi

ElevenLabs v3'te [whispers], [excited] gibi audio tag'ler; gpt-4o tabanlı seste "üzgün bir tonda oku" komutu prosodiyi doğrudan yönlendirir.

flow Akış Eşleştirme (Flow Matching)

F5-TTS ve CosyVoice 2 gibi 2024-2025 modelleri, prosodi dahil tüm akustik detayı flow matching ile tek aşamada üretir; ayrı prosodi modülü gerekmez.

Modern TTS Modellerinde Prosodi (2026 Görünümü)

2017-2021 döneminde Tacotron 2, FastSpeech 2 ve VITS prosodi parametrelerini metin-ses eşleşmesinden öğrenen standart mimarilerdi. 2023 sonrası dil modeli tabanlı sistemler (VALL-E, Bark, XTTS-v2) sesi ayrık token dizisi olarak üretmeye geçti; prosodi bu token dağılımının içinde örtük olarak modellenir. 2025-2026'da öne çıkan yaklaşım, konuşma-LLM'lerin metnin anlamını kavrayarak tonlamayı bağlama göre üretmesidir: OpenAI Realtime API'nin sesli modu, Google Gemini 2.5'in native-audio çıkışı ve ElevenLabs v3 duygu, tempo ve vurguyu yönergeyle kontrol edilebilir hale getirdi. Açık kaynakta CosyVoice 2 ve F5-TTS sıfır örnekle (zero-shot) prosodi kopyalama yaparken, 82 milyon parametrelik Kokoro küçük boyutuna rağmen dengeli tonlamayla uç cihazlarda çalışabildiğini gösterdi. Değerlendirmede MOS testlerinin yanında prosodi odaklı F0-RMSE ve süre hatası metrikleri kullanılır.

Türkçe için Prosodi

Türkçe, sondan eklemeli yapısı ve genellikle son heceye düşen sözcük vurgusuyla İngilizce eğitimli prosodi modellerinden farklı davranır. Soru anlamı çoğu dilde olduğu gibi yalnızca tonlamayla değil, -mı/-mi/-mu/-mü soru ekiyle kurulur; bu ek vurguyu kendinden önceki heceye çeker ("geldi Mİ" değil "gelDİ mi"). Yer adlarında ve bazı zarflarda vurgu öne kayar (AN-kara, ŞİM-di). Bu örüntüleri öğrenmemiş bir TTS modeli, sözcükleri doğru sesletse bile yabancı aksanlı duyulur. Türkçeye özgü prosodi kurallarının sisteme eklenmesinin sentez doğallığını dinleyici testlerinde belirgin biçimde iyileştirdiği raporlanmıştır. 2026 itibarıyla ElevenLabs, Azure AI Speech ve Google Cloud TTS Türkçe için nöral sesler sunar; açık kaynak tarafında Coqui XTTS-v2 ve Piper Türkçe destekler, ancak uzun bileşik cümlelerde duraklama yerleşimi hâlâ en sık görülen hata sınıfıdır.

Prosodinin Uygulama Alanları

  • check_circle Sesli Asistanlar ve Konuşma Ajanları: Gerçek zamanlı diyalogda doğal turn-taking ve bağlama uygun tonlama, kullanıcı memnuniyetini doğrudan etkiler; OpenAI Realtime API ve Gemini Live bu alanda yarışır.
  • check_circle Sesli Kitap ve Dublaj: Karakter başına farklı duygu ve tempo üretimi prosodi kontrolü gerektirir; ElevenLabs v3'ün audio tag'leri bu iş akışını hedefler.
  • check_circle Ses Klonlama: Zero-shot klonlamada yalnızca tını değil, kişinin ritmi ve vurgu alışkanlıkları da (prosody transfer) kopyalanır; 3-10 saniyelik referans yeterlidir.
  • check_circle Konuşma Tanıma ve Analiz: Prosodik ipuçları noktalama tahmini, konuşmacı duygusu tespiti (SER) ve depresyon/Parkinson taraması gibi klinik analizlerde özellik olarak kullanılır.
  • check_circle Dil Öğrenme Uygulamaları: Telaffuz koçları, öğrencinin pitch konturunu ana dil konuşucusuyla karşılaştırarak tonlama geri bildirimi verir.

Sık Sorulan Sorular

  • check_circle Prosodi ile fonem arasındaki fark nedir?: Fonem, konuşmanın en küçük anlam ayırıcı ses birimidir (/p/, /a/ gibi) ve "ne" söylendiğini taşır. Prosodi ise fonemlerin üzerine binen ton, süre ve enerji örüntüsüdür; konuşmanın melodisi ve ritmi olarak "nasıl" söylendiğini belirler.
  • check_circle Prosodi kontrolü TTS kalitesi için neden kritiktir?: Prosodi zayıfsa sentezlenen ses doğru sesletilse bile tek düze ve robotik duyulur. İyi prosodi modeli cümle tonlamasını, duygusal vurguyu ve duraklamaları doğru yerleştirerek MOS puanını insan kaydına yaklaştırır.
  • check_circle TTS'te prosodi nasıl kontrol edilir?: Üç ana yol vardır: SSML etiketleriyle pitch/hız/vurgu ayarı, referans ses üzerinden stil vektörü aktarımı (GST/VAE) ve modern modellerde doğal dil yönergeleri veya [excited] gibi audio tag'ler.
  • check_circle Prosody transfer (prosodi aktarımı) nedir?: Bir referans kayıttaki tonlama, ritim ve vurgu örüntüsünün başka bir metne veya başka bir konuşmacının sesine taşınmasıdır; ses klonlama ve dublajda kimliğin doğal duyulması için kullanılır.
  • check_circle Türkçe TTS'te prosodi neden daha zordur?: Türkçe sondan eklemelidir, soru anlamı -mı/-mi ekiyle kurulur ve vurgu bu ekin öncesindeki heceye kayar. İngilizce ağırlıklı veriyle eğitilen modeller bu örüntüleri kaçırdığında ses yabancı aksanlı duyulur.
  • check_circle Hangi modeller prosodi açısından en gelişmiştir (2026)?: Kapalı kaynakta ElevenLabs v3, OpenAI gpt-4o tabanlı Realtime sesi ve Google Gemini 2.5 native-audio; açık kaynakta StyleTTS 2, CosyVoice 2, F5-TTS ve hafif model sınıfında Kokoro öne çıkar.