Speech Emotion Recognition (Konuşma Duygu Tanıma)

Konuşmadaki ses tonu, enerji ve ritim analizi yoluyla mutluluk, öfke veya üzüntü gibi duygusal durumları otomatik tanıyan yapay zeka teknolojisi.

Konuşma Duygu Tanıma (Speech Emotion Recognition, SER), bir ses kaydındaki konuşmacının mutluluk, üzüntü, öfke, korku, tiksinme ve tarafsızlık gibi duygusal durumlarını otomatik olarak tespit eden ve sınıflandıran yapay zeka teknolojisidir. Metin tabanlı duygu analizinden farklı olarak SER; ses tonu (pitch), konuşma hızı, enerji yoğunluğu ve titreşim (jitter/shimmer) gibi akustik özelliklere odaklanır. SER sistemi tipik olarak üç aşamada çalışır: ön işleme aşamasında ham ses sinyali normalize edilir ve gürültü bastırılır; özellik çıkarımında MFCC, log-mel spektrogramı veya Wav2vec 2.0/HuBERT gibi öğrenilmiş temsiller hesaplanır; sınıflandırma aşamasında ise CNN, LSTM, Transformer veya hibrit mimariler duygusal etiketi belirler. Modern sistemlerde uçtan uca eğitim ile özellik çıkarımı ve sınıflandırma aynı anda optimize edilmektedir. Temel değerlendirme veri kümeleri arasında IEMOCAP (12 saatlik interaktif diyad kayıtları, 4-8 duygu sınıfı), RAVDESS (24 aktör, 8 duygu), EmoDB (Almanca, 7 duygu) ve SAVEE (İngilizce, 7 duygu) sayılabilir. Wav2vec 2.0 tabanlı sistemler IEMOCAP üzerinde yüzde 73-74 ağırlıklı doğruluk (WA) elde ederken Temporal Bucketing yaklaşımı RAVDESS üzerinde yüzde 95 üzerine çıkmaktadır. Değerlendirme metrikleri olarak Ağırlıklı Doğruluk (WA) ve Ağırlıksız Doğruluk (UA) kullanılır. Çağrı merkezi kalite izleme, zihinsel sağlık uygulamaları (ruh hali takibi), otonom araçlar (sürücü durumu analizi) ve insan-robot etkileşimi başlıca uygulama alanlarıdır. Temel zorluklar arasında kültürel farklılıklar, oynanmış (acted) ile doğal konuşma arasındaki uçurum ve birden fazla duygunun eş zamanlı ifade edilmesi yer alır. Çok modlu SER ise ses sinyalini yüz ifadesi ve metin bağlamıyla birleştirerek daha yüksek doğruluk elde etmeyi hedefler.

Temel Kavram ve Tarihsel Arka Plan

SER, 1990'lı yıllarda görüntü işleme ve doğal dil işleme yöntemlerinden esinlenerek ortaya çıkmış bir araştırma alanıdır. İlk çalışmalar kural tabanlı ve istatistiksel modellere dayanırken 2010'lardan itibaren derin öğrenme devrim yaratmıştır. İnsan duygularını kavramsallaştırmak için genellikle iki model kullanılır: ayrık kategorik model (mutlu, üzgün, öfkeli, tarafsız, korku, tiksinme, sürpriz) ve sürekli değerlendirme modeli (Valence-Arousal-Dominance eksenleri). Büyük konuşma veri kümeleri ve ön eğitimli Transformer modelleri bu alanda performans sınırlarını sürekli yeniden çizmektedir.

Özellik Çıkarım Yöntemleri

  • check_circle MFCC (Mel Frekans Kepstral Katsayıları): Ses sinyalinin kısa vadeli güç spektrumunu temsil eden klasik akustik özellik; 13-40 katsayı hesaplanır, geleneksel SER sistemlerinin temelini oluşturur.
  • check_circle Log-Mel Spektrogram: Frekans ekseninin mel ölçeğine dönüştürüldüğü 2D görüntü temsili; CNN mimarileri için ideal girdi formatı.
  • check_circle Wav2Vec 2.0 / HuBERT: Ham ses sinyalinden öz-denetimli ön eğitimle elde edilen bağlamsal temsiller; ince ayarla IEMOCAP üzerinde SOTA düzeyinde performans.
  • check_circle Prosodik Özellikler: Temel frekans (pitch), enerji, konuşma hızı, jitter ve shimmer; sesin ritmik ve tonsal niteliklerini kodlayan doğrudan duygusal sinyaller.
  • check_circle OpenSMILE Araç Seti: 682 düşük seviyeli tanımlayıcıdan oluşan standart özellik seti; INTERSPEECH kıyaslama çalışmalarında temel başvuru kaynağı.

Uygulama Alanları

  • check_circle Çağrı Merkezi Kalite İzleme: Müşteri ve temsilci seslerindeki duygu değişimlerini gerçek zamanlı analiz ederek eskalasyon riskini öngörme ve hizmet kalitesini ölçme.
  • check_circle Zihinsel Sağlık Takibi: Sesli günlük uygulamaları aracılığıyla depresyon ve anksiyete taraması; klinik ortamda hastalara sürekli izleme imkânı.
  • check_circle Otonom Araç Güvenliği: Sürücünün öfke, panik veya yorgunluk durumunu sesinden tespit ederek proaktif uyarı sistemleri devreye sokma.
  • check_circle İnsan-Robot Etkileşimi: Sosyal robotların kullanıcının duygusal durumuna göre yanıt tonu ve içeriğini dinamik biçimde uyarlaması.
  • check_circle Dijital Medya ve Oyunlar: Oyunculardaki duygu durumunu analiz ederek oyun zorluğunu adaptif biçimde ayarlama ve duygu odaklı içerik önerisi sistemleri.

Temel Veri Kümeleri

  • check_circle IEMOCAP: 12 saatlik interaktif İngilizce diyad kaydı; 4-8 duygu sınıfı; akademide en yaygın kullanılan SER veri kümesi.
  • check_circle RAVDESS: 24 aktörden 1440 sesli ifade; 8 duygu; hem konuşma hem şarkı kayıtları içerir; yüksek ses kalitesiyle öne çıkar.
  • check_circle EmoDB: Almanca konuşmacılardan oluşan 7 duygu sınıflı klasik veri seti; küçük boyutuna karşın sık tercih edilir.
  • check_circle MSP-Podcast: Gerçek podcast yayınlarından derlenen büyük ölçekli doğal konuşma veri seti; Valence-Arousal-Dominance sürekli etiketli.
  • check_circle MELD: Friends TV dizisinden çıkarılan diyaloglar; bağlam bağımlı ve çok modlu SER araştırmaları için ideal çerçeve.

Çok Modlu SER ve Güncel Gelişmeler

Tek modalite (ses) ile elde edilen doğruluk oranları birçok gerçek dünya uygulaması için yetersiz kalmaktadır. Çok modlu SER yaklaşımları ses sinyalini yüz ifadesi, beden dili ve metin bağlamıyla bir araya getirerek performansı anlamlı biçimde artırmaktadır. BLSP-Emo ve Whisper tabanlı ince ayar modelleri, hem transkripsiyon hem duygu sınıflandırmasını tek geçişte gerçekleştirebilmektedir. Federe öğrenme tabanlı çalışmalar ise gizlilik gereksinimlerini karşılarken birden fazla kurumun verisinden yararlanmayı mümkün kılmaktadır.

Sık Sorulan Sorular

  • check_circle SER metin tabanlı duygu analizinden nasıl farklıdır?: Metin tabanlı duygu analizi kelimelerin anlamına odaklanırken SER ses tonu, enerji ve hız gibi akustik özellikleri kullanır; aynı cümle farklı tonlamalarla zıt duygular taşıyabilir.
  • check_circle IEMOCAP üzerinde en iyi doğruluk nedir?: Wav2vec 2.0 ince ayarlı modeller yaklaşık yüzde 73-74 WA; Temporal Bucketing yaklaşımı bazı yapılandırmalarda yüzde 89 üzerini bildirmiştir (2025 sonuçları).
  • check_circle Türkçe için SER veri kümesi var mı?: Boğaziçi Üniversitesi Türkçe Duygusal Ses Veritabanı (BUSS) gibi küçük ölçekli veri kümeleri bulunmaktadır; ancak İngilizce kaynaklara kıyasla oldukça sınırlıdır.
  • check_circle SER sistemleri gerçek zamanlı çalışabilir mi?: ECAPA-TDNN ve TDNNx gibi hafif modeller CPU üzerinde bile 50ms altı gecikmeyle çalışabilmekte; çağrı merkezi uygulamalarında yaygın kullanılmaktadır.
  • check_circle Kültürel farklılıklar SER performansını nasıl etkiler?: Duygu ifadesi kültürden kültüre farklılık gösterir; tek veri kümesi üzerinde eğitilen model farklı kültürlerde yüzde 10-20 performans düşüşü yaşayabilir.