tag SER

Speech Emotion Recognition (Konuşma Duygu Tanıma)

Bu sayfada SER (Speech Emotion Recognition (Konuşma Duygu Tanıma)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Konuşma Duygu Tanıma (Speech Emotion Recognition, SER), bir ses kaydındaki konuşmacının mutluluk, üzüntü, öfke, korku, tiksinme ve tarafsızlık gibi duygusal durumlarını otomatik olarak tespit eden ve sınıflandıran yapay zeka teknolojisidir. Metin tabanlı duygu analizinden farklı olarak SER; ses tonu (pitch), konuşma hızı, enerji yoğunluğu ve titreşim (jitter/shimmer) gibi akustik özelliklere odaklanır. SER sistemi tipik olarak üç aşamada çalışır: ön işleme aşamasında ham ses sinyali normalize edilir ve gürültü bastırılır; özellik çıkarımında MFCC, log-mel spektrogramı veya Wav2vec 2.0/HuBERT gibi öğrenilmiş temsiller hesaplanır; sınıflandırma aşamasında ise CNN, LSTM, Transformer veya hibrit mimariler duygusal etiketi belirler. Modern sistemlerde uçtan uca eğitim ile özellik çıkarımı ve sınıflandırma aynı anda optimize edilmektedir. Temel değerlendirme veri kümeleri arasında IEMOCAP (12 saatlik interaktif diyad kayıtları, 4-8 duygu sınıfı), RAVDESS (24 aktör, 8 duygu), EmoDB (Almanca, 7 duygu) ve SAVEE (İngilizce, 7 duygu) sayılabilir. Wav2vec 2.0 tabanlı sistemler IEMOCAP üzerinde yüzde 73-74 ağırlıklı doğruluk (WA) elde ederken Temporal Bucketing yaklaşımı RAVDESS üzerinde yüzde 95 üzerine çıkmaktadır. Değerlendirme metrikleri olarak Ağırlıklı Doğruluk (WA) ve Ağırlıksız Doğruluk (UA) kullanılır. Çağrı merkezi kalite izleme, zihinsel sağlık uygulamaları (ruh hali takibi), otonom araçlar (sürücü durumu analizi) ve insan-robot etkileşimi başlıca uygulama alanlarıdır. Temel zorluklar arasında kültürel farklılıklar, oynanmış (acted) ile doğal konuşma arasındaki uçurum ve birden fazla duygunun eş zamanlı ifade edilmesi yer alır. Çok modlu SER ise ses sinyalini yüz ifadesi ve metin bağlamıyla birleştirerek daha yüksek doğruluk elde etmeyi hedefler.

code_blocks

Speech Emotion Recognition (Konuşma Duygu Tanıma)

Konuşma Duygu Tanıma (Speech Emotion Recognition, SER), bir ses kaydındaki konuşmacının mutluluk, üzüntü, öfke, korku, tiksinme ve tarafsızlık gibi duygusal durumlarını otomatik olarak tespit eden ve sınıflandıran yapay zeka teknolojisidir. Metin tabanlı duygu analizinden farklı olarak SER; ses tonu (pitch), konuşma hızı, enerji yoğunluğu ve titreşim (jitter/shimmer) gibi akustik özelliklere odaklanır. SER sistemi tipik olarak üç aşamada çalışır: ön işleme aşamasında ham ses sinyali normalize edilir ve gürültü bastırılır; özellik çıkarımında MFCC, log-mel spektrogramı veya Wav2vec 2.0/HuBERT gibi öğrenilmiş temsiller hesaplanır; sınıflandırma aşamasında ise CNN, LSTM, Transformer veya hibrit mimariler duygusal etiketi belirler. Modern sistemlerde uçtan uca eğitim ile özellik çıkarımı ve sınıflandırma aynı anda optimize edilmektedir. Temel değerlendirme veri kümeleri arasında IEMOCAP (12 saatlik interaktif diyad kayıtları, 4-8 duygu sınıfı), RAVDESS (24 aktör, 8 duygu), EmoDB (Almanca, 7 duygu) ve SAVEE (İngilizce, 7 duygu) sayılabilir. Wav2vec 2.0 tabanlı sistemler IEMOCAP üzerinde yüzde 73-74 ağırlıklı doğruluk (WA) elde ederken Temporal Bucketing yaklaşımı RAVDESS üzerinde yüzde 95 üzerine çıkmaktadır. Değerlendirme metrikleri olarak Ağırlıklı Doğruluk (WA) ve Ağırlıksız Doğruluk (UA) kullanılır. Çağrı merkezi kalite izleme, zihinsel sağlık uygulamaları (ruh hali takibi), otonom araçlar (sürücü durumu analizi) ve insan-robot etkileşimi başlıca uygulama alanlarıdır. Temel zorluklar arasında kültürel farklılıklar, oynanmış (acted) ile doğal konuşma arasındaki uçurum ve birden fazla duygunun eş zamanlı ifade edilmesi yer alır. Çok modlu SER ise ses sinyalini yüz ifadesi ve metin bağlamıyla birleştirerek daha yüksek doğruluk elde etmeyi hedefler.

arrow_forward