tag Transkripsiyon

Speaker Diarization (Konuşmacı Ayrıştırma)

Bu sayfada Transkripsiyon (Speaker Diarization (Konuşmacı Ayrıştırma)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Konuşmacı Ayrıştırma (Speaker Diarization), bir ses kaydındaki farklı konuşmacıları otomatik olarak tanıyıp birbirinden ayıran ve her konuşmacının konuştuğu zaman dilimlerini etiketleyen yapay zeka teknolojisidir. Latince'de 'günlük' anlamına gelen 'diarize' kelimesinden türeyen bu terim, çok kişili ses kayıtlarını 'Kim ne zaman konuştu?' sorusunu yanıtlayacak biçimde bölümlere ayırmayı amaçlar. Teknik olarak sistem üç temel aşamadan oluşur: Önce Ses Etkinlik Tespiti (Voice Activity Detection — VAD) ile sessizlik ve konuşma bölgeleri ayrılır. Ardından her konuşma bölümünden konuşmacı gömme vektörü (speaker embedding) çıkarılır; bu vektör, o bölümün kimin sesi olduğunu temsil eden kompakt bir sayısal imzadır. ECAPA-TDNN, x-vector ve d-vector gibi nöral gömme modelleri modern sistemlerin omurgasını oluştururken son aşamada spektral kümeleme veya aglomeratif hiyerarşik kümeleme (AHC) algoritmaları benzer vektörlü bölümleri aynı konuşmacı altında gruplar. Sistem, konuşmacı sayısını önceden bilmeden çalışabilir — kaç kişi olduğunu veriden kendisi tahmin eder. Bu özellik, katılımcı sayısının değişken olduğu toplantı ve çağrı merkezi senaryolarında kritik avantaj sağlar. Bilindiği durumlarda ise sabit sayıda kümeye bölünerek hata oranı azaltılabilir. Whisper gibi ASR modellerine entegre edilen speaker diarization, ham transkripsiyon çıktılarını yapılandırılmış, konuşmacı etiketli belgelere dönüştürür. pyannote.audio, NVIDIA NeMo ve AssemblyAI bu alanda öne çıkan açık kaynaklı ve ticari araçlardır. Hata ölçütü olarak DER (Diarization Error Rate) ve JER (Jaccard Error Rate) kullanılır; sektörde %5-15 DER aralığı iyi performans, %5 altı ise mükemmel performans olarak kabul edilir. Üst üste binen konuşmalar (overlapping speech) ve kısa konuşmacı geçişleri sistemlerin en önemli hata kaynakları olmaya devam etmektedir. Son yıllarda uçtan uca eğitilen diarization modelleri ve büyük konuşma modellerinin entegrasyonu bu sınırları önemli ölçüde daraltmış; gerçek zamanlı ve çok dilli diarization giderek olgunlaşmaktadır.

record_voice_over

Speaker Diarization (Konuşmacı Ayrıştırma)

Konuşmacı Ayrıştırma (Speaker Diarization), bir ses kaydındaki farklı konuşmacıları otomatik olarak tanıyıp birbirinden ayıran ve her konuşmacının konuştuğu zaman dilimlerini etiketleyen yapay zeka teknolojisidir. Latince'de 'günlük' anlamına gelen 'diarize' kelimesinden türeyen bu terim, çok kişili ses kayıtlarını 'Kim ne zaman konuştu?' sorusunu yanıtlayacak biçimde bölümlere ayırmayı amaçlar. Teknik olarak sistem üç temel aşamadan oluşur: Önce Ses Etkinlik Tespiti (Voice Activity Detection — VAD) ile sessizlik ve konuşma bölgeleri ayrılır. Ardından her konuşma bölümünden konuşmacı gömme vektörü (speaker embedding) çıkarılır; bu vektör, o bölümün kimin sesi olduğunu temsil eden kompakt bir sayısal imzadır. ECAPA-TDNN, x-vector ve d-vector gibi nöral gömme modelleri modern sistemlerin omurgasını oluştururken son aşamada spektral kümeleme veya aglomeratif hiyerarşik kümeleme (AHC) algoritmaları benzer vektörlü bölümleri aynı konuşmacı altında gruplar. Sistem, konuşmacı sayısını önceden bilmeden çalışabilir — kaç kişi olduğunu veriden kendisi tahmin eder. Bu özellik, katılımcı sayısının değişken olduğu toplantı ve çağrı merkezi senaryolarında kritik avantaj sağlar. Bilindiği durumlarda ise sabit sayıda kümeye bölünerek hata oranı azaltılabilir. Whisper gibi ASR modellerine entegre edilen speaker diarization, ham transkripsiyon çıktılarını yapılandırılmış, konuşmacı etiketli belgelere dönüştürür. pyannote.audio, NVIDIA NeMo ve AssemblyAI bu alanda öne çıkan açık kaynaklı ve ticari araçlardır. Hata ölçütü olarak DER (Diarization Error Rate) ve JER (Jaccard Error Rate) kullanılır; sektörde %5-15 DER aralığı iyi performans, %5 altı ise mükemmel performans olarak kabul edilir. Üst üste binen konuşmalar (overlapping speech) ve kısa konuşmacı geçişleri sistemlerin en önemli hata kaynakları olmaya devam etmektedir. Son yıllarda uçtan uca eğitilen diarization modelleri ve büyük konuşma modellerinin entegrasyonu bu sınırları önemli ölçüde daraltmış; gerçek zamanlı ve çok dilli diarization giderek olgunlaşmaktadır.

arrow_forward