tag Ses İşleme

Acoustic Model (Akustik Model)

Bu sayfada Ses İşleme (Acoustic Model (Akustik Model)) etiketi ile işaretlenmiş 13 yapay zeka kavramını bulabilirsiniz.

Akustik Model, otomatik konuşma tanıma (ASR) sistemlerinin temel bileşenidir ve ses sinyalleri ile dilbilimsel birimler (fonemler, seslemler veya sözcükler) arasındaki istatistiksel ilişkiyi temsil eden bir modeldir. Konuşma işlemenin çekirdeğinde yer alan bu yapı, ham ses dalgalarını sayısal özelliklere (genellikle MFCC — Mel Frekansı Kepstral Katsayıları) dönüştürerek hangi sesbirime ya da sözcüğe karşılık geldiğini olasılıksal olarak tahmin eder. Tarihsel olarak akustik modeller, Gizli Markov Modelleri (Hidden Markov Models — HMM) ve Gauss Karışım Modelleri (GMM) üzerine inşa edilmiştir. Bu klasik yaklaşımda her fonem ayrı bir durum makinesiyle temsil edilir ve gözlem olasılıkları Gauss dağılımlarıyla hesaplanır. 1970'lerden 2000'lerin başına kadar konuşma tanımanın baskın paradigması olan bu yöntem, sınırlı veri ve hesaplama gücüyle bile kabul edilebilir sonuçlar vermiştir. Derin öğrenmenin yükselişiyle birlikte akustik modeller köklü bir dönüşüm geçirmiştir. Günümüz sistemlerinde Derin Sinir Ağları (DNN), Tekrarlayan Sinir Ağları (RNN), LSTM ve Transformer mimarileri, HMM ile hibrit ya da tamamen uçtan uca (end-to-end) biçimde kullanılmaktadır. OpenAI'nin Whisper modeli, dil modelini ve akustik modeli tek bir Transformer mimarisi altında birleştirerek son derece yüksek doğruluk oranları elde etmektedir. Akustik modelin eğitimi için yüzlerce hatta binlerce saat etiketlenmiş ses kaydı gerekmektedir. Çevre gürültüsü, farklı aksanlar, mikrofon kalitesi ve konuşma hızı tanıma doğruluğunu doğrudan etkiler. Transfer learning ve self-supervised learning yaklaşımları (wav2vec 2.0, HuBERT gibi modeller) etiketli veri ihtiyacını önemli ölçüde azaltmıştır. CTC (Connectionist Temporal Classification) kaybı veya dikkat tabanlı kod çözme mekanizmaları, sürekli ses sinyalinden ayrık sembol dizisine geçişi mümkün kılar. Akustik model çıkışı genellikle fonem olasılıkları dizisidir; bu olasılıklar dil modeliyle birleştirilerek nihai kelime transkripti üretilir. Türkçe gibi çekimli diller için akustik modellerin morfolojik çeşitliliği kapsayacak biçimde eğitilmesi, model kalitesi açısından kritik bir gereklilik olmaya devam etmektedir.

multitrack_audio

Acoustic Model (Akustik Model)

Akustik Model, otomatik konuşma tanıma (ASR) sistemlerinin temel bileşenidir ve ses sinyalleri ile dilbilimsel birimler (fonemler, seslemler veya sözcükler) arasındaki istatistiksel ilişkiyi temsil eden bir modeldir. Konuşma işlemenin çekirdeğinde yer alan bu yapı, ham ses dalgalarını sayısal özelliklere (genellikle MFCC — Mel Frekansı Kepstral Katsayıları) dönüştürerek hangi sesbirime ya da sözcüğe karşılık geldiğini olasılıksal olarak tahmin eder. Tarihsel olarak akustik modeller, Gizli Markov Modelleri (Hidden Markov Models — HMM) ve Gauss Karışım Modelleri (GMM) üzerine inşa edilmiştir. Bu klasik yaklaşımda her fonem ayrı bir durum makinesiyle temsil edilir ve gözlem olasılıkları Gauss dağılımlarıyla hesaplanır. 1970'lerden 2000'lerin başına kadar konuşma tanımanın baskın paradigması olan bu yöntem, sınırlı veri ve hesaplama gücüyle bile kabul edilebilir sonuçlar vermiştir. Derin öğrenmenin yükselişiyle birlikte akustik modeller köklü bir dönüşüm geçirmiştir. Günümüz sistemlerinde Derin Sinir Ağları (DNN), Tekrarlayan Sinir Ağları (RNN), LSTM ve Transformer mimarileri, HMM ile hibrit ya da tamamen uçtan uca (end-to-end) biçimde kullanılmaktadır. OpenAI'nin Whisper modeli, dil modelini ve akustik modeli tek bir Transformer mimarisi altında birleştirerek son derece yüksek doğruluk oranları elde etmektedir. Akustik modelin eğitimi için yüzlerce hatta binlerce saat etiketlenmiş ses kaydı gerekmektedir. Çevre gürültüsü, farklı aksanlar, mikrofon kalitesi ve konuşma hızı tanıma doğruluğunu doğrudan etkiler. Transfer learning ve self-supervised learning yaklaşımları (wav2vec 2.0, HuBERT gibi modeller) etiketli veri ihtiyacını önemli ölçüde azaltmıştır. CTC (Connectionist Temporal Classification) kaybı veya dikkat tabanlı kod çözme mekanizmaları, sürekli ses sinyalinden ayrık sembol dizisine geçişi mümkün kılar. Akustik model çıkışı genellikle fonem olasılıkları dizisidir; bu olasılıklar dil modeliyle birleştirilerek nihai kelime transkripti üretilir. Türkçe gibi çekimli diller için akustik modellerin morfolojik çeşitliliği kapsayacak biçimde eğitilmesi, model kalitesi açısından kritik bir gereklilik olmaya devam etmektedir.

arrow_forward
hearing

Audio Captioning (Ses Açıklaması)

Audio Captioning (Otomatik Ses Açıklaması), bir yapay zeka modelinin ham ses verisini analiz ederek içeriği doğal dil cümleleriyle otomatik olarak betimlemesi görevidir. Yalnızca konuşmayı metne dönüştüren speech-to-text sistemlerinin aksine, audio captioning müzik, çevre sesleri, hayvan sesleri ve insan aktivitelerini tek bir anlamlı cümle veya paragrafta bir araya getirir. Teknik süreç encoder-decoder mimarisi üzerine kuruludur. Ses sinyali MFCC, mel spektrogram veya ham dalga biçimi (waveform) olarak kodlanır; ardından bir dil modeli bu ses temsilini doğal dile çevirir. Son dönemde CLAP (Contrastive Language-Audio Pretraining) gibi modeller, ses ile metni ortak bir anlam uzayında eşleştirerek captioning kalitesini önemli ölçüde artırmaktadır. Alandaki temel veri kümeleri şunlardır: Clotho (4.981 ses klibi, her biri beş referans açıklamayla birlikte; DCASE yarışmasının ana değerlendirme kümesi), AudioCaps (AudioSet'ten 46.000 klipin insan tarafından yazılmış açıklamaları) ve WavCaps (ChatGPT destekli işleme hattıyla oluşturulmuş yaklaşık 400.000 klip). Model başarımı BLEU, METEOR, CIDEr ve SPIDEr metrikleriyle ölçülür. Uygulama alanları arasında işitme engelli bireyler için otomatik içerik açıklaması, büyük ses arşivlerinin metin tabanlı aranabilir kılınması, medya arşivleme, akıllı ev sistemleri ve güvenlik kameraları için ortam olay tespiti ile podcast içerik indeksleme sayılabilir. DCASE (Detection and Classification of Acoustic Scenes and Events) uluslararası yarışması, audio captioning alanındaki akademik ilerlemenin ana ölçütüdür. 2025-2026 itibarıyla alanın öncü yaklaşımı, ses kodlayıcı olarak CLAP veya BEATs modelini Qwen-Audio, LLaMA-3 veya Gemma gibi açık ağırlıklı büyük dil modelleriyle birleştiren sistemlerdir. Bu mimaride ses kodlayıcı çıktısı, projeksiyon katmanı aracılığıyla dil modelinin giriş uzayına eşlenir; böylece model karmaşık ses sahnelerini bağlam duyarlı ve tutarlı cümlelerle betimleyebilir. Sıfır-atım (zero-shot) captioning için ise GPT-4o Ses veya Gemini 1.5 gibi yetenekli çok modlu modeller ek eğitim verisi olmadan rekabetçi sonuçlar elde etmektedir.

arrow_forward
hearing

Audio Classification (Ses Sınıflandırma)

Ses sınıflandırma (Audio Classification), bir ses kaydını önceden tanımlanmış kategorilerden birine veya birkaçına atayan makine öğrenmesi görevidir. Konuşma tanıma, müzik türü tespiti, çevre sesi analizi, hayvan türü teşhisi ve sanayi makinelerinde arıza tespiti bu alanın tipik uygulama örnekleridir. Ses sınıflandırma sürecinde ham ses sinyali önce ön işlemden geçirilir. Kısa zamanlı Fourier dönüşümü (STFT) aracılığıyla zaman-frekans temsili elde edilir ve ardından insan kulağının frekans algısını taklit eden mel ölçeğine dönüştürülerek mel-spektrogram oluşturulur. Bu iki boyutlu görsel temsil, evrişimsel sinir ağlarının (CNN) doğrudan işleyebildiği bir formattır. Ek olarak MFCC (Mel Frekans Kepstrum Katsayıları) ve Chroma özellikleri, farklı görevlerde tamamlayıcı giriş temsilleri olarak kullanılır. Model eğitimi sırasında etiketlenmiş ses veri kümeleri kullanılarak ağ ağırlıkları optimize edilir. Tek etiketli problemlerde kategorik çapraz entropi kaybı yaygın seçimken, bir ses kaydında eş zamanlı birden fazla ses türü bulunabileceği çok etiketli problemlerde ikili çapraz entropi tercih edilir. Büyük ölçekli ön eğitimli modeller —YAMNet, PANN (Pre-trained Audio Neural Networks), BEATs ve Wav2Vec 2.0— transfer learning için güçlü başlangıç noktaları sunar; küçük veri kümelerinde bu modellerin son katmanları yeni kategorilere ince ayarla (fine-tuning) uyarlanır. Ses sınıflandırmanın pratik zorluklarını aşmak kritik öneme sahiptir: gürültülü ortam kayıtları, ses üstüste binmesi (polyphony), veri dengesizliği ve gerçek zamanlı çıkarım kısıtları öne çıkan sorunlardır. Veri artırma teknikleri —zaman kaydırma, perde değiştirme, arka plan gürültüsü ekleme ve SpecAugment— modelin genelleme kapasitesini artırmada etkili yöntemlerdir. Referans kıyaslamalar için AudioSet (632 kategori, yaklaşık iki milyon klip), ESC-50 (çevre sesleri), UrbanSound8K (kentsel sesler) ve FSD50K veri kümeleri yaygın olarak kullanılmaktadır. Bu görev, otomasyon, güvenlik sistemleri ve akıllı cihazlar gibi alanlarda ticari uygulamaların temelini oluşturmaktadır.

arrow_forward
noise_control_off

Noise Cancellation (Yapay Zeka ile Gürültü Engelleme)

Noise Cancellation (Gürültü Engelleme), yapay zeka ve derin öğrenme modellerini kullanarak ses sinyallerindeki istenmeyen arka plan gürültüsünü gerçek zamanlı olarak tespit edip bastıran ses işleme teknolojisidir. Geleneksel aktif gürültü engelleme (ANC) yöntemleri donanım tabanlı olup ters fazlı ses dalgaları üretirken; yapay zeka tabanlı gürültü engelleme, eğitilmiş nöral ağlar aracılığıyla yalnızca yazılım katmanında çalışır ve çok daha geniş bir gürültü spektrumunu bastırabilir. Bu teknoloji, özellikle video konferans, uzaktan çalışma, oyun ve işitme cihazları alanlarında geniş kullanım alanı bulmuştur. NVIDIA RTX Voice, Krisp, Microsoft Teams Gürültü Giderme ve Zoom'un arka plan ses filtresi bu teknolojiyi kullanan öncü ürünler arasında yer alır. Yapay zeka tabanlı gürültü engelleme sistemleri genellikle yinelemeli sinir ağları (RNN), uzun kısa süreli bellek (LSTM) modelleri veya dönüştürücü (transformer) mimarileri üzerine inşa edilir. Modeller, eşleştirilmiş temiz ses ve gürültülü ses veri kümeleri kullanılarak eğitilir; bu sayede sisteme yeni bir ses geldiğinde konuşma sinyali ile gürültü sinyalini birbirinden ayırt edebilir hâle gelirler. Çalışma prensibi şöyledir: gelen ses sinyali kısa zaman dilimlerine (frame) bölünür, her dilim için spektrogram veya mel-frekans kepstral katsayıları (MFCC) hesaplanır, nöral ağ her frekans bandında gürültünün mü konuşmanın mı hâkim olduğunu tahmin ederek bir maske üretir ve bu maske orijinal spektruma uygulanarak temizlenmiş ses elde edilir. Teknolojinin en büyük avantajı, frekans bandına bağımlı olmayan geniş spektrum gürültü bastırması sunmasıdır: klavye sesi, iklimlendirme uğultusu, sokak gürültüsü ve kalabalık ortam sesleri gibi birbirinden farklı gürültü türlerini aynı model işleyebilir. Modern çözümlerde gecikme süresi genellikle 20 milisaniyenin altındadır; bu değer gerçek zamanlı iletişim için kabul edilebilir eşiğin çok altındadır. Daha gelişmiş modeller, yalnızca gürültüyü bastırmakla kalmayıp konuşmacının sesini de iyileştirme (speech enhancement) özelliğini bünyesinde barındırır ve arka planda müzik çalarken dahi konuşma netliğini koruyabilir.

arrow_forward
code_blocks

Acoustic Scene Classification (Akustik Sahne Sınıflandırma)

Acoustic Scene Classification (ASC), bir yapay zeka sisteminin ham ses kaydından "café ortamı", "park", "şehir sokağı" veya "ev içi" gibi ortam türlerini otomatik olarak tanımasını sağlayan derin öğrenme tabanlı ses analizi tekniğidir. Türkçe karşılığı Akustik Sahne Sınıflandırma olan bu yaklaşım, mikrofon ile yakalanan çevresel sesleri işleyerek ortama özgü akustik parmak izlerini çıkarır ve ortam farkındalığı gerektiren sistemlere anında bağlam bilgisi sağlar. Temel işlem hattı şu adımlardan oluşur: Ham ses sinyali önce mel-spektrogramlara veya mel-frekans kepstral katsayılarına (MFCC) dönüştürülür; ardından bir Evrişimli Sinir Ağı (CNN) ya da Transformer mimarisi bu iki boyutlu görüntü temsilini sınıflandırır. 2013 yılında başlayan DCASE (Detection and Classification of Acoustic Scenes and Events) yarışması, bu alandaki küresel standart kıyaslamayı belirlemektedir. Her yıl güncellenen TAU Urban Acoustic Scenes veri seti, 10+ şehirde 10 farklı ortam sınıfı için etiketli ses kayıtları sunar; bu sınıflar alışveriş merkezi, metro, tramvay, park, sokak, hava limanı ve ofis gibi çeşitli mekânları kapsar. 2024 itibarıyla en yüksek skorlar, ses olayı tespiti ile ortak öğrenme kullanan hibrit CNN-Transformer modellerine aittir. ASC'nin temel uygulama alanları arasında akıllı şehir gürültü haritalaması, otonom araçların ortam farkındalığı, işitsel engelliler için çevre tanımlayıcı sistemler, giyilebilir cihazlarda bağlam duyarlı bildirim yönetimi ve akıllı ev ekipmanlarının ortam uyarlaması sayılabilir. Örneğin bir akıllı saat, kullanıcının toplantı odasında mı yoksa açık havada mı olduğunu akustik sahneye göre algılayarak bildirimleri otomatik olarak susturabilir ya da hoparlör sesini ortama uyarlayabilir. OpenSMILE, librosa ve PANNs (Pretrained Audio Neural Networks) yaygın kullanılan açık kaynak kütüphanelerdir. Teknik zorluklar arasında mikrofon kalitesine bağlı domain shift, gürültülü ortamlarda sınıf örtüşmesi ve yüksek etiketleme maliyeti öne çıkar. AudioSet üzerinde ön eğitilmiş modellerin ince ayarlanması ve transfer öğrenme yaklaşımları, az veriyle yüksek doğruluk elde etmeyi mümkün kılmaktadır. MixUp, SpecAugment ve pitch shift gibi veri artırma teknikleri küçük veri setleri için zorunlu hale gelmiştir. Edge cihazlarda gerçek zamanlı sınıflandırma amacıyla EfficientNet-b0 ve MobileNet tabanlı hafif ASC modelleri, TensorFlow Lite veya ONNX Runtime ile dağıtılmakta ve bu alan aktif bir araştırma konusu olmaya devam etmektedir.

arrow_forward
code_blocks

Keyword Detection (Anahtar Kelime Tespiti)

Keyword detection (anahtar kelime tespiti), bir ses sinyalinde veya metin akışında önceden tanımlanmış sözcükleri ya da ifadeleri gerçek zamanlı olarak tanıyan yapay zeka tabanlı bir tekniktir. Sesli asistanlar, akıllı hoparlörler ve çağrı merkezi sistemlerinde temel bir bileşen olan bu teknoloji, sürekli dinleme (continuous listening) ile tetikleme kelimelerini milisaniyeler içinde ayırt edebilir. Teknik altyapı açısından keyword detection, genellikle iki aşamalı bir pipeline üzerinde çalışır. İlk aşamada küçük ve hesaplama açısından hafif bir model (örneğin MobileNet tabanlı ses sınıflandırıcısı) cihaz üzerinde sürekli çalışarak olası tetikleme kelimelerini tarar. Pozitif bir sinyal alındığında daha kapasiteli bir konuşma tanıma motoru devreye girer. Bu yaklaşım hem pil ömrünü korur hem de gizlilik açısından daha güvenli bir çözüm sunar; veriler tetikleyici kelime tespit edilene kadar buluta gönderilmez. Anahtar kelime tespiti için yaygın olarak kullanılan mimariler arasında Convolutional Neural Network (CNN) tabanlı ses sınıflandırıcıları, Recurrent Neural Network (RNN) ve dikkat mekanizmalı hibrit modeller yer alır. "Hey Siri", "OK Google" ve "Alexa" gibi wake-word sistemleri bu teknolojinin en bilinen uygulamalarıdır. Gömülü sistemlerde çalışan keyword detection modelleri, düşük gecikme süresi (≤200ms) ve yüksek yanlış pozitif dayanıklılığı gibi katı kısıtlamalara tabi tutulur. Arka plan gürültüsü, farklı aksanlar ve konuşma hızları modelin sağlamlığını test eden başlıca zorluklardır. Bu nedenle modeller genellikle ONNX veya TFLite ile optimize edilerek edge cihazlara deploy edilir. NLP alanında ise keyword detection, metin tabanlı belgelerde belirli kavramları otomatik olarak işaretlemek, içerik moderasyonu yapmak veya arama motorlarını optimize etmek amacıyla kullanılır. Ses ve metin pipeline'larının kesiştiği bu nokta, keyword detection'ı modern yapay zeka sistemlerinin vazgeçilmez bir bileşeni haline getirir.

arrow_forward
graphic_eq

Mel Spectrogram (Mel Spektrogramı)

Mel Spektrogramı, sesin zaman-frekans temsilini insan işitme algısını taklit eden mel ölçeğinde sunan bir ses özellik çıkarma yöntemidir. "Mel" adı, 1937 yılında Stevens, Volkmann ve Newman tarafından geliştirilen ve insan kulağının farklı frekanslara nasıl tepki verdiğini modelleyen mel ölçeğinden (mel scale) gelir. İnsan kulağı düşük frekanslarda ince ayrımlar yaparken yüksek frekanslarda daha az hassastır; mel ölçeği bu işitsel özelliği matematiksel olarak yaklaşık olarak ifade eder. Mel spektrogramı üretmek için önce ses sinyali kısa pencereler (genellikle 25 ms) hâlinde Kısa Süreli Fourier Dönüşümü (STFT) ile spektrograma çevrilir. Bu işlem her pencerede frekans bileşenlerini ortaya koyar. Ardından bu spektrogram, mel filtre bankasından geçirilerek doğrusal frekans ekseni mel ölçeğine dönüştürülür; düşük frekanslarda sık, yüksek frekanslarda seyrek yerleştirilmiş üçgen filtreler kullanılır. Son adımda logaritmik ölçekleme (log-mel) uygulanarak insan işitme duyarlılığına benzer bir dinamik aralık elde edilir. Mel spektrogramları modern ses işleme ve konuşma tanıma sistemlerinde temel girdi formatı olarak kabul görür. OpenAI Whisper, 80 adet mel filtresi kullanan 25 ms pencerelere sahip log-mel spektrogramlarını ASR (Automatic Speech Recognition) için standart girdi biçimi olarak benimser. TTS (Text-to-Speech) sistemleri de mel spektrogramlarını ara temsil olarak kullanır; önce metinden mel spektrogramı tahmin edilir, ardından WaveGlow veya HiFi-GAN gibi bir vocoder bu spektrogramu ham ses dalgasına çevirir. Ses sınıflandırma, duygu tanıma, müzik türü tespiti ve konuşmacı kimlik doğrulama gibi görevlerde CNN, LSTM ve Transformer modelleri mel spektrogramlarını görsel girdi gibi işler. Bu yaklaşım, ses görevlerini bilgisayarlı görü tekniklerine taşıyarak ImageNet üzerinde önceden eğitilmiş modellerin aktarım öğrenimi (transfer learning) yoluyla ses uygulamalarında kullanılmasına olanak tanır. Mel spektrogramı, ham dalga formu işlemeye kıyasla daha az hesaplama gerektirirken yüksek doğruluk üretir ve günümüzde ses yapay zekasının temel taşlarından biri olarak kabul edilmektedir.

arrow_forward
graphic_eq

Speech Enhancement (Konuşma İyileştirme)

Konuşma İyileştirme (Speech Enhancement), gürültülü ortamlarda kaydedilen ya da iletilen ses sinyallerinin kalitesini yapay zeka ve derin öğrenme yöntemleriyle artırma sürecidir. Geleneksel istatistiksel yaklaşımlar (Wiener filtresi, MMSE gibi) sabit gürültü modellerini varsayarken, derin öğrenme tabanlı modeller değişken ve karmaşık gürültü koşullarında da etkili biçimde çalışabilmektedir. Modern sistemler; evrişimli sinir ağları (CNN), tekrarlayan sinir ağları (RNN, LSTM), üretken çekişmeli ağlar (GAN) ve Transformer mimarilerini tek başına ya da hibrit olarak kullanmaktadır. Bu ağlar, eğitim aşamasında binlerce gürültülü ve temiz ses çifti üzerinde optimize edilen bir dönüşüm fonksiyonunu öğrenerek gerçek zamanlı gürültü giderme yapabilmektedir. Tipik bir işlem hattında ses sinyali kısa zamanlı Fourier dönüşümüyle (STFT) frekans-zaman bölgesine aktarılır, sinir ağı tarafından işlenir ve ters dönüşümle (iSTFT) yeniden zaman bölgesine döndürülür. Kalite değerlendirmesi için standart metrikler kullanılmaktadır: PESQ (Perceptual Evaluation of Speech Quality) genel ses kalitesini, STOI (Short-Time Objective Intelligibility) anlaşılırlığı, CSIG ve CBAK ise arka plan gürültüsünün müdahalesini ve konuşma bozulmasını ölçer. DeepFilterNet gibi ileri düzey modeller PESQ skorunu 3.17 seviyesine çıkarırken işlem yükünü mobil cihazlarda kullanılabilir düzeyde tutmaktadır. Uygulama alanları son derece geniştir: video konferans yazılımları, akıllı hoparlörler ve sesli asistanlar, işitme cihazları, otomatik altyazı sistemleri, radyo yayıncılığı ve sağlık kayıt sistemleri bu teknolojiden yoğun olarak yararlanmaktadır. Konuşma tanıma (ASR) sistemlerinin ön işleme adımı olarak kullanılması, gürültülü ortamlarda tanıma doğruluğunu belirgin biçimde artırmaktadır. Telefon görüşmelerinde, sesli asistan wake-word algılamada ve tele-tıp uygulamalarında gerçek zamanlı konuşma iyileştirme artık standart bir bileşen olarak yerini almaktadır. Veri kümesi açısından ise VoiceBank-DEMAND ve DNS Challenge gibi kamuya açık benchmark veri setleri, model karşılaştırmaları için araştırma topluluğunun referans noktası hâline gelmiştir. Bu rekabetçi ortam, hem akademik hem de ticari konuşma iyileştirme modellerinin hızla olgunlaşmasını sağlamaktadır.

arrow_forward
code_blocks

ASR (Automatic Speech Recognition) (ASR — Otomatik Konuşma Tanıma)

ASR (Automatic Speech Recognition — Otomatik Konuşma Tanıma), insan sesini gerçek zamanlı olarak metne dönüştüren yapay zeka alt dalıdır. Mikrofon gibi bir ses girişinden alınan ham ses dalgaları; akustik model, dil modeli ve çözümleme (decoding) katmanı üçlüsü aracılığıyla işlenerek yazılı çıktıya dönüştürülür. Teknolojinin kökeni 1950'lerin ilkel rakam tanıma sistemlerine dayanır; ancak derin öğrenme devriminden sonra sıçrama yaşandı. 2014'te CTC (Connectionist Temporal Classification) kaybı ve end-to-end sinir ağları, HMM (Hidden Markov Model) tabanlı geleneksel akışın yerini almaya başladı. 2022'de OpenAI'ın açık kaynaklı Whisper modeli 680.000 saatlik çok dilli veriyle eğitildi; Türkçe dahil 99 dilde yüksek doğruluk sergiledi. Bir ASR sistemi üç temel bileşenden oluşur: Akustik Model ses özelliklerini (MFCCs, mel spektrogramları) fonem olasılıklarına eşler; Dil Modeli kelime dizileri arasında en olası olanı seçer; Decoder ise ışın araması (beam search) gibi algoritmalarla en yüksek skorlu transkripti bulur. Modern transformatör tabanlı sistemlerde bu üç katman tek bir uçtan uca mimaride birleşmiştir. ASR'ın başarımı Kelime Hata Oranı (Word Error Rate — WER) ile ölçülür: %5 WER'in altı insan düzeyine yakın kabul edilir. İngilizce için önde gelen modeller %3–6 WER aralığında yer alırken, Türkçe gibi zengin çekimli dillerde veri azlığı ve morfolojik karmaşıklık nedeniyle WER daha yüksek seyredebilir. Uygulama alanları geniştir: sesli asistanlar (Siri, Google Assistant), gerçek zamanlı altyazı, çağrı merkezi analizi, tıbbi dikte sistemleri, toplantı transkripti ve erişilebilirlik araçları. Gürültülü ortam, aksan çeşitliliği ve konuşmacıya özgü kalıplar hâlâ temel zorluklar olmaya devam etmekte; bu alanda konuşmacı ayrıştırma (speaker diarization) ve gürültü bastırma ön işleme adımları kritik rol üstlenir. Özellikle Türkçe gibi eklemeli dillerde tek bir sözcüğün yüzlerce çekim formu alabilmesi, dil modeli tasarımını önemli ölçüde güçleştirmektedir.

arrow_forward
code_blocks

CTC (Connectionist Temporal Classification) (Bağlantıcı Zamansal Sınıflandırma)

CTC (Connectionist Temporal Classification — Bağlantıcı Zamansal Sınıflandırma), girdi dizisini çıktı dizisiyle zaman hizalaması yapmadan doğrudan eğitmeyi sağlayan bir kayıp fonksiyonu ve çıkarım algoritmasıdır. Graves ve arkadaşları tarafından 2006'da önerilen bu yaklaşım, özellikle otomatik konuşma tanıma (ASR) ve el yazısı tanımada devrim yaratmıştır. Geleneksel dizi modelleri, giriş çerçeveleri ile çıktı sembolleri arasında önceden tanımlı hizalama etiketlerine ihtiyaç duyar. Bunu sağlamak emek yoğundur ve uzman işaretleme gerektirir. CTC bu kısıtı ortadan kaldırır: model, hangi girdi çerçevesinin hangi çıktı sembolüne karşılık geldiğini öğrenmek yerine, tüm olası hizalamalar üzerinden toplamı hesaplayarak optimize edilir. Bunun için çıktı alfabesine özel bir 'boş karakter' (blank) eklenir; bu karakter tekrarlı sembolleri ve dolgu çerçevelerini temsil eder. Eğitim sırasında ileri-geri algoritması (forward-backward algorithm) kullanılarak bütün geçerli hizalamaların olasılıkları verimli biçimde hesaplanır ve hedef dizinin toplam olasılığı maksimize edilir. Çıkarım aşamasında açgözlü kod çözme (greedy decoding) ya da kiriş arama (beam search) kullanılarak en olası çıktı dizisi elde edilir; tekrarlı karakterler ve blank semboller kaldırılarak nihai metin üretilir. CTC, derin öğrenmenin konuşma tanımada yaygınlaşmasında kritik rol oynamıştır. wav2vec 2.0, Conformer-CTC ve bazı Whisper varyantları gibi modern modeller CTC kaybını büyük ölçekli ön eğitimle birleştirmektedir. El yazısı ve optik karakter tanıma (OCR) sistemleri de CTC'yi satır düzeyinde metin hizalaması için kullanmaktadır. Attention tabanlı kodlayıcı-çözücü mimarilerin yaygınlaşmasıyla birlikte CTC çoğunlukla hibrit sistemlerde yardımcı kayıp (auxiliary CTC loss) olarak kullanılmakta, hem eğitim hızlanmakta hem de monotonik hizalama zorlanmaktadır.

arrow_forward
mic

Speech-to-Text (ASR) (Sesten Metne (Otomatik Konuşma Tanıma))

Speech-to-Text (STT) veya Otomatik Konuşma Tanıma (ASR — Automatic Speech Recognition), mikrofondan ya da ses dosyasından gelen konuşulmuş dili analiz ederek yazıya dönüştüren yapay zeka teknolojisidir. Siri, Google Asistan ve otomatik YouTube altyazılarının temelinde bu teknoloji yatar. Modern STT sistemlerinin mimarisi birkaç katmandan oluşur. Akustik model, ham ses sinyallerindeki konuşma birimlerini (fonemleri) tanır; dil modeli ise tanınan ses örüntülerini anlamlı kelime ve cümlelere dönüştürür. 2015 yılından itibaren bu iki ayrı bileşen, uçtan uca (end-to-end) derin öğrenme mimarileriyle tek bir modelde birleştirilmeye başlandı. Günümüzde en yaygın yaklaşım Transformer tabanlı modeller olan Wav2Vec 2.0 (Meta) ve Whisper (OpenAI) gibi sistemlerdir. Whisper, 2022'de OpenAI tarafından piyasaya sürülen ve 680.000 saat ses verisiyle eğitilen çok dilli bir STT modelidir. Açık kaynaklı yapısı geliştiricilerin özgürce kullanımına imkân tanır; Türkçe dahil 99 dili destekler. Google'ın USM (Universal Speech Model) modeli ise 300'den fazla dili kapsayan kurumsal ölçekli bir ASR altyapısı sunar. Kalite ölçütü olarak WER (Word Error Rate — Kelime Hata Oranı) kullanılır: üretilen metin ile referans metin arasındaki kelime düzeyindeki hatalar normalleştirilerek hesaplanır. İnsan seviyesi İngilizce konuşma tanımada WER %5 civarındayken modern sistemler bu eşiğe ulaşmış ya da geçmiştir. Türkiye'de STT teknolojisi müşteri hizmetleri çağrı merkezi analitiği, tıbbi dikte sistemleri ve dil öğrenme uygulamalarında giderek yaygınlaşmaktadır. Türkçenin aglütinatif yapısı (çok ekli sözcük biçimleri) sözcük dağarcığı büyüklüğü açısından STT modellerine ek zorluk çıkarmaktadır; bu nedenle Türkçeye özgü ince ayarlı modeller standart modellere kıyasla daha yüksek doğruluk sunar. Gerçek zamanlı STT uygulamalarında gecikme (latency) kritik bir tasarım parametresidir: çevrimiçi konferans altyazıları için 200 ms altı gecikme hedeflenir. Streaming ASR mimarileri, konuşmacı konuşmaya devam ederken kısmi transkriptler üretir ve sonucu iteratif olarak günceller. Bu yaklaşım, Conformer mimarisi gibi yerel dikkat (local attention) mekanizmalarını kullanan modellerle verimli biçimde uygulanır.

arrow_forward
queue_music

Stem Separation (Stem Ayrıştırma)

Stem ayrıştırma (İng. stem separation veya source separation), karışık bir ses kaydından vokal, davul, bas, gitar ve diğer enstrümanları birbirinden bağımsız parçalara (stem) ayırma işlemidir. Müzik üretimi, post-prodüksiyon ve yapay zeka destekli ses uygulamalarında her enstrümanın bağımsız olarak işlenmesini, düzenlenmesini ve yeniden karıştırılmasını mümkün kılan bu teknik, derin öğrenme tabanlı modellerle son yıllarda dramatik biçimde iyileşmiştir. Derin öğrenme öncesinde stem ayrıştırma, körsel kaynak ayrıştırma (blind source separation) ve ICA (Independent Component Analysis) gibi geleneksel sinyal işleme yöntemleriyle gerçekleştiriliyordu; bu yaklaşımlar kanal sayısı kısıtlamaları ve güçlü istatistiksel bağımsızlık varsayımları nedeniyle sınırlı kalıyordu. Derin öğrenme ile birlikte maskeli zaman-frekans temsilleri (spectral masking) ve uçtan uca öğrenme paradigmaları bu sınırları aştı. Meta'nın geliştirdiği Demucs, hibrit bir transformer-dalga formu mimarisine sahiptir; htdemucs versiyonu frekans ve zaman domenlerini paralel olarak işler ve doğal stereo genişlik koruması sağlar. Deezer'ın açık kaynak modeli Spleeter, U-Net mimarisiyle 2, 4 veya 5 stem ayrıştırması sunar. MDX-Net ve Open-Unmix ise SiSEC/MUSDB18 yarışma setinde referans sonuçlar üretmiştir. Model başarısı Sinyal-Bozulma Oranı (SDR — Signal-to-Distortion Ratio) ile ölçülür; güncel modeller vokal için +10 dB SDR değerlerine ulaşmaktadır. Stem ayrıştırmanın başlıca kullanım alanları şunlardır: karaoke altyapısı üretimi, remiks ve yeniden düzenleme, müzik eğitimi (belirli enstrümanı izole ederek pratik yapma), telif hakkı ve örnekleme (sampling) denetimi, oyun içi uyarlanabilir ses müziği ve Suno/Udio gibi üretken yapay zeka platformlarında ses yeniden kullanımı. Ses kalitesi üzerindeki etkiyi en aza indirmek için modeller genellikle kayan pencere (sliding window) ve örtüşen parça birleştirme (overlap-add) teknikleriyle çalışır. LALAL.AI, Moises, Stemify ve BaruwaAI bu teknolojiyi bulut API'leri aracılığıyla sunarken, Demucs ve Spleeter yerel GPU'larda da çalıştırılabilir.

arrow_forward
code_blocks

Language Identification (LID) (Dil Tanıma)

Language Identification (LID), kısaca dil tanıma, bir konuşma kaydının ya da metin parçasının hangi dile ait olduğunu insan müdahalesi olmadan otomatik olarak belirleyen yapay zeka görevidir. Çok dilli sistemlerin olmazsa olmaz bir ön işlem katmanı olan LID, gelen sesi veya metni önce tanımlayarak doğru ASR modeline, çeviri motoruna ya da içerik denetim sistemine yönlendirir. İki ana kolu bulunmaktadır: konuşma tabanlı LID ve metin tabanlı LID. Konuşma tabanlı LID'de sistem, sesten log-mel spektrogram veya MFCC gibi akustik öznitelikler çıkarır ve bunları sabit uzunluklu bir gömmeye (embedding) dönüştürür. Klasik yaklaşımlarda i-vektörler kullanılırken modern sistemler ECAPA-TDNN, x-vektör veya Whisper gibi derin sinir ağı mimarilerini tercih etmektedir. SpeechBrain'in VoxLingua107 üzerinde eğitilmiş ECAPA-TDNN modeli 107 dilde %93,3 doğruluk sağlarken OpenAI Whisper'ın large-v3 sürümü FLEURS kıyaslamasında %94,6 oranına ulaşmaktadır. 2025-2026 itibarıyla FireRedLID bu kıyaslamada %97,18 ile en yüksek doğruluğa ulaşmıştır. Meta'nın MMS-LID-4017 modeli ise 4.017 dili tanıyabilen en geniş kapsama sahip sistemdir. Metin tabanlı LID'de karakter n-gramları, kelime embeddingleri ve kural tabanlı yöntemler kullanılır. Meta'nın fastText tabanlı modeli 176 dili, GlotLID ise 600'den fazla düşük kaynaklı dili desteklemektedir. LID; çok dilli çağrı merkezi yönlendirme, makine çevirisi, içerik denetimi ve konuşucu diyarizasyonu gibi alanlarda yaygın biçimde kullanılmaktadır. Tek konuşmada birden fazla dilin kullanıldığı kod değiştirme (code-switching) senaryoları, sistem tasarımında önemli bir zorluk oluşturmaktadır. Ayrıca 3 saniyenin altındaki kısa ses parçalarında doğruluk belirgin biçimde düşer ve aksanlı konuşmalar bazı modellerin yanlış sınıflandırmasına yol açabilir. Türkçe, hem VoxLingua107 hem MMS-LID hem de Whisper'ın dil listeleri arasında yer almaktadır. Türkçenin sondan eklemeli (agglutinative) yapısı kısa metin parçalarında dil tanımayı güçleştirirken, TurkicNLP projesi Türk dili ailesi için ortak eğitimle kelime hata oranını %54 oranında azaltmayı başarmıştır.

arrow_forward