Acoustic Scene Classification (Akustik Sahne Sınıflandırma)

Yapay zekanın mikrofon verilerinden ortam türünü (café, park, ofis vb.) otomatik olarak tanıdığı derin öğrenme tabanlı ses analizi tekniği.

Acoustic Scene Classification (ASC), bir yapay zeka sisteminin ham ses kaydından "café ortamı", "park", "şehir sokağı" veya "ev içi" gibi ortam türlerini otomatik olarak tanımasını sağlayan derin öğrenme tabanlı ses analizi tekniğidir. Türkçe karşılığı Akustik Sahne Sınıflandırma olan bu yaklaşım, mikrofon ile yakalanan çevresel sesleri işleyerek ortama özgü akustik parmak izlerini çıkarır. Temel işlem hattı şu adımlardan oluşur: Ham ses sinyali önce mel-spektrogramlara veya mel-frekans kepstral katsayılarına (MFCC) dönüştürülür; ardından bir Evrişimli Sinir Ağı (CNN) ya da Transformer mimarisi bu iki boyutlu görüntü temsilini sınıflandırır. 2013 yılında başlayan DCASE (Detection and Classification of Acoustic Scenes and Events) yarışması, bu alandaki küresel standart kıyaslamayı belirlemektedir. 2024 itibarıyla en yüksek skorlar, ses olayı tespiti ile ortak öğrenme kullanan hibrit modellere aittir. ASC'nin temel uygulama alanları arasında akıllı şehir gürültü haritalaması, otonom araçların ortam farkındalığı, işitsel engelliler için çevre tanımlayıcı sistemler, giyilebilir cihazlarda bağlam duyarlı bildirim yönetimi ve akıllı ev ekipmanlarının ortam uyarlaması sayılabilir. OpenSMILE, librosa ve PANNs (Pretrained Audio Neural Networks) yaygın kullanılan açık kaynak kütüphanelerdir. Teknik zorluklar arasında mikrofon kalitesine bağlı domain shift, gürültülü ortamlarda sınıf örtüşmesi ve yüksek etiketleme maliyeti öne çıkar. AudioSet ön eğitimli modellerin ince ayarlanması ve transfer öğrenme yaklaşımları, az veriyle yüksek doğruluk elde etmeyi mümkün kılmaktadır. Edge cihazlarda çalışabilmek amacıyla EfficientNet-b0 ve MobileNet tabanlı hafif ASC modelleri aktif bir araştırma alanı olmaya devam etmektedir.

Temel Çalışma Prensibi

ASC sistemleri, çevresel sesi zaman-frekans alanında temsil eden mel-spektrogram veya MFCC özellik çıkarımıyla başlar. Bu iki boyutlu matrisler, görüntü sınıflandırma için geliştirilen CNN mimarilerine girdi olarak verilir; model evrişimsel katmanlar aracılığıyla ortama özgü örüntüleri öğrenir. Modern yaklaşımlar, evrişimli öznitelik çıkarımı ile dikkat mekanizmaları kullanan Transformer bloklarını birleştiren hibrit CNN-Transformer mimarileri kullanır. Ses sinyali tipik olarak 1-30 saniyelik örtüşen pencereler halinde işlenerek karar birleştirme ile nihai sınıf olasılıkları hesaplanır.

Öne Çıkan Mimariler

  • check_circle CNN Tabanlı Modeller: ResNet, VGGNet ve EfficientNet gibi görüntü CNN'leri mel-spektrogram girişiyle ASC'ye uyarlanmıştır; güçlü baseline performansı sunar.
  • check_circle Audio Spectrogram Transformer (AST): ImageNet ön eğitimli ViT ağırlıklarından yararlanan AST, 2021'de DCASE'de üst sıralara ulaşarak Transformer'ların ses alanındaki gücünü kanıtlamıştır.
  • check_circle PANNs: AudioSet üzerinde önceden eğitilmiş Pretrained Audio Neural Networks, transfer öğrenme ile küçük ASC veri setlerine kolayca ince ayar yapılmasını sağlar.
  • check_circle Hafif Edge Modeller: MobileNet-v3 ve EfficientNet-b0 tabanlı küçük modeller; IoT sensörleri ve giyilebilir cihazlarda gerçek zamanlı sınıflandırma sunar.
  • check_circle Çok Görevli Öğrenme: ASC ile Sound Event Detection görevini birlikte öğrenen modeller, ayrı öğrenilen modellerden üstün performans göstermektedir.

DCASE Yarışması ve Kıyaslama

IEEE DCASE yarışması, 2013'ten bu yana ASC alanında temel kıyaslama standardını belirlemektedir. Her yıl yayımlanan veri seti, farklı şehirlerde çekilen 10 ortam sınıfı (alışveriş merkezi, metro, tramvay, sokak, park, araba içi, hava limanı, ofis, şehir merkezi, kamusal iç mekan) içerir. 2024 yarışmasında en iyi modeller %80+ doğruluk oranlarına ulaşmış; temel metrikler Log-Average Miss Rate ve makro-ortalamalı F1 skoru olmuştur. Veri setinin görece küçüklüğü, mixup, SpecAugment ve pitch shift gibi veri artırma tekniklerini zorunlu kılmaktadır.

Uygulama Alanları

  • check_circle Akıllı Şehir Gürültü Haritası: Şehir genelinde dağıtılan sensörler ASC ile trafik, inşaat ve eğlence kaynaklarını anlık olarak haritalandırır; belediyeler bu veriyi gürültü yönetiminde kullanır.
  • check_circle Otonom Araç Farkındalığı: Otonom araçlar, ambulans sireni veya otoyol sesini café ortamından ayırt ederek sürüş kararlarını ortama göre uyarlar.
  • check_circle İşitsel Engelli Yardım Sistemleri: Giyilebilir cihazlar, kullanıcının bulunduğu ortamı sesli veya titreşimle ileterek sosyal bağlam farkındalığı sağlar.
  • check_circle Bağlam Duyarlı Bildirim Yönetimi: Akıllı telefon ve saatler, kullanıcının toplantıda mı yoksa parkta mı olduğunu anlayarak bildirimleri ve ses seviyesini otomatik olarak ayarlar.
  • check_circle Endüstriyel IoT İzleme: Fabrika ortamlarında makine arızasını gürültü profilinden erken tespit etmek için ASC ve anomali tespiti birlikte kullanılır.

Teknik Zorluklar ve Edge Dağıtım

  • check_circle Domain Shift: Farklı mikrofon tipleri ve akustik ortamlar arasındaki değişkenlik, gerçek dünya performansını düşürür; domain adaptation teknikleri bu açığı kapatır.
  • check_circle Sınıf Örtüşmesi: Café ile restoran gibi benzer akustik profillere sahip sahne çiftleri modelin en çok yanıldığı alanlardır; ince taneli özellik öğrenimi gerektirir.
  • check_circle Az Etiketli Veri: Her ortam sınıfı için yeterli etiketli ses toplamak maliyetlidir; AudioSet ön eğitimi ve yarı denetimli öğrenme bu sorunu hafifletir.
  • check_circle Edge Gerçek Zamanlı Sınırlılıklar: IoT cihazlarında ≤100ms gecikme için model küçültme (pruning, quantization) ve ONNX Runtime çıkarım motoru birlikte kullanılır.

Sık Sorulan Sorular

  • check_circle ASC ile Sound Event Detection arasındaki fark nedir?: ASC genel ortam sınıfını (sahne) tanımlar; SED ise o ortamdaki belirli ses olaylarını (kuş sesi, araba freni) zaman damgasıyla tespit eder. İkisi çoğunlukla birlikte çalışır.
  • check_circle Hangi veri setleri kullanılır?: TAU Urban Acoustic Scenes, DCASE'nin yıllık veri seti ve AudioSet en yaygın açık veri setleridir. Türkçe özel veri seti henüz standartlaşmamıştır.
  • check_circle ASC için hangi Python kütüphaneleri önerilir?: Ses ön işleme için librosa standarttır. Modelleme tarafında PANNs (torchlibrosa), torchaudio ve TensorFlow Audio sık kullanılır; hafif modeller için ONNX Runtime tercih edilir.
  • check_circle ASC mobil uygulamada çalışabilir mi?: Evet. MobileNet veya EfficientNet tabanlı modeller, TensorFlow Lite veya Core ML ile iOS/Android cihazlarda gerçek zamanlı çalışabilir; tipik model boyutu 2-15 MB aralığındadır.
  • check_circle DCASE yarışmasına nasıl katılınabilir?: dcase.community web sitesinde her yıl başvuru açılır. Sistem ve teknik rapor sunmak zorunludur; açık kaynak baseline kodları başlangıç noktası sağlar.