tag AkustikSahne
Acoustic Scene Classification (Akustik Sahne Sınıflandırma)
Bu sayfada AkustikSahne (Acoustic Scene Classification (Akustik Sahne Sınıflandırma)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
Acoustic Scene Classification (ASC), bir yapay zeka sisteminin ham ses kaydından "café ortamı", "park", "şehir sokağı" veya "ev içi" gibi ortam türlerini otomatik olarak tanımasını sağlayan derin öğrenme tabanlı ses analizi tekniğidir. Türkçe karşılığı Akustik Sahne Sınıflandırma olan bu yaklaşım, mikrofon ile yakalanan çevresel sesleri işleyerek ortama özgü akustik parmak izlerini çıkarır ve ortam farkındalığı gerektiren sistemlere anında bağlam bilgisi sağlar. Temel işlem hattı şu adımlardan oluşur: Ham ses sinyali önce mel-spektrogramlara veya mel-frekans kepstral katsayılarına (MFCC) dönüştürülür; ardından bir Evrişimli Sinir Ağı (CNN) ya da Transformer mimarisi bu iki boyutlu görüntü temsilini sınıflandırır. 2013 yılında başlayan DCASE (Detection and Classification of Acoustic Scenes and Events) yarışması, bu alandaki küresel standart kıyaslamayı belirlemektedir. Her yıl güncellenen TAU Urban Acoustic Scenes veri seti, 10+ şehirde 10 farklı ortam sınıfı için etiketli ses kayıtları sunar; bu sınıflar alışveriş merkezi, metro, tramvay, park, sokak, hava limanı ve ofis gibi çeşitli mekânları kapsar. 2024 itibarıyla en yüksek skorlar, ses olayı tespiti ile ortak öğrenme kullanan hibrit CNN-Transformer modellerine aittir. ASC'nin temel uygulama alanları arasında akıllı şehir gürültü haritalaması, otonom araçların ortam farkındalığı, işitsel engelliler için çevre tanımlayıcı sistemler, giyilebilir cihazlarda bağlam duyarlı bildirim yönetimi ve akıllı ev ekipmanlarının ortam uyarlaması sayılabilir. Örneğin bir akıllı saat, kullanıcının toplantı odasında mı yoksa açık havada mı olduğunu akustik sahneye göre algılayarak bildirimleri otomatik olarak susturabilir ya da hoparlör sesini ortama uyarlayabilir. OpenSMILE, librosa ve PANNs (Pretrained Audio Neural Networks) yaygın kullanılan açık kaynak kütüphanelerdir. Teknik zorluklar arasında mikrofon kalitesine bağlı domain shift, gürültülü ortamlarda sınıf örtüşmesi ve yüksek etiketleme maliyeti öne çıkar. AudioSet üzerinde ön eğitilmiş modellerin ince ayarlanması ve transfer öğrenme yaklaşımları, az veriyle yüksek doğruluk elde etmeyi mümkün kılmaktadır. MixUp, SpecAugment ve pitch shift gibi veri artırma teknikleri küçük veri setleri için zorunlu hale gelmiştir. Edge cihazlarda gerçek zamanlı sınıflandırma amacıyla EfficientNet-b0 ve MobileNet tabanlı hafif ASC modelleri, TensorFlow Lite veya ONNX Runtime ile dağıtılmakta ve bu alan aktif bir araştırma konusu olmaya devam etmektedir.