Anomaly Detection (Anomali (Aykırılık) Tespiti)

Veri kümesindeki normal kalıptan sapan aykırı nokta veya davranışı otomatik saptayan makine öğrenmesi tekniği.

Anomali tespiti (anomaly detection), bir veri kümesindeki normal davranış kalıplarının dışına çıkan nokta, olay veya davranışı otomatik olarak belirleyen makine öğrenmesi tekniğidir. Sık kullanılan eşdeğerleri arasında aykırı değer tespiti (outlier detection) ve yenilik tespiti (novelty detection) yer almaktadır. Dolandırıcılık tespiti, ağ güvenliği, üretim kalite kontrolü ve sağlık izleme gibi kritik alanlarda hayati öneme sahiptir. Anomali tespit yöntemleri üç ana kategoride incelenir. İstatistiksel yöntemler, verinin normal dağılıma uygunluğunu ölçer ve Z-skoru, IQR gibi metriklerle aykırı değerleri saptar. Makine öğrenmesi tabanlı yöntemler ise Isolation Forest, Local Outlier Factor (LOF), One-Class SVM ve Autoencoder gibi algoritmaları kapsar. Derin öğrenme yaklaşımlarında LSTM tabanlı zaman serisi anomali tespiti ve GAN tabanlı sentetik normal veri oluşturma öne çıkmaktadır. Denetimli, yarı denetimli ve denetimsiz anomali tespiti birbirinden farklıdır. Denetimli yaklaşımda hem normal hem de anormal örneklere ait etiketler gerekir; ancak gerçek dünya verilerinde anomaliler nadir olduğu için etiketli veri elde etmek genellikle güçtür. Yarı denetimli yaklaşımda yalnızca normal örnekler üzerinde eğitim yapılır; test aşamasında normalden sapan örnekler anomali sayılır. Denetimsiz yöntemler ise hiçbir etiket olmaksızın yoğunluk tahmini veya kümeleme yoluyla aykırı değerleri bulur. Eşik değeri seçimi anomali tespitinin en kritik adımlarından biridir. Çok düşük eşik yanlış pozitif (normal örneklerin anomali sanılması) üretirken çok yüksek eşik gerçek anomalilerin gözden kaçmasına neden olur. Precision-Recall eğrisi, bu dengeyi optimize etmek için kullanılan temel görselleştirme aracıdır. Gerçek zamanlı akış verilerinde (streaming data) anomali tespiti ayrıca zorluk taşır. Apache Kafka ile entegre çalışabilen Kafka Streams, Apache Flink veya Amazon Kinesis gibi platformlar, milyonlarca olayı saniyede işleme kapasitesi sunarken uygulanan modellerin çok hızlı karar vermesi gerekir. Bu gereksinim, hafif ve hızlı modellerin tercih edilmesini veya sinir ağlarının kuantizasyon teknikleriyle sıkıştırılmasını zorunlu kılar.

Anomali Çeşitleri

Anomaliler üç türde sınıflandırılır: nokta anomalisi (tek bir gözlem), bağlam anomalisi (belirli bağlam içinde anormal olan ancak genel olarak normal olan gözlem) ve kolektif anomali (birlikte anormal anlam ifade eden gözlem grubu). Örneğin bir kredi kartında yurt dışı harcama tek başına normal olabilir; ancak aynı anda iki farklı ülkede gerçekleşen harcama bağlam anomalisidir. Bir ağda kısa sürede patlayan trafik ise kolektif anomali örneği oluşturur.

Temel Algoritmalar

Isolation Forest, verinin rastgele bölünmesiyle anormal örneklerin daha az bölme gerektirdiğini varsayarak çalışır; hızlı ve ölçeklenebilirdir. LOF (Local Outlier Factor), bir noktanın komşu yoğunluğuna göre ne kadar izole olduğunu ölçer. One-Class SVM, yalnızca normal sınıf üzerinde eğitim alarak karar sınırları oluşturur. Autoencoder ise normal veriyi sıkıştırıp yeniden oluşturmak için eğitilir; anomaliler yüksek yeniden yapım hatası verir.

Zaman Serisi Anomali Tespiti

Sensör verileri, finansal zaman serileri ve günlük (log) verileri gibi sırasal veri kaynakları, anomali tespiti açısından özel zorluklar içermektedir. LSTM Autoencoder, bir penceredeki normal sistemi öğrenip gelecekteki penceredeki yeniden yapım hatasını ölçer. STL (Seasonal-Trend decomposition using LOESS) ile mevsimsel etkileri giderdikten sonra kalıntı anomali analizi uygulamak da yaygın bir yaklaşımdır. Prophet + anomaly scoring kombinasyonu da kurumsal ortamlarda tercih edilmektedir.

Uygulama Alanları

Finans sektöründe anlık ödeme işlemlerinin milyonlarcası saniyede taranarak sahte işlemler engellenir. Siber güvenlikte ağ trafiği izlenerek bilinmeyen saldırı imzalarının dışında yeni tehditlere karşı sıfır gün (zero-day) anomali tespiti uygulanır. Üretimde CNC makinesi veya robot kolundan gelen sensör verileri analiz edilerek arızadan önce uyarı verilir. Sağlıkta giyilebilir cihazlardan gelen kalp ritmi verileri anomali tespiti ile aritmiler erkenden saptanabilir.

Anomali Tespiti Araçları ve Platformlar

PyOD

Python Outlier Detection kütüphanesi; 40+ algoritma (Isolation Forest, LOF, COPOD) tek API altında sunar.

Amazon Lookout

AWS yönetilen anomali tespiti; zaman serisi ve endüstriyel sensör verisi için önceden eğitilmiş modeller içerir.

Prometheus + AlertManager

Metrik tabanlı anomali izleme; eşik kuralları ve ML destekli otomatik anomali uyarıları için kullanılır.

River

Çevrimiçi (online) makine öğrenmesi kütüphanesi; akış verisi üzerinde gerçek zamanlı anomali tespiti için uygundur.

Sık Sorulan Sorular

  • check_circle Anomali tespiti ile sınıflandırma arasındaki fark nedir? Sınıflandırma her sınıf için etiketli örnek ister; anomali tespiti çoğunlukla yalnızca normal veriyle eğitilir ve nadir anomalileri yakalar. Bu nedenle anomali tespiti, etiketli verinin kısıtlı olduğu siber güvenlik ve dolandırıcılık senaryolarında tercih edilir.
  • check_circle Hangi algoritma seçilmeli? Tablo verisi için Isolation Forest iyi bir başlangıç noktasıdır. Zaman serisi için LSTM Autoencoder; yüksek boyutlu veri için VAE düşünülebilir. Küçük veri setlerinde LOF ve One-Class SVM daha güvenilir sonuçlar verebilir.
  • check_circle Eşik değeri nasıl belirlenir? İşletme maliyetleri dikkate alınmalıdır: bir güvenlik sisteminde yanlışlıkla kaybetmek mi, yoksa yanlış pozitif ile analist yorgunluğu mu daha pahalı? Precision-Recall eğrisi ve F-beta skoru bu dengeyi optimize etmek için kullanılır.
  • check_circle PyOD nedir? Python Outlier Detection — 40'tan fazla anomali tespit algoritması içeren açık kaynak kütüphanesidir. Isolation Forest, LOF, COPOD ve ECOD gibi klasik yöntemlerden derin öğrenme tabanlı algoritmalara (AutoEncoder, DeepSVDD) kadar tek bir API sunar.
  • check_circle Anomali tespiti gerçek zamanlı akış verilerinde nasıl çalışır? Apache Kafka veya AWS Kinesis gibi akış platformlarıyla entegre çalışan hafif modeller (Isolation Forest, River kütüphanesi) milisaniyeler içinde karar verebilir. LSTM tabanlı yaklaşımlar daha yüksek gecikmeyle daha derin örüntüler yakalar; seçim gecikme bütçesine bağlıdır.