tag lof

Outlier Detection Nedir? Aykırı Değer Tespiti (Aykırı Değer Tespiti)

Bu sayfada lof (Outlier Detection Nedir? Aykırı Değer Tespiti (Aykırı Değer Tespiti)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Aykırı değer tespiti (outlier detection ya da anomaly detection), bir veri seti içinde normal davranıştan anormal biçimde sapan gözlemleri otomatik olarak tanımlayan makine öğrenmesi ve istatistik tekniklerinin bütünüdür. Aykırı değerler üç kaynaktan doğabilir: veri toplama ya da ölçüm hataları; nadir ama gerçek olaylar (dolandırıcılık işlemi, hastalık belirtisi); veya ilginç uç noktalar (pazar fırsatı, keşif). Kaynağı doğru saptamak uygulanacak yöntemi belirler. İstatistiksel yöntemler en basit ve yorumlanabilir yaklaşımlardır. IQR (Interquartile Range) yöntemi, birinci ve üçüncü çeyrekler arasındaki aralığın 1.5 katının dışında kalan değerleri aykırı sayar; tek değişkenli ve normal dağılıma yakın verilerde çalışır. Z-skoru, bir gözlemin ortalamastan standart sapma cinsinden uzaklığını ölçer; |z| > 3 eşiği sıkça kullanılır. Bu yöntemler çok boyutlu veri ve doğrusal olmayan dağılımlarda yetersiz kalır. Yoğunluk tabanlı yöntemler yerel komşuluk ilişkilerini kullanır. LOF (Local Outlier Factor, 2000), bir noktanın yerel yoğunluğunu komşularının yoğunluğuyla karşılaştırır; çevresine kıyasla boşlukta kalan noktalar yüksek LOF skoru alır. DBSCAN (Density-Based Spatial Clustering), minimum komşu sayısını karşılayamayan noktaları "gürültü" yani aykırı değer olarak etiketler; küme şeklini önceden belirtme zorunluluğu yoktur. Makine öğrenmesi tabanlı yöntemler yüksek boyutlu veride öne çıkar. Isolation Forest (Liu ve ark., 2008), rastgele özellik ve bölüm noktaları seçerek veriyi yinelemeli böler; az örnekli aykırı değerler ortalamadan çok daha kısa yolda izole edildiğinden ağaç derinliği kısa olur. Bu basit sezgi ölçeklenebilir ve paralel hesaplamaya uygundur. One-Class SVM, yalnızca normal sınıfın verisinden sıkı bir karar sınırı öğrenir; bu sınırın dışına düşen noktaları anormal kabul eder. Autoencoder tabanlı yöntemler ise giriş verisini düşük boyutlu gizli uzayda yeniden oluşturur; yeniden yapılandırma hatası (reconstruction error) yüksek olan örnekler modelin öğrendiği "normal" desenden uzaklaşmıştır. Uygulama alanları son derece geniştir: bankacılıkta kredi kartı dolandırıcılığı tespiti, endüstriyel IoT'da makine arıza öngörüsü (predictive maintenance), ağ güvenliğinde siber saldırı tespiti, sağlıkta nadir hastalık tanısı ve perakendede envanter sahtekarlığı bu alanların öne çıkanlarıdır. Denetlenmemiş (unsupervised) senaryolarda etiketli veri gerektirmeyen Isolation Forest ve LOF tercih edilirken, az sayıda bilinen anormallik örneği varsa yarı-denetimli (semi-supervised) yaklaşımlar değer katar.

🔍

Outlier Detection Nedir? Aykırı Değer Tespiti (Aykırı Değer Tespiti)

Aykırı değer tespiti (outlier detection ya da anomaly detection), bir veri seti içinde normal davranıştan anormal biçimde sapan gözlemleri otomatik olarak tanımlayan makine öğrenmesi ve istatistik tekniklerinin bütünüdür. Aykırı değerler üç kaynaktan doğabilir: veri toplama ya da ölçüm hataları; nadir ama gerçek olaylar (dolandırıcılık işlemi, hastalık belirtisi); veya ilginç uç noktalar (pazar fırsatı, keşif). Kaynağı doğru saptamak uygulanacak yöntemi belirler. İstatistiksel yöntemler en basit ve yorumlanabilir yaklaşımlardır. IQR (Interquartile Range) yöntemi, birinci ve üçüncü çeyrekler arasındaki aralığın 1.5 katının dışında kalan değerleri aykırı sayar; tek değişkenli ve normal dağılıma yakın verilerde çalışır. Z-skoru, bir gözlemin ortalamastan standart sapma cinsinden uzaklığını ölçer; |z| > 3 eşiği sıkça kullanılır. Bu yöntemler çok boyutlu veri ve doğrusal olmayan dağılımlarda yetersiz kalır. Yoğunluk tabanlı yöntemler yerel komşuluk ilişkilerini kullanır. LOF (Local Outlier Factor, 2000), bir noktanın yerel yoğunluğunu komşularının yoğunluğuyla karşılaştırır; çevresine kıyasla boşlukta kalan noktalar yüksek LOF skoru alır. DBSCAN (Density-Based Spatial Clustering), minimum komşu sayısını karşılayamayan noktaları "gürültü" yani aykırı değer olarak etiketler; küme şeklini önceden belirtme zorunluluğu yoktur. Makine öğrenmesi tabanlı yöntemler yüksek boyutlu veride öne çıkar. Isolation Forest (Liu ve ark., 2008), rastgele özellik ve bölüm noktaları seçerek veriyi yinelemeli böler; az örnekli aykırı değerler ortalamadan çok daha kısa yolda izole edildiğinden ağaç derinliği kısa olur. Bu basit sezgi ölçeklenebilir ve paralel hesaplamaya uygundur. One-Class SVM, yalnızca normal sınıfın verisinden sıkı bir karar sınırı öğrenir; bu sınırın dışına düşen noktaları anormal kabul eder. Autoencoder tabanlı yöntemler ise giriş verisini düşük boyutlu gizli uzayda yeniden oluşturur; yeniden yapılandırma hatası (reconstruction error) yüksek olan örnekler modelin öğrendiği "normal" desenden uzaklaşmıştır. Uygulama alanları son derece geniştir: bankacılıkta kredi kartı dolandırıcılığı tespiti, endüstriyel IoT'da makine arıza öngörüsü (predictive maintenance), ağ güvenliğinde siber saldırı tespiti, sağlıkta nadir hastalık tanısı ve perakendede envanter sahtekarlığı bu alanların öne çıkanlarıdır. Denetlenmemiş (unsupervised) senaryolarda etiketli veri gerektirmeyen Isolation Forest ve LOF tercih edilirken, az sayıda bilinen anormallik örneği varsa yarı-denetimli (semi-supervised) yaklaşımlar değer katar.

arrow_forward