tag data-mining

Bu sayfada data-mining etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

DBSCAN (Density-Based Spatial Clustering of Applications with Noise), 1996 yılında Martin Ester ve ekibi tarafından tanıtılan, yoğunluk tabanlı bir kümeleme algoritmasıdır. K-Means gibi yöntemlerin aksine, küme sayısını önceden belirleme zorunluluğu taşımaz ve keyfi geometrik şekillerdeki kümeleri tespit edebilir. Bunun yanı sıra gürültü noktalarını açıkça etiketleyerek aykırı değer tespitine de doğal destek verir. Algoritma iki temel parametreye dayanır: ε (epsilon), bir noktanın komşuluk yarıçapını tanımlar; minPts ise bir bölgenin çekirdek nokta sayılabilmesi için gereken asgari komşu sayısıdır. DBSCAN her nokta için ε yarıçaplı komşuluk bölgesini inceler. MinPts veya daha fazla komşuya sahip noktalar çekirdek nokta olarak sınıflandırılır ve bir kümenin çekirdeğini oluşturur. Bir çekirdek noktanın ε-komşuluğunda bulunan ancak kendisi çekirdek olmayan noktalar kenar nokta (border point) adını alır. Hiçbir çekirdek noktanın ε-komşuluğunda yer almayan noktalar ise gürültü (noise) olarak etiketlenir ve -1 etiketi atanır. Algoritma, birbirine yoğunluk-bağlantılı tüm noktaları tek bir kümede toplar. Parametre seçimi DBSCAN'ın başarısını doğrudan belirler. ε için yaygın yöntem k-en yakın komşu (kNN) grafiğidir: her noktanın minPts'inci en yakın komşusuna mesafesi grafiğe dökülerek dirsek (elbow) noktası bulunur. minPts için genel kural, boyut sayısının iki katı (2×d) olmakla birlikte veri setinin yoğunluğuna göre ayarlanması önerilir. Büyük veri kümelerinde standart DBSCAN O(n²) zaman karmaşıklığı gösterir. Bu kısıtlamayı aşmak için HDBSCAN (Hierarchical DBSCAN), OPTICS ve Approximated DBSCAN gibi varyantlar geliştirilmiştir. HDBSCAN, sabit ε yerine adaptif yoğunluk eşiği kullanarak değişken yoğunluktaki karmaşık küme yapılarını başarıyla tespit eder ve Python'daki hdbscan kütüphanesiyle kolayca uygulanabilir. DBSCAN başlıca şu alanlarda kullanılır: coğrafi veri analizinde olay noktalarını doğal kümeler halinde gruplama, anomali tespitinde gürültü noktalarını anormallik göstergesi olarak değerlendirme, görüntü bölütlemede piksel uzayında renk ve doku benzerliğine göre bölge oluşturma ve müşteri segmentasyonunda keyfi şekilli davranış gruplarını belirleme. Scikit-learn'ün sklearn.cluster.DBSCAN sınıfı, algoritmayı yalnızca birkaç satır Python kodu ile kullanılabilir hale getirir.

code_blocks

DBSCAN (Yoğunluk Tabanlı Kümeleme (DBSCAN))

DBSCAN (Density-Based Spatial Clustering of Applications with Noise), 1996 yılında Martin Ester ve ekibi tarafından tanıtılan, yoğunluk tabanlı bir kümeleme algoritmasıdır. K-Means gibi yöntemlerin aksine, küme sayısını önceden belirleme zorunluluğu taşımaz ve keyfi geometrik şekillerdeki kümeleri tespit edebilir. Bunun yanı sıra gürültü noktalarını açıkça etiketleyerek aykırı değer tespitine de doğal destek verir. Algoritma iki temel parametreye dayanır: ε (epsilon), bir noktanın komşuluk yarıçapını tanımlar; minPts ise bir bölgenin çekirdek nokta sayılabilmesi için gereken asgari komşu sayısıdır. DBSCAN her nokta için ε yarıçaplı komşuluk bölgesini inceler. MinPts veya daha fazla komşuya sahip noktalar çekirdek nokta olarak sınıflandırılır ve bir kümenin çekirdeğini oluşturur. Bir çekirdek noktanın ε-komşuluğunda bulunan ancak kendisi çekirdek olmayan noktalar kenar nokta (border point) adını alır. Hiçbir çekirdek noktanın ε-komşuluğunda yer almayan noktalar ise gürültü (noise) olarak etiketlenir ve -1 etiketi atanır. Algoritma, birbirine yoğunluk-bağlantılı tüm noktaları tek bir kümede toplar. Parametre seçimi DBSCAN'ın başarısını doğrudan belirler. ε için yaygın yöntem k-en yakın komşu (kNN) grafiğidir: her noktanın minPts'inci en yakın komşusuna mesafesi grafiğe dökülerek dirsek (elbow) noktası bulunur. minPts için genel kural, boyut sayısının iki katı (2×d) olmakla birlikte veri setinin yoğunluğuna göre ayarlanması önerilir. Büyük veri kümelerinde standart DBSCAN O(n²) zaman karmaşıklığı gösterir. Bu kısıtlamayı aşmak için HDBSCAN (Hierarchical DBSCAN), OPTICS ve Approximated DBSCAN gibi varyantlar geliştirilmiştir. HDBSCAN, sabit ε yerine adaptif yoğunluk eşiği kullanarak değişken yoğunluktaki karmaşık küme yapılarını başarıyla tespit eder ve Python'daki hdbscan kütüphanesiyle kolayca uygulanabilir. DBSCAN başlıca şu alanlarda kullanılır: coğrafi veri analizinde olay noktalarını doğal kümeler halinde gruplama, anomali tespitinde gürültü noktalarını anormallik göstergesi olarak değerlendirme, görüntü bölütlemede piksel uzayında renk ve doku benzerliğine göre bölge oluşturma ve müşteri segmentasyonunda keyfi şekilli davranış gruplarını belirleme. Scikit-learn'ün sklearn.cluster.DBSCAN sınıfı, algoritmayı yalnızca birkaç satır Python kodu ile kullanılabilir hale getirir.

arrow_forward