tag KumelemeClustering

Hierarchical Clustering (Hiyerarşik Kümeleme)

Bu sayfada KumelemeClustering (Hierarchical Clustering (Hiyerarşik Kümeleme)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Hiyerarşik kümeleme (hierarchical clustering), veri noktaları arasındaki benzerlik ilişkilerini kullanarak hiyerarşik bir yapı oluşturan denetimsiz öğrenme algoritmasıdır. K-means gibi yöntemlerin aksine, küme sayısını önceden belirlemeyi gerektirmez; bunun yerine tüm veri seti tek bir kümeden başlanarak alt gruplara bölünür ya da bireysel noktalardan başlanarak büyük kümelere birleştirilir. İki temel yaklaşım bulunur. Agglomeratif (birleştirici, aşağıdan yukarı) yöntemde her veri noktası başlangıçta ayrı bir küme kabul edilir; algoritma adım adım en yakın çiftleri birleştirir ve sonunda tek bir büyük kümeye ulaşır. Bu süreç bir ağaç diyagramında — dendrogramda — görselleştirilir. Bölücü (divisive, yukarıdan aşağı) yöntemde ise tüm veri kümesi tek bir gruptan başlar ve tekrarlı bölümlerle alt kümelere ayrılır. Pratikte agglomeratif yöntem çok daha yaygın kullanılmaktadır. Kümeler arasındaki mesafeyi ölçmek için bağlantı kriteri (linkage criterion) seçilir. Tek bağlantı (single linkage) iki kümenin birbirine en yakın noktaları arasındaki mesafeyi kullanır; zincir etkisine (chaining) yatkındır. Tam bağlantı (complete linkage) en uzak noktaları; ortalama bağlantı (average linkage) tüm nokta çiftlerinin ortalama mesafesini kullanır. Ward bağlantısı ise birleştirme sonrası küme içi toplam karesel sapma artışını minimize eder ve genel amaçlı kullanımda dengeli, kompakt kümeler ürettiği için en sık tercih edilen kriterdir. Dendrogramda belirli bir yükseklikte yatay bir kesim çizgisi çekerek istenilen küme sayısına ulaşılır; bu özellik algoritmayı keşifsel veri analizinde değerli kılar. Algoritmanın hesaplama karmaşıklığı naif uygulamada O(n³), bellek kullanımı O(n²) düzeyindedir; bu durum büyük veri kümelerinde ölçeklenebilirliği kısıtlar. Yaklaşık yöntemler ve BIRCH gibi özel algoritmalar bu sorunu kısmen gidermektedir. Biyoinformatik (gen ifadesi analizi, protein sekans sınıflandırması), belge kümeleme, müşteri segmentasyonu, piyasa sepet analizi ve anomali tespiti başlıca uygulama alanları arasındadır. Python'da scipy.cluster.hierarchy ve sklearn.cluster.AgglomerativeClustering modülleriyle kolayca uygulanır; dendrogramlar matplotlib ile görselleştirilebilir. Sonuçlar, kümeleme kalitesini ölçmek için Silhouette skoru veya Cophenetic korelasyon katsayısıyla değerlendirilir.

account_tree

Hierarchical Clustering (Hiyerarşik Kümeleme)

Hiyerarşik kümeleme (hierarchical clustering), veri noktaları arasındaki benzerlik ilişkilerini kullanarak hiyerarşik bir yapı oluşturan denetimsiz öğrenme algoritmasıdır. K-means gibi yöntemlerin aksine, küme sayısını önceden belirlemeyi gerektirmez; bunun yerine tüm veri seti tek bir kümeden başlanarak alt gruplara bölünür ya da bireysel noktalardan başlanarak büyük kümelere birleştirilir. İki temel yaklaşım bulunur. Agglomeratif (birleştirici, aşağıdan yukarı) yöntemde her veri noktası başlangıçta ayrı bir küme kabul edilir; algoritma adım adım en yakın çiftleri birleştirir ve sonunda tek bir büyük kümeye ulaşır. Bu süreç bir ağaç diyagramında — dendrogramda — görselleştirilir. Bölücü (divisive, yukarıdan aşağı) yöntemde ise tüm veri kümesi tek bir gruptan başlar ve tekrarlı bölümlerle alt kümelere ayrılır. Pratikte agglomeratif yöntem çok daha yaygın kullanılmaktadır. Kümeler arasındaki mesafeyi ölçmek için bağlantı kriteri (linkage criterion) seçilir. Tek bağlantı (single linkage) iki kümenin birbirine en yakın noktaları arasındaki mesafeyi kullanır; zincir etkisine (chaining) yatkındır. Tam bağlantı (complete linkage) en uzak noktaları; ortalama bağlantı (average linkage) tüm nokta çiftlerinin ortalama mesafesini kullanır. Ward bağlantısı ise birleştirme sonrası küme içi toplam karesel sapma artışını minimize eder ve genel amaçlı kullanımda dengeli, kompakt kümeler ürettiği için en sık tercih edilen kriterdir. Dendrogramda belirli bir yükseklikte yatay bir kesim çizgisi çekerek istenilen küme sayısına ulaşılır; bu özellik algoritmayı keşifsel veri analizinde değerli kılar. Algoritmanın hesaplama karmaşıklığı naif uygulamada O(n³), bellek kullanımı O(n²) düzeyindedir; bu durum büyük veri kümelerinde ölçeklenebilirliği kısıtlar. Yaklaşık yöntemler ve BIRCH gibi özel algoritmalar bu sorunu kısmen gidermektedir. Biyoinformatik (gen ifadesi analizi, protein sekans sınıflandırması), belge kümeleme, müşteri segmentasyonu, piyasa sepet analizi ve anomali tespiti başlıca uygulama alanları arasındadır. Python'da scipy.cluster.hierarchy ve sklearn.cluster.AgglomerativeClustering modülleriyle kolayca uygulanır; dendrogramlar matplotlib ile görselleştirilebilir. Sonuçlar, kümeleme kalitesini ölçmek için Silhouette skoru veya Cophenetic korelasyon katsayısıyla değerlendirilir.

arrow_forward