tag KumelemeClustering

Hierarchical Clustering (Hiyerarşik Kümeleme)

Bu sayfada KumelemeClustering (Hierarchical Clustering (Hiyerarşik Kümeleme)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Hiyerarşik kümeleme (hierarchical clustering), veri noktaları arasındaki benzerlik ilişkilerini kullanarak hiyerarşik bir yapı oluşturan denetimsiz öğrenme algoritmasıdır. K-means gibi yöntemlerin aksine, küme sayısını önceden belirlemeyi gerektirmez; bunun yerine tüm veri seti tek bir kümeden başlanarak alt gruplara bölünür ya da bireysel noktalardan başlanarak büyük kümelere birleştirilir. İki temel yaklaşım bulunur. Agglomeratif (birleştirici) yöntemde her veri noktası başlangıçta ayrı bir küme kabul edilir; algoritma adım adım en yakın çiftleri birleştirir ve sonunda tek bir büyük kümeye ulaşır. Bu işlem bir ağaç diyagramında, yani dendrogramda görselleştirilir. Bölücü (divisive) yöntemde ise tüm veri kümesi tek bir grup olarak başlar ve tekrarlı bölümlerle alt kümelere ayrılır. Pratikte agglomeratif yöntem çok daha yaygın kullanılır. Kümeler arasındaki mesafeyi ölçmek için bağlantı kriteri (linkage criterion) seçilir. Tek bağlantı (single linkage) iki kümenin birbirine en yakın noktaları arasındaki mesafeyi; tam bağlantı (complete linkage) en uzak noktaları; ortalama bağlantı tüm nokta çiftlerinin ortalama mesafesini kullanır. Ward bağlantısı ise birleştirme sonrası küme içi varyans artışını minimize eder ve genellikle dengeli kompakt kümeler ürettiği için tercih edilir. Dendrogram üzerinde yatay bir eşik çizgisi belirleyerek istenilen küme sayısına ulaşılır; bu özellik algoritmayı keşifsel veri analizinde değerli kılar. Hesaplama karmaşıklığı naif uygulamada O(n³), bellek kullanımı O(n²) düzeyindedir; bu durum algoritmanın büyük veri kümelerinde ölçeklenmesini zorlaştırır. Biyoinformatik (gen ifadesi analizi, protein sınıflandırması), belge kümeleme, müşteri segmentasyonu ve anomali tespiti başlıca uygulama alanları arasındadır. Python'da scipy.cluster.hierarchy ve sklearn.cluster.AgglomerativeClustering kütüphaneleriyle kolayca uygulanabilir.

account_tree

Hierarchical Clustering (Hiyerarşik Kümeleme)

Hiyerarşik kümeleme (hierarchical clustering), veri noktaları arasındaki benzerlik ilişkilerini kullanarak hiyerarşik bir yapı oluşturan denetimsiz öğrenme algoritmasıdır. K-means gibi yöntemlerin aksine, küme sayısını önceden belirlemeyi gerektirmez; bunun yerine tüm veri seti tek bir kümeden başlanarak alt gruplara bölünür ya da bireysel noktalardan başlanarak büyük kümelere birleştirilir. İki temel yaklaşım bulunur. Agglomeratif (birleştirici) yöntemde her veri noktası başlangıçta ayrı bir küme kabul edilir; algoritma adım adım en yakın çiftleri birleştirir ve sonunda tek bir büyük kümeye ulaşır. Bu işlem bir ağaç diyagramında, yani dendrogramda görselleştirilir. Bölücü (divisive) yöntemde ise tüm veri kümesi tek bir grup olarak başlar ve tekrarlı bölümlerle alt kümelere ayrılır. Pratikte agglomeratif yöntem çok daha yaygın kullanılır. Kümeler arasındaki mesafeyi ölçmek için bağlantı kriteri (linkage criterion) seçilir. Tek bağlantı (single linkage) iki kümenin birbirine en yakın noktaları arasındaki mesafeyi; tam bağlantı (complete linkage) en uzak noktaları; ortalama bağlantı tüm nokta çiftlerinin ortalama mesafesini kullanır. Ward bağlantısı ise birleştirme sonrası küme içi varyans artışını minimize eder ve genellikle dengeli kompakt kümeler ürettiği için tercih edilir. Dendrogram üzerinde yatay bir eşik çizgisi belirleyerek istenilen küme sayısına ulaşılır; bu özellik algoritmayı keşifsel veri analizinde değerli kılar. Hesaplama karmaşıklığı naif uygulamada O(n³), bellek kullanımı O(n²) düzeyindedir; bu durum algoritmanın büyük veri kümelerinde ölçeklenmesini zorlaştırır. Biyoinformatik (gen ifadesi analizi, protein sınıflandırması), belge kümeleme, müşteri segmentasyonu ve anomali tespiti başlıca uygulama alanları arasındadır. Python'da scipy.cluster.hierarchy ve sklearn.cluster.AgglomerativeClustering kütüphaneleriyle kolayca uygulanabilir.

arrow_forward