Hierarchical Clustering (Hiyerarşik Kümeleme)

Hierarchical clustering, küme sayısı belirtilmeden veri noktalarını dendrogram ağacında birleştiren denetimsiz kümeleme algoritmasıdır.

Hiyerarşik kümeleme (hierarchical clustering), veri noktaları arasındaki benzerlik ilişkilerini kullanarak hiyerarşik bir yapı oluşturan denetimsiz öğrenme algoritmasıdır. K-means gibi yöntemlerin aksine, küme sayısını önceden belirlemeyi gerektirmez; bunun yerine tüm veri seti tek bir kümeden başlanarak alt gruplara bölünür ya da bireysel noktalardan başlanarak büyük kümelere birleştirilir. İki temel yaklaşım bulunur. Agglomeratif (birleştirici) yöntemde her veri noktası başlangıçta ayrı bir küme kabul edilir; algoritma adım adım en yakın çiftleri birleştirir ve sonunda tek bir büyük kümeye ulaşır. Bu işlem bir ağaç diyagramında, yani dendrogramda görselleştirilir. Bölücü (divisive) yöntemde ise tüm veri kümesi tek bir grup olarak başlar ve tekrarlı bölümlerle alt kümelere ayrılır. Pratikte agglomeratif yöntem çok daha yaygın kullanılır. Kümeler arasındaki mesafeyi ölçmek için bağlantı kriteri (linkage criterion) seçilir. Tek bağlantı (single linkage) iki kümenin birbirine en yakın noktaları arasındaki mesafeyi; tam bağlantı (complete linkage) en uzak noktaları; ortalama bağlantı tüm nokta çiftlerinin ortalama mesafesini kullanır. Ward bağlantısı ise birleştirme sonrası küme içi varyans artışını minimize eder ve genellikle dengeli kompakt kümeler ürettiği için tercih edilir. Dendrogram üzerinde yatay bir eşik çizgisi belirleyerek istenilen küme sayısına ulaşılır; bu özellik algoritmayı keşifsel veri analizinde değerli kılar. Hesaplama karmaşıklığı naif uygulamada O(n³), bellek kullanımı O(n²) düzeyindedir; bu durum algoritmanın büyük veri kümelerinde ölçeklenmesini zorlaştırır. Biyoinformatik (gen ifadesi analizi, protein sınıflandırması), belge kümeleme, müşteri segmentasyonu ve anomali tespiti başlıca uygulama alanları arasındadır. Python'da scipy.cluster.hierarchy ve sklearn.cluster.AgglomerativeClustering kütüphaneleriyle kolayca uygulanabilir.

Nasıl Çalışır: Agglomeratif ve Bölücü Yaklaşımlar

Hiyerarşik kümeleme, iki karşıt yöntemle çalışır. Agglomeratif (aşağıdan yukarı) yaklaşımda her veri noktası başlangıçta tek başına bir küme oluşturur. Algoritma her adımda iki en yakın kümeyi birleştirir; bu işlem tüm noktalar tek kümede toplanana dek tekrarlanır. Birleştirme geçmişi dendrogram adı verilen ağaç diyagramında kayıt altına alınır. Bölücü (yukarıdan aşağı) yaklaşım tam tersi yönde çalışır: tüm veri tek kümeden başlar ve tekrarlı bölümlerle alt kümelere ayrılır. Pratikte agglomeratif yöntem baskın tercih olmakla birlikte, bölücü yöntem de özellikle geniş veri kümelerinde hız avantajı sunabilir.

Bağlantı Kriterleri

  • check_circle Ward Bağlantısı: Birleştirme sonrasında küme içi varyans artışını minimize eder; dengeli ve kompakt kümeler üretir, en sık tercih edilen yöntemdir.
  • check_circle Tam Bağlantı (Complete Linkage): İki kümenin birbirine en uzak noktaları arasındaki mesafeyi esas alır; kompakt, eş boyutlu kümeler elde etmek için uygundur.
  • check_circle Ortalama Bağlantı (Average Linkage): İki kümedeki tüm nokta çiftlerinin ortalama mesafesini kullanır; aşırı değerlere daha az duyarlıdır.
  • check_circle Tek Bağlantı (Single Linkage): İki kümenin birbirine en yakın noktaları arasındaki mesafeyi temel alır; uzun zincir yapıdaki kümeleri iyi tanımlar ancak gürültüye duyarlıdır.
  • check_circle Centroid Bağlantısı: İki küme merkezleri arasındaki Öklid mesafesini hesaplar; hız avantajı vardır ancak Ward'a göre daha az tercih edilir.

Dendrogram ve Küme Sayısı Seçimi

Algoritmanın ürettiği dendrogram, birleştirme geçmişini dikey bir ağaç olarak görselleştirir. Dikey eksen mesafe (veya benzemezlik) değerini, yatay eksen ise veri noktalarını temsil eder. Dendrogramda yatay bir kesim eşiği (threshold) belirlenerek bu seviyedeki küme sayısı elde edilir: eşik yükseltildikçe daha az küme, alçaltıldıkça daha fazla küme ortaya çıkar. Bu esneklik, K-means gibi yöntemlere kıyasla büyük bir avantajdır; araştırmacılar veriyi birden fazla granülarite düzeyinde inceleyebilir. En uzun dikey çizgiyi kesen yatay eşik genellikle doğal küme sayısını gösterir (elbow yöntemi benzeri).

Uygulama Alanları

  • check_circle Biyoinformatik: Gen ifadesi verisinde ortak ekspresyon profiline sahip gen gruplarını tespit etmek ve protein ailelerini sınıflandırmak için kullanılır.
  • check_circle Belge Kümeleme: Büyük metin koleksiyonlarında benzer konudaki belgeleri otomatik gruplara ayırır; haber kategorilendirme ve akademik makale organizasyonunda uygulanır.
  • check_circle Müşteri Segmentasyonu: Satın alma geçmişi ve demografik verilere göre müşteri grupları oluşturur; pazarlama kampanyalarının hedeflenmesinde etkin rol oynar.
  • check_circle Anomali Tespiti: Diğer kümelerden çok farklı konumlanan küçük gruplar veya tekil noktalar potansiyel aykırı değerleri (anomali) işaret eder.
  • check_circle Görüntü Bölütleme: Piksel benzerliğine dayalı hiyerarşik kümeleme, tıbbi görüntüleme ve uydu fotoğrafı analizinde nesne sınırlarını belirler.

K-Means ile Karşılaştırma

Hiyerarşik kümeleme ile K-means arasındaki en önemli fark, küme sayısı gereksinimidir: K-means k değerini baştan ister, hiyerarşik kümeleme ise sonradan dendrogram üzerinden seçime izin verir. Hiyerarşik yöntem aynı zamanda deterministik sonuçlar üretirken K-means rastgele başlangıç noktaları nedeniyle farklı çalıştırmalarda farklı sonuçlar verebilir. Öte yandan büyük veri setlerinde O(n³) karmaşıklık nedeniyle hiyerarşik yöntem yavaşlar; bu durumda mini-batch K-means veya DBSCAN daha uygun tercih olabilir. Her iki algoritma da küresel olmayan küme şekillerinde (hilal, halka) yetersiz kalabilir; bu tür veriler için DBSCAN ya da spectral clustering tercih edilir.

Sık Sorulan Sorular

  • check_circle Hierarchical clustering ile K-means arasındaki fark nedir?: K-means küme sayısını (k) baştan gerektirir ve her çalıştırmada farklı sonuç verebilir. Hiyerarşik kümeleme ise küme sayısını önceden belirtmez; dendrogram üzerinden sonradan seçim yapılır ve sonuç deterministiktir.
  • check_circle Hangi bağlantı kriteri en iyi sonucu verir?: Genel amaçlı kullanımda Ward bağlantısı çoğunlukla en dengeli kümeleri üretir. Gürültülü veri veya uzun zincirli yapılar için tek bağlantı, kompakt eş boyutlu kümeler için tam bağlantı tercih edilebilir.
  • check_circle Büyük veri setlerinde kullanılabilir mi?: Naif agglomeratif uygulaması O(n³) karmaşıklığa sahiptir; onlarca bin noktanın üzerinde belirgin biçimde yavaşlar. fastcluster kütüphanesi ve yaklaşık yöntemler (BIRCH, HDBSCAN) büyük ölçekli senaryolar için geliştirilmiştir.
  • check_circle Dendrogram'ı nasıl yorumlarım?: Birleşme yüksekliği (dikey eksen) iki kümenin ne kadar farklı olduğunu gösterir. En uzun dikey çizgiyi yatay olarak kesen kesim noktası genellikle optimal küme sayısını işaret eder.
  • check_circle HDBSCAN ile ilişkisi nedir?: HDBSCAN, hiyerarşik yoğunluk bazlı kümelemenin modern biçimidir; gürültüye dayanıklı ve küresel olmayan küme şekillerini de tanımlayabilir. Klasik agglomeratif kümelemeden daha güçlü bir alternatif sunar.