Nasıl Çalışır: Agglomeratif ve Bölücü Yaklaşımlar
Hiyerarşik kümeleme, iki karşıt yöntemle çalışır. Agglomeratif (aşağıdan yukarı) yaklaşımda her veri noktası başlangıçta tek başına bir küme oluşturur. Algoritma her adımda iki en yakın kümeyi birleştirir; bu işlem tüm noktalar tek kümede toplanana dek tekrarlanır. Birleştirme geçmişi dendrogramda kayıt altına alınır. Bölücü (yukarıdan aşağı) yaklaşım tam tersi yönde çalışır: tüm veri tek kümeden başlar ve tekrarlı bölümlerle alt kümelere ayrılır. Pratikte agglomeratif yöntem baskın tercih olmakla birlikte bölücü yöntem geniş veri kümelerinde hız avantajı sunabilir.
Bağlantı Kriterleri
- check_circle Ward Bağlantısı: Birleştirme sonrasında küme içi toplam karesel sapma artışını minimize eder. Dengeli ve kompakt kümeler üretir; genel amaçlı kullanımda en sık tercih edilen kriterdir.
- check_circle Tam Bağlantı (Complete Linkage): İki küme arasındaki mesafeyi en uzak nokta çiftiyle tanımlar. Dairesel, birbirine eş büyüklükte kümeler oluşturma eğilimindedir; aykırı değerlere duyarlıdır.
- check_circle Tek Bağlantı (Single Linkage): En yakın nokta çiftine dayalı mesafe ölçer. Uzun zincir benzeri kümelere yol açabilir (chaining effect); gürültülü veriye karşı kırılgandır.
- check_circle Ortalama Bağlantı (Average Linkage): İki kümedeki tüm nokta çiftlerinin ortalama mesafesini kullanır. Tek ve tam bağlantı arasında denge kuran, daha kararlı bir yaklaşımdır.
Dendrogram ve Küme Sayısı Seçimi
Dendrogram, hiyerarşik kümelemenin en güçlü görselleştirme aracıdır. Dikey eksen birleştirme mesafesini, yatay eksen veri noktalarını temsil eder. Belirli bir yükseklikte yatay bir kesim çizgisi çekerek istenilen küme sayısına ulaşılır; büyük sıçramanın gerçekleştiği mesafe genellikle optimal küme sayısına işaret eder. Cophenetic korelasyon katsayısı, dendrogramın orijinal uzaklık matrisini ne kadar iyi temsil ettiğini ölçer ve bağlantı kriteri seçimini değerlendirmek için kullanılır.
Uygulama Alanları
- check_circle Biyoinformatik: Gen ifadesi matrislerini kümelemek için yaygın kullanılır; hangi genlerin benzer koşullarda birlikte aktive olduğunu ortaya koyar. Protein sekans sınıflandırması ve filogenetik analizde de temel araçtır.
- check_circle Müşteri Segmentasyonu: Satın alma davranışı, demografik özellikler ve etkileşim verilerini birleştirerek homojen müşteri grupları oluşturur. K-means'in aksine küme sayısı önceden belirlenmek zorunda değildir.
- check_circle Belge ve Metin Kümeleme: TF-IDF veya embedding vektörleri kullanılarak benzer makaleler, haberler veya destek talepleri gruplanır. Haber ajansları arşiv organizasyonu ve konu tespiti için kullanır.
- check_circle Anomali Tespiti: Ana kümelerden uzak kalan ve küçük boyutlu alt küme oluşturan noktalar aykırı değer adayı olarak işaretlenir. Ağ güvenliği ve dolandırıcılık tespitinde uygulanır.
K-Means ile Karşılaştırma
Hiyerarşik kümeleme ile K-means arasındaki temel fark, küme sayısı gerektirmemesidir: hiyerarşik yöntemde küme sayısı dendrogram üzerinde analiz sonrasında belirlenir. K-means daire benzeri kümeler üretirken hiyerarşik kümeleme istenen şekilde küme oluşturabilir. Hesaplama maliyeti açısından K-means büyük veri setlerinde çok daha ölçeklenebilirdir; hiyerarşik kümelemenin O(n³) karmaşıklığı on binleri aşan veri setlerinde kısıtlayıcı olur. Buna karşın hiyerarşik yöntemin ürünü olan dendrogram, veri yapısı hakkında K-means'in sunmadığı zengin görsel bilgi içerir.
Sık Sorulan Sorular
- check_circle Hierarchical clustering ile K-means arasındaki temel fark nedir? K-means küme sayısını önceden belirtmenizi ister ve yuvarlak kümeler üretmeye meyillidir. Hiyerarşik kümeleme küme sayısı gerektirmez; dendrogram analizi sonrasında istenen sayıda küme kesilebilir ve her şekildeki küme yapısını yakalayabilir.
- check_circle Ward bağlantısı neden tercih edilir? Ward bağlantısı, birleştirme sonrası küme içi varyans artışını minimize ettiğinden dengeli ve kompakt kümeler üretir. Diğer kriterlere kıyasla aykırı değerlere daha az duyarlıdır ve genellikle daha yorumlanabilir dendrogramlar oluşturur.
- check_circle Büyük veri setlerinde hiyerarşik kümeleme uygulanabilir mi? Naif uygulamada O(n³) karmaşıklık nedeniyle on binleri aşan veri setlerinde zorlanır. BIRCH algoritması veya örnekleme tabanlı yaklaşımlar bu kısıtı hafifletmek için kullanılabilir; alternatif olarak K-means gibi ölçeklenebilir yöntemler tercih edilebilir.
- check_circle Dendrogram nasıl yorumlanır? Dikey eksen birleştirme mesafesini gösterir; yüksek mesafede birleşen dallar birbirinden uzak kümeleri temsil eder. Yatay kesim çizgisini büyük sıçramanın hemen altına çekerek optimal küme sayısı belirlenebilir. Python'da scipy.dendrogram ile görselleştirilebilir.