Feature Importance (Özellik Önemi)

Makine öğrenmesi modelinde her girdi özelliğinin tahmin üzerindeki etkisini sayısal olarak ölçen yorumlanabilirlik tekniği.

Feature importance (özellik önemi), makine öğrenmesi modellerinde her bir girdi özelliğinin tahmin çıktısı üzerindeki etkisini ölçen ve modellerine yorumlanabilirlik kazandıran temel bir tekniktir. On farklı değişken kullanan bir modelde, hangi değişkenlerin tahmini en çok şekillendirdiğini sayısal olarak ortaya koyar; böylece kara kutu modeller daha anlaşılır hale gelir. Bu analiz üç temel yöntemle gerçekleştirilir. Gini/MDI (Mean Decrease Impurity) yöntemi, karar ağacı tabanlı modellerde her özelliğin düğümlerdeki safsızlık azalmasına katkısını hesaplar; hızlı ve yerleşik bir yaklaşım olmakla birlikte yüksek kardinaliteli özelliklere karşı önyargılı olabilir. Permutation Importance yöntemi, bir özelliğin değerlerini test verisi üzerinde rastgele karıştırır ve modelin doğruluğundaki düşüşü ölçer; herhangi bir modelde çalışan model-bağımsız bir tekniktir. SHAP (SHapley Additive exPlanations) değerleri ise kooperatif oyun teorisinden türetilmiş matematiksel bir çerçevedir; her tahmin için her özelliğin bireysel katkısını tutarlı ve adil biçimde hesaplar ve günümüzde endüstri standardı kabul edilmektedir. SHAP'ın avantajı tutarlılık garantisidir: bir özellik modelin tahminini ne kadar etkilerse SHAP değeri de o kadar büyük olur. SHAP değerleri hem global (hangi özellik genel olarak en önemli?) hem de lokal (bu spesifik tahmin için hangi özellik belirleyici oldu?) yorumlama yapar. LIME (Local Interpretable Model-agnostic Explanations) ise karmaşık modeli lokal olarak basit bir doğrusal modelle yaklaşık olarak temsil ederek bireysel tahminler için açıklama üretir. Feature importance analizinin pratik yararları şunlardır: gereksiz özellikleri eleme yoluyla boyut azaltma, modelin paydaşlara anlaşılır biçimde açıklanması, veri toplama maliyetlerinin düşürülmesi ve modeldeki olası önyargı kaynaklarının tespiti. AB Yapay Zeka Yasası ve GDPR, otomatik kararların açıklanmasını zorunlu kılmakta; bu nedenle feature importance, açıklanabilir yapay zeka (XAI) ekosisteminin temel taşlarından birini oluşturmaktadır. Araç desteği açısından Scikit-learn, XGBoost ve LightGBM gibi kütüphaneler yerleşik importance hesapları sunarken, SHAP ve LIME kütüphaneleri herhangi bir kara kutu model için yorumlanabilir açıklamalar üretir. Random forest ve gradient boosting gibi topluluk yöntemleri, özellik önemini ortalama doğruluk kaybı üzerinden doğal biçimde hesaplar. Finans sektöründe kredi kararları, sağlık alanında tanı modelleri ve hukuki süreçlerde yapay zeka kararlarını açıklamak giderek zorunlu hale gelmektedir.

Feature Importance Nedir?

Feature importance (özellik önemi), makine öğrenmesi modellerinde her bir girdi değişkeninin tahmin üzerindeki ağırlığını sayısal olarak ölçen bir yorumlanabilirlik tekniğidir. Model bir kara kutu bile olsa, bu analiz hangi özelliklerin kararı en çok yönlendirdiğini ortaya çıkarır. Gereksiz değişkenleri eleme, model güvenilirliğini artırma ve düzenleyici kurumlar için otomatik kararları açıklama açısından kritik bir araçtır.

Temel Yöntemler

Üç ana yaklaşım öne çıkmaktadır. MDI/Gini, ağaç modellerinde her bölme noktasındaki safsızlık azalmasını toplar; hızlıdır ancak yüksek kardinaliteli değişkenlere karşı önyargılı olabilir. Permutation Importance, özellik değerlerini karıştırarak doğruluk kaybını ölçer; herhangi bir modelde uygulanabilir. SHAP ise kooperatif oyun teorisine dayalı tutarlı bir çerçeve sunarak her tahmin için her özelliğin bireysel katkısını hesaplar; hem global hem de lokal yorumlama yapar ve endüstri standardı konumundadır. LIME ise karmaşık modeli lokal olarak basit bir doğrusal modelle yaklaşık göstererek bireysel tahmin açıklamaları üretir.

Uygulama Alanları

Gereksiz özelliklerin elenip modelin hafifletilmesi, AB Yapay Zeka Yasası ve GDPR uyumluluğu için otomatik kararların açıklanması, veri toplama maliyetinin optimize edilmesi ve önyargı kaynaklarının tespiti başlıca kullanım senaryolarıdır. Finans sektöründe kredi kararları, sağlık alanında tanı modelleri ve sigorta primlerinin belirlenmesi gibi yüksek etkili kararlar için feature importance analizi giderek yasal bir zorunluluk haline gelmektedir.

Öne Çıkan Feature Importance Yöntemleri

SHAP (SHapley)

Oyun teorisine dayalı; her özelliğin tahmine katkısını bireysel örnek düzeyinde hesaplar. Model-agnostik, yorumlanabilirliği yüksek. Büyük veri setlerinde hesaplama maliyeti artabilir.

LIME

Local Interpretable Model-agnostic Explanations. Bir örnek etrafında yerel doğrusal model oluşturur. Hızlı ama global tutarsızlık riski taşır — farklı rastgele tohumlar farklı açıklamalar üretebilir.

Permutation Importance

Bir özellik karıştırıldığında model doğruluğu ne kadar düşer? Ölçer. Scikit-learn entegrasyonu vardır; model-agnostiktir. Yüksek korelasyonlu özellikler yanıltıcı sonuç verebilir.

Random Forest Gini/Entropi

Ağaç tabanlı modellerde her özelliğin karar düğümlerindeki ortalama safsızlık azalması. Hesaplaması hızlıdır; ancak yüksek kardinaliteli kategorik değişkenlere yanlı davranır.

lightbulb Feature Importance Kullanımında Pratik İpuçları

  • check_circle Çoklu yöntem kullanın: SHAP ve permutation importance sonuçları çelişiyorsa veri kalitesini veya multikolineerlik sorununu inceleyin.
  • check_circle Veri sızıntısı tuzağı: Yüksek önem skoru bazen gizli veri sızıntısına işaret eder — özelliğin hedef değişkenle gerçekten nedensel bağı olup olmadığını sorgulayın.
  • check_circle Zaman serisi dikkat: Geçmiş satışlar gibi özellikler geleceği sızdırıyor olabilir; sıralı cross-validation ile birlikte değerlendirin.
  • check_circle Kategorik özellikler: One-hot encode sonrası her sütun ayrı skora sahip olur; ortak önem skorlarını toplayarak orijinal değişken düzeyinde yorumlayın.
  • check_circle Özellik seçimi için: Önem skoru düşük ama kararlı özellikler tutulabilir; yüksek ama kararsız (yeniden çalıştırmada değişen) özellikler gürültüye işaret eder.
  • check_circle SHAP beeswarm grafiği: Global önem sıralaması ile bireysel etki yönünü (pozitif/negatif) tek arada görselleştirir — açıklanabilir AI raporlarında standart araç hâline gelmiştir.

Sık Sorulan Sorular

  • check_circle SHAP ile permutation importance arasındaki fark nedir? Permutation importance tüm model üzerinde global bir metrik üretir; hangi özelliğin genel performansı en çok etkilediğini gösterir. SHAP ise her bireysel tahmin için her özelliğin katkısını hesaplar; hem global hem de lokal yorumlama olanağı tanır ve teorik tutarlılık garantisi sunar.
  • check_circle Feature importance negatif değer alabilir mi? Gini/MDI her zaman pozitiftir. Permutation importance, bir özelliğin karıştırılmasının modeli iyileştirdiği durumlarda negatif değer alabilir — bu özelliğin eğitim setine aşırı uyum yaptığına işaret eder. SHAP değerleri de pozitif veya negatif olabilir; pozitif değer tahmini artıran, negatif değer azaltan katkıyı gösterir.
  • check_circle Hangi modeller feature importance hesaplayabilir? Ağaç tabanlı modeller (Random Forest, XGBoost, LightGBM) yerleşik MDI importance hesabına sahiptir. Permutation importance ve SHAP herhangi bir model için — derin öğrenme dahil — uygulanabilir. LIME ise lokal doğrusal yaklaşımla kara kutu modelleri açıklar.
  • check_circle Feature importance boyut indirgeme için nasıl kullanılır? Düşük importance değerlerine sahip özellikler elenebilir. Bu işlem modeli hafifletir, eğitim süresini kısaltır ve bazı durumlarda genelleme performansını artırır. Scikit-learn'ün SelectFromModel aracı bu eleme işlemini otomatikleştirir.
  • check_circle XAI ile feature importance arasındaki ilişki nedir? Feature importance, açıklanabilir yapay zeka (XAI) ekosisteminin temel tekniklerinden biridir. SHAP ve LIME, XAI'nin model-bağımsız yorumlanabilirlik katmanını oluşturan başlıca araçlardır; özellikle düzenleyici raporlama ve kullanıcı güveni için kritik önem taşır.