Feature Importance Nedir?
Feature importance (özellik önemi), makine öğrenmesi modellerinde her bir girdi değişkeninin tahmin üzerindeki ağırlığını sayısal olarak ölçen bir yorumlanabilirlik tekniğidir. Model bir kara kutu bile olsa, bu analiz hangi özelliklerin kararı en çok yönlendirdiğini ortaya çıkarır. Gereksiz değişkenleri eleme, model güvenilirliğini artırma ve düzenleyici kurumlar için otomatik kararları açıklama açısından kritik bir araçtır.
Temel Yöntemler
Üç ana yaklaşım öne çıkmaktadır. MDI/Gini, ağaç modellerinde her bölme noktasındaki safsızlık azalmasını toplar; hızlıdır ancak yüksek kardinaliteli değişkenlere karşı önyargılı olabilir. Permutation Importance, özellik değerlerini karıştırarak doğruluk kaybını ölçer; herhangi bir modelde uygulanabilir. SHAP ise kooperatif oyun teorisine dayalı tutarlı bir çerçeve sunarak her tahmin için her özelliğin bireysel katkısını hesaplar; hem global hem de lokal yorumlama yapar ve endüstri standardı konumundadır. LIME ise karmaşık modeli lokal olarak basit bir doğrusal modelle yaklaşık göstererek bireysel tahmin açıklamaları üretir.
Uygulama Alanları
Gereksiz özelliklerin elenip modelin hafifletilmesi, AB Yapay Zeka Yasası ve GDPR uyumluluğu için otomatik kararların açıklanması, veri toplama maliyetinin optimize edilmesi ve önyargı kaynaklarının tespiti başlıca kullanım senaryolarıdır. Finans sektöründe kredi kararları, sağlık alanında tanı modelleri ve sigorta primlerinin belirlenmesi gibi yüksek etkili kararlar için feature importance analizi giderek yasal bir zorunluluk haline gelmektedir.
Öne Çıkan Feature Importance Yöntemleri
SHAP (SHapley)
Oyun teorisine dayalı; her özelliğin tahmine katkısını bireysel örnek düzeyinde hesaplar. Model-agnostik, yorumlanabilirliği yüksek. Büyük veri setlerinde hesaplama maliyeti artabilir.
LIME
Local Interpretable Model-agnostic Explanations. Bir örnek etrafında yerel doğrusal model oluşturur. Hızlı ama global tutarsızlık riski taşır — farklı rastgele tohumlar farklı açıklamalar üretebilir.
Permutation Importance
Bir özellik karıştırıldığında model doğruluğu ne kadar düşer? Ölçer. Scikit-learn entegrasyonu vardır; model-agnostiktir. Yüksek korelasyonlu özellikler yanıltıcı sonuç verebilir.
Random Forest Gini/Entropi
Ağaç tabanlı modellerde her özelliğin karar düğümlerindeki ortalama safsızlık azalması. Hesaplaması hızlıdır; ancak yüksek kardinaliteli kategorik değişkenlere yanlı davranır.
lightbulb Feature Importance Kullanımında Pratik İpuçları
- check_circle Çoklu yöntem kullanın: SHAP ve permutation importance sonuçları çelişiyorsa veri kalitesini veya multikolineerlik sorununu inceleyin.
- check_circle Veri sızıntısı tuzağı: Yüksek önem skoru bazen gizli veri sızıntısına işaret eder — özelliğin hedef değişkenle gerçekten nedensel bağı olup olmadığını sorgulayın.
- check_circle Zaman serisi dikkat: Geçmiş satışlar gibi özellikler geleceği sızdırıyor olabilir; sıralı cross-validation ile birlikte değerlendirin.
- check_circle Kategorik özellikler: One-hot encode sonrası her sütun ayrı skora sahip olur; ortak önem skorlarını toplayarak orijinal değişken düzeyinde yorumlayın.
- check_circle Özellik seçimi için: Önem skoru düşük ama kararlı özellikler tutulabilir; yüksek ama kararsız (yeniden çalıştırmada değişen) özellikler gürültüye işaret eder.
- check_circle SHAP beeswarm grafiği: Global önem sıralaması ile bireysel etki yönünü (pozitif/negatif) tek arada görselleştirir — açıklanabilir AI raporlarında standart araç hâline gelmiştir.
Sık Sorulan Sorular
- check_circle SHAP ile permutation importance arasındaki fark nedir? Permutation importance tüm model üzerinde global bir metrik üretir; hangi özelliğin genel performansı en çok etkilediğini gösterir. SHAP ise her bireysel tahmin için her özelliğin katkısını hesaplar; hem global hem de lokal yorumlama olanağı tanır ve teorik tutarlılık garantisi sunar.
- check_circle Feature importance negatif değer alabilir mi? Gini/MDI her zaman pozitiftir. Permutation importance, bir özelliğin karıştırılmasının modeli iyileştirdiği durumlarda negatif değer alabilir — bu özelliğin eğitim setine aşırı uyum yaptığına işaret eder. SHAP değerleri de pozitif veya negatif olabilir; pozitif değer tahmini artıran, negatif değer azaltan katkıyı gösterir.
- check_circle Hangi modeller feature importance hesaplayabilir? Ağaç tabanlı modeller (Random Forest, XGBoost, LightGBM) yerleşik MDI importance hesabına sahiptir. Permutation importance ve SHAP herhangi bir model için — derin öğrenme dahil — uygulanabilir. LIME ise lokal doğrusal yaklaşımla kara kutu modelleri açıklar.
- check_circle Feature importance boyut indirgeme için nasıl kullanılır? Düşük importance değerlerine sahip özellikler elenebilir. Bu işlem modeli hafifletir, eğitim süresini kısaltır ve bazı durumlarda genelleme performansını artırır. Scikit-learn'ün SelectFromModel aracı bu eleme işlemini otomatikleştirir.
- check_circle XAI ile feature importance arasındaki ilişki nedir? Feature importance, açıklanabilir yapay zeka (XAI) ekosisteminin temel tekniklerinden biridir. SHAP ve LIME, XAI'nin model-bağımsız yorumlanabilirlik katmanını oluşturan başlıca araçlardır; özellikle düzenleyici raporlama ve kullanıcı güveni için kritik önem taşır.