Churn Prediction Nedir?
Churn prediction (müşteri kaybı tahmini), bir şirketin müşteri tabanından hangilerinin yakın vadede ayrılacağını tahmin etmek için istatistiksel ve makine öğrenmesi yöntemlerini kullanan analitik bir süreçtir. Teknik açıdan problem bir ikili sınıflandırma (binary classification) görevidir: bir müşteri ya 'churn' (1) ya da 'churn değil' (0) olarak etiketlenir.
İşletmeler açısından, yeni bir müşteri kazanmak mevcut bir müşteriyi elde tutmaktan beş ila yedi kat daha maliyetlidir. Bu gerçek, churn tahminini sıradan bir analitik egzersizden stratejik bir iş aracına dönüştürür. Model çıktısı olan 'churn olasılık skoru', pazarlama ekiplerinin özel kampanyalar tasarlamasını, müşteri başarı ekiplerinin proaktif temas kurmasını sağlar.
Gerçek zamanlı skorlama sistemlerine entegre edilen modeller, CRM ve pazarlama otomasyon platformlarıyla birlikte tetikleyici tabanlı müdahale akışları oluşturur.
Temel ML Teknikleri
Churn prediction problemi farklı karmaşıklık düzeylerine sahip makine öğrenmesi yöntemleriyle çözülebilir.
Lojistik Regresyon: En basit ve yorumlanabilir başlangıç noktasıdır. Özellik katsayıları 'hangi değişken churnu artırır?' sorusunu yanıtlar. Düzenleyici (regularization) eklenerek yüksek boyutlu verilerde kararlı çalışır.
Karar Ağaçları ve Rastgele Ormanlar: Karar ağaçları eşik tabanlı ayrımları hiyerarşik biçimde öğrenir. Rastgele ormanlar yüzlerce ağacı birleştirerek varyansı düşürür ve eksik değerlere karşı dayanıklıdır.
Gradient Boosting (XGBoost, LightGBM, CatBoost): Ardışık ağaçların artıkları üzerinde öğrenen bu yöntem, tablo verilerinde sektör standardı haline gelmiştir. Uygun şekilde optimize edildiğinde üst düzey AUC-ROC değerleri elde edilir.
Yapay Sinir Ağları ve LSTM: Büyük veri setlerinde gradient boosting ile rekabet edebilir. Müşterinin zaman içindeki davranış serisini (oturum geçmişi, çağrı kayıtları) modellemek için LSTM ve Transformer tabanlı mimariler giderek yaygınlaşmaktadır.
Sınıf Dengesizliği Stratejileri: Gerçek dünya veri setlerinde pozitif örnekler %5–20 oranında kalır. SMOTE, class_weight parametreleri veya threshold ayarlaması bu dengesizliği gidermek için kullanılan başlıca yöntemlerdir.
Feature Engineering (Özellik Mühendisliği)
Bir churn modelinin kalitesi büyük ölçüde kullanılan özelliklerle belirlenir.
RFM Analizi: - Recency (Güncellik): Müşterinin en son etkileşiminin üzerinden kaç gün geçti? - Frequency (Sıklık): Belirli dönemde kaç kez satın alma ya da oturum gerçekleştirdi? - Monetary (Parasal Değer): Toplam ya da ortalama harcama ne kadar?
Davranışsal Özellikler: Oturum uzunluğu trendleri (son 30 gün vs önceki 30 gün), destek talebi sayısı, ürün/özellik kullanım derinliği, fiyat değişikliğine verilen tepki ve uygulama açma sıklığı.
Demografik ve Sözleşme Özellikleri: Tenure (müşteri yaşı) uzun müşterilerde daha düşük churn riski işaret eder. Aylık abonelikler yıllıklara göre daha yüksek risk taşır; otomatik ödeme churnu azaltır.
Zaman Penceresi Mühendisliği: Geçen 7, 30 ve 90 günlük kayan pencere metrikleri, müşteri davranışındaki hız ve yön değişimlerini yakalayarak anlık puan yerine değişim hızını modele yansıtır.
Değerlendirme Metrikleri
Churn modellerinde yalnızca doğruluk (accuracy) metriğine güvenmek yanıltıcıdır. Sınıf dengesizliği nedeniyle her örneği 'churn değil' diye tahmin eden model yüksek accuracy elde eder; ancak hiçbir iş değeri üretmez.
AUC-ROC: True Positive Rate ile False Positive Rate arasındaki dengeyi farklı karar eşiklerinde gösterir. Churn modellerinde AUC > 0,80 başarılı, > 0,85 üstün kabul edilir. Eşikten bağımsız olduğu için karşılaştırmalı model seçiminde tercih edilir.
Precision-Recall Eğrisi: Sınıf dengesizliğinin yüksek olduğu durumlarda ROC eğrisinden daha gerçekçi bir tablo sunar. Kesinlik (precision) 'churn dediğimizin ne kadarı gerçekten churna uğradı?'; duyarlılık (recall) 'gerçek churn'lerin ne kadarını yakaladık?' sorularını yanıtlar.
Confusion Matrix ve Eşik Optimizasyonu: Dört hücre (TP, FP, TN, FN) iş maliyetleriyle ilişkilendirildiğinde maliyet-duyarlı karar eşiği seçilebilir.
İş Metrikleri: Müdahale oranı, kampanya dönüşüm oranı, kaçırılan churna bağlı gelir kaybı ve model lift eğrisi (rastgele seçime kıyasla verimlilik) izlenmesi gereken başlıca göstergelerdir.
Gerçek Dünya Uygulamaları
Telekomünikasyon: En olgun churn prediction ekosistemlerinden birine sahiptir. Kullanılan özellikler: çağrı kalitesi şikayetleri, veri kullanım trendleri, rakip tekliflerle temas ve sözleşme yenileme tarihleri. Büyük operatörler modelleri gerçek zamanlı skorlamaya entegre ederek müşteri hizmetleri temsilcilerine risk uyarısı gönderir.
Bankacılık: Bireysel bankacılıkta aktif hesaptan pasife geçiş, kredi kartı kullanım düşüşü ve şubeye giriş sıklığının azalması churn öncülü olarak izlenir. Düzenleyici gereksinimler yorumlanabilirlik zorunluluğu getirdiğinden lojistik regresyon ve kural tabanlı yaklaşımlar sıklıkla tercih edilir.
SaaS Platformları: Ürün kullanım verisi ana sinyal kaynağıdır. 'Core özelliği hiç kullanmayan müşteri' ve 'login sıklığı son 14 günde sıfıra düşen hesap' yüksek riskli segment olarak tanımlanır. Health Score sistemleri churn olasılığını 0–100 skoru üzerinde görselleştirir.
E-Ticaret: 'Pasif müşteri' tanımı (90 gündür satın alma yapmayan kullanıcı) kullanılır. Sepet terk oranı, e-posta tıklama trendleri ve indirim kampanyalarına verilen tepki model özelliklerine dahil edilir.