Concept Drift (Kavram Kayması)

Zamanla değişen veri dağılımı nedeniyle ML modelinin doğruluğunu yitirmesi olgusu.

Kavram kayması (concept drift), makine öğrenmesi modellerinin eğitiminde kullanılan verinin istatistiksel dağılımının zamanla değişmesi ve bunun sonucunda modelin performansının düşmesi olgusudur. Model yayına alındıktan sonra gerçek dünya verisi sürekli evrilirken model, eğitimde öğrendiği eski kalıpları uygulamaya devam eder; bu uyumsuzluk tahmin hatalarının artmasına yol açar. Kavram kayması dört temel türde gözlemlenir: ani kayma (abrupt drift), ekonomik kriz veya yasal değişiklik gibi anlık olaylarda dağılımın topluca değişmesidir; kademeli kayma (gradual drift), uzun sürede yavaş yavaş meydana gelir; tekrarlayan kayma (recurring drift), mevsimsellik gibi periyodik değişimler içerir; kör nokta kayması (blind spot drift) ise eğitim verisinde hiç görünmemiş yeni veri türlerinin üretimde ortaya çıkmasıdır. Gerçek dünya senaryolarında bu türler iç içe geçebilir; bir e-ticaret platformu hem mevsimsel (recurring) hem de uzun dönemli tüketici tercihi değişimlerine (gradual) maruz kalabilir. Drift tespitinde istatistiksel testler (Kolmogorov-Smirnov, Chi-square), özellik dağılımı izleme (Population Stability Index — PSI), referans pencere ile kayan pencere karşılaştırma ve model performans metriklerinin takibi (doğruluk, AUC, RMSE) en yaygın yöntemlerdir. Evidently AI, River, NannyML ve Alibi-Detect bu analizler için açık kaynaklı araçlar sunar. Yanıt stratejileri arasında periyodik yeniden eğitim (scheduled retraining), drift algılandığında tetiklenen otomatik güncelleme (triggered retraining), her yeni örnekle güncellenen online öğrenme ve farklı döneme ait modelleri birleştiren ensemble yaklaşımları öne çıkar. MLOps altyapısı bu stratejileri drift → uyarı → yeniden eğitim döngüsüyle otomatik biçimde işletir. Kredi riski değerlendirmesinden öneri sistemlerine, doğal dil işlemeden görüntü tanımaya kadar üretimdeki tüm ML modelleri kavram kaymasına karşı savunmasızdır. Pandemi döneminde tüketici harcama kalıpları dramatik biçimde değişmiş, bu durum perakende öneri sistemlerinde ani doğruluk düşüşlerine yol açmıştır. Model izleme ve zamanında yeniden eğitim, güvenilir yapay zeka sistemlerinin temel bileşenleridir.

Neden Oluşur?

Gerçek dünya verisinin dağılımı zamanla değişir. Müşteri davranışı mevsimden mevsime farklılaşır; sağlık verisi yeni hastalık veya tedavi yöntemlerinin ortaya çıkmasıyla evrilir; ekonomik krizler finansal modelleme verilerini kökten değiştirir. Model eğitildiğinde bu değişimleri bilemez. Yayın sürecinde dünyayla uyumunu kaybeden model, eski kalıplarla yeni verileri yorumlamaya çalışarak yanlış kararlar üretir. Belirgin bir hata artışı çoğu zaman gecikmiş bir uyarıdır; bu yüzden erken izleme kritik önem taşır.

Drift Türleri

  • check_circle Ani Kayma (Abrupt Drift): Yasal düzenleme, ekonomik kriz veya salgın gibi anlık bir olay tüm dağılımı bir anda değiştirir. Model bu ani geçişe hazırlıksız yakalanır ve doğruluk hızla düşer.
  • check_circle Kademeli Kayma (Gradual Drift): Değişim uzun süreye yayılır; tüketici tercihlerinin yıllar içinde evrilmesi gibi. Tespit için sabırlı bir izleme penceresi ve istatistiksel testler gerektirir.
  • check_circle Tekrarlayan Kayma (Recurring Drift): Mevsimsellik, hafta içi/sonu kalıpları gibi periyodik değişimlerdir. Zaman boyutunu dikkate alan modeller ve ensemble stratejileri bu türe karşı koruma sunar.
  • check_circle Kör Nokta Kayması (Blind Spot Drift): Eğitim kümesinde hiç görünmemiş yeni veri türleri üretimde ortaya çıkar. Sıfır örnekli bu durumlar, modelin en savunmasız olduğu senaryodur.

Tespit Yöntemleri

PSI (Population Stability Index) eğitim ve üretim dönemindeki özellik dağılımlarını karşılaştırır; 0.2 üzeri ciddi drift sinyali verir. Kolmogorov-Smirnov testi, iki dağılımın aynı kaynaktan gelip gelmediğini istatistiksel olarak sorgular. Kayan pencere (sliding window) yaklaşımında son N gözlem referans pencereyle kıyaslanır. Model metriklerini izlemek ise en pratik yoldur: AUC veya doğruluk belirgin düşüş gösteriyorsa drift kaynağı araştırılır. Evidently AI, NannyML ve River bu analizler için açık kaynaklı araçlar sunar.

Yanıt Stratejileri

  • check_circle Scheduled Retraining: Belirlenen periyotlarda (haftalık, aylık) model yeni veriyle yeniden eğitilir. Düşük değişkenlikli ortamlarda maliyet-etkin bir çözümdür.
  • check_circle Triggered Retraining: PSI eşiği veya AUC düşüşü gibi drift sinyali alındığında otomatik eğitim süreci başlatılır. Dinamik ortamlar için tercih edilen yaklaşımdır.
  • check_circle Online Learning: Model her yeni örnekle adım adım güncellenir; bellek kısıtlı ortamlarda veya hızlı değişen dağılımlarda verimli bir seçenektir.
  • check_circle Weighted Resampling: Yeni gözlemlere daha yüksek ağırlık verilerek modelin güncel veriye odaklanması sağlanır. Geçmişi tamamen atmak yerine yavaşça azaltır.

MLOps ile Otomasyon

Üretim ortamındaki modeli izlemek manuel süreçten otomatik pipeline'a dönüşmektedir. Evidently AI, HTML raporlar ve Grafana/Prometheus entegrasyonu ile drift metriklerini görselleştirir. MLflow model versiyonlama ve geri alma kapasitesi sunar. Apache Airflow veya Prefect ile scheduled retraining pipeline kurulur. Bu altyapı; drift → uyarı → model güncelleme → yeniden yayın döngüsünü otomatik işletir ve mühendis müdahalesini minimuma indirir.

Sık Sorulan Sorular

  • check_circle Kavram kayması ile veri kayması arasındaki fark nedir?: Veri kayması (data drift) özellik dağılımının değişmesidir. Kavram kayması ise hedef değişken ile özellikler arasındaki ilişkinin değişmesidir; daha derin bir sorun olmakla birlikte tespiti de daha güçtür.
  • check_circle Ne sıklıkla model yeniden eğitilmeli?: İş alanı, drift hızı ve maliyete göre belirlenir. Haber öneri sistemleri günlük; kredi riski modeli aylık yeniden eğitim uygulayabilir.
  • check_circle Online öğrenme her zaman iyi bir çözüm müdür?: Hayır; kirli veya manipüle edilmiş veriye karşı hassastır. Güvenlik ve denetim gereksinimlerine göre dikkatli tasarlanmalıdır.
  • check_circle PSI değeri ne anlama gelir?: PSI < 0.1 düşük drift; 0.1–0.2 orta düzey; PSI > 0.2 yüksek drift anlamına gelir. Yüksek değer retraining tetiklemek için eşik olarak kullanılır.
  • check_circle Concept drift ile model çürümesi aynı şey mi?: Model çürümesi (model decay) daha geniş bir kavramdır; veri kayması, kavram kayması ve sistem değişikliklerini kapsar. Kavram kayması bunun bir alt türüdür.