Causal Discovery (Nedensel Keşif)

Gözlemsel veriden değişkenler arasındaki nedensel yapıyı ve yönlü bağımlılıkları otomatik olarak çıkaran yöntemlerin bütünüdür.

Nedensel keşif, yalnızca gözlemsel veriye bakarak değişkenler arasındaki nedensel ilişkilerin yapısını ortaya çıkarmaya çalışan bir makine öğrenmesi ve istatistik alanıdır. Temel çıktı genellikle yönlü döngüsüz bir çizge (DAG) biçimindedir; bu çizgede düğümler değişkenleri, oklar ise nedensel yönü temsil eder. Alanın köklü algoritmaları arasında PC algoritması (Peter-Clark) yer alır: koşullu bağımsızlık testleri yaparak önce bir iskelet çizgesi kurar, ardından v-yapılarını yönlendirerek Markov denklik sınıfını temsil eden bir kısmi yönlü döngüsüz çizgeye (CPDAG) ulaşır. FCI (Fast Causal Inference) algoritması ise gizli ortak nedenler bulunduğunda PC'nin yetersiz kaldığı durumlarda kullanılır ve gizli karıştırıcıları modelleyebilen PAG (Partial Ancestral Graph) yapılarını üretir. LiNGAM (Linear Non-Gaussian Acyclic Model), değişkenler arasındaki ilişkilerin doğrusal ve gürültünün Gauss dışı olduğunu varsayarak tek bir DAG'ı tanımlayabilir; bu varsayım, Gauss durumundaki tanımlanamama sorununu çözer. GES (Greedy Equivalence Search) denklik sınıfları üzerinde aç gözlü bir arama yürüterek skoru en çoklaştıran yapıyı bulur. 2019'da önerilen NOTEARS ise DAG'ı öğrenmeyi sürekli optimizasyon problemine dönüştürerek gradyan tabanlı yöntemlerle çözüme olanak tanır ve büyük ölçekli veri kümelerinde avantaj sunar. Nedensel keşif, nedensel çıkarımdan (causal inference) farklı bir problemi çözer: nedensel çıkarım yapı bilindiğinde belirli bir müdahalenin etkisini tahmin ederken, nedensel keşif o yapının kendisini veriden öğrenmeye çalışır. İkisi çoğu zaman birlikte kullanılır: önce keşif, sonra çıkarım. Uygulama alanları oldukça geniştir. Genomide gen düzenleyici ağları aydınlatmak, epidemiyolojide hastalık risk faktörlerini ayırt etmek, ekonomide politika etkilerini modellemek ve yapay zeka adalet çalışmalarında karar sistemlerindeki önyargı kaynaklarını tespit etmek bu alanların başında gelir. Alanın temel güçlükleri şunlardır: Markov denklik sınıfı problemi, yani birden fazla DAG'ın aynı gözlemsel dağılımı üretebilmesi; ölçülmemiş karıştırıcıların (confounders) varlığı; ve yeterli örneklem olmadığında koşullu bağımsızlık testlerinin güvenilirliğinin düşmesi. Tanımlanabilirlik (identifiability) kısıtlamaları hangi koşullar altında gerçek nedensel grafın kurtarılabileceğini belirler ve bu kısıtlamalar her durumda sağlanamaz.

Nedensel Keşif Nedir?

Nedensel keşif, gözlemsel veri kümesinden değişkenler arasındaki nedensel yapıyı — yani hangi değişkenin hangisini etkilediğini — otomatik olarak öğrenmeye çalışır. Klasik istatistik korelasyonları ölçerken nedensel keşif, bu korelasyonların arkasındaki ok yönlerini bulmayı hedefler. Çıktı tipik olarak bir Yönlü Döngüsüz Grafik (DAG) ya da bu grafiklerin Markov denklik sınıfını temsil eden bir CPDAG'dır.

Temel Algoritmalar

  • check_circle PC Algoritması: Koşullu bağımsızlık testlerine dayanan kısıtlama tabanlı yöntem; CPDAG üretir.
  • check_circle FCI (Fast Causal Inference): Gizli ortak nedenler ve seçim yanlılığı altında çalışır; PAG yapılarını üretir.
  • check_circle LiNGAM: Doğrusal ilişkiler ve Gauss dışı gürültü varsayımıyla tek bir DAG'ı tam tanımlar.
  • check_circle GES (Greedy Equivalence Search): Skor tabanlı; denklik sınıfları üzerinde açgözlü arama yaparak BIC/BDe skorunu en çoklaştırır.
  • check_circle NOTEARS (2019): DAG kısıtını türevlenebilir bir fonksiyona çevirerek gradyan optimizasyonuyla büyük ölçekli keşfe olanak tanır.

Nedensel Keşif ile Nedensel Çıkarım Farkı

Nedensel çıkarım (causal inference), nedensel yapının bilindiğini varsayar ve belirli bir müdahalenin — örneğin bir ilacın verilmesinin — etkisini tahmin eder. Nedensel keşif ise bu yapıyı veriden sıfırdan öğrenmeye çalışır. Pratikte iki adım birbirini tamamlar: önce keşif algoritmasıyla bir DAG tahmini yapılır, ardından bu yapı üzerinde çıkarım modelleri kurulur.

Uygulama Alanları

  • check_circle Genomik ve Biyoinformatik: Gen düzenleyici ağları ve protein etkileşim yollarının haritasını çıkarmak.
  • check_circle Epidemiyoloji: Hastalık risk faktörlerini korelasyondan ayırt ederek gerçek nedensel etkileri tahmin etmek.
  • check_circle Ekonomi ve Politika: Gözlemsel veriden politika müdahalelerinin etkisini modellemek.
  • check_circle Yapay Zeka Adaleti: Karar sistemlerindeki önyargı kaynaklarını nedensel yapı üzerinden tespit etmek.

Zorluklar ve Kısıtlamalar

Markov denklik sınıfı problemi, birden fazla farklı DAG'ın aynı gözlemsel dağılımı üretmesine yol açar ve doğru grafiği belirsiz kılar. Ölçülmemiş karıştırıcılar (confounders) PC gibi algoritmalar için ciddi bir sorun oluştururken FCI bunları kısmen ele alır. Örneklem büyüklüğü arttıkça koşullu bağımsızlık testlerinin gücü yükselir; ancak yüksek boyutlu verilerde hesaplama maliyeti hızla artar. Tanımlanabilirlik kısıtları her veri yapısında gerçek nedensel grafiğin kurtarılmasını güvence altına almaz.

Sık Sorulan Sorular

  • check_circle Nedensel keşif korelasyon analizinden nasıl farklıdır?: Korelasyon sadece iki değişkenin birlikte değişip değişmediğini söyler; nedensel keşif hangisinin diğerine neden olduğunu belirlemeye çalışır ve ok yönünü tahmin eder.
  • check_circle Sadece gözlemsel veriyle nedensellik keşfedilebilir mi?: Evet, ancak sınırlamalarla. Gözlemsel veriden tam bir DAG yerine çoğu zaman bir denklik sınıfı (CPDAG) elde edilir. LiNGAM gibi parametrik varsayımlar veya müdahale verileri eklenmesi daha kesin sonuç verir.
  • check_circle PC ve GES algoritmalarından hangisi tercih edilmeli?: PC koşullu bağımsızlık testlerinin yorumlanabilirliğini ön plana alır; az sayıda değişken ve güvenilir bağımsızlık testleri varsa uygundur. GES skora dayalı olduğundan gürültülü verilerde daha kararlı olabilir.
  • check_circle Nedensel keşif LLM sistemlerinde kullanılıyor mu?: LLM'ler doğrudan nedensel keşif algoritmaları çalıştırmaz; ancak nedensel keşif sonuçları, LLM destekli sistemlerin açıklanabilirliğini artırmak amacıyla XAI katmanlarında kullanılmaktadır.
  • check_circle Python'da hangi kütüphaneler mevcuttur?: causal-learn (pywhy), gCastle, lingam ve DoWhy kütüphaneleri PC, GES, LiNGAM ve NOTEARS algoritmalarını içerir. DoWhy hem keşif hem de çıkarım adımlarını destekler.