Keşifsel Veri Analizi, makine öğrenimi modellemesinden önce verinin yapısını, dağılımını ve ilişkilerini istatistiksel ve görsel yöntemlerle keşfeden sistematik yaklaşımdır.

Keşifsel Veri Analizi (Exploratory Data Analysis, EDA), ham veriden anlam çıkarmanın ilk ve en kritik adımıdır. John Tukey'in 1977'de kaleme aldığı aynı adlı eseriyle sistematik bir disiplin hâline gelen EDA, veri bilimcilerin bir veri kümesini modellemeden veya hipotez testine sokmadan önce derinlemesine incelediği keşifsel süreçtir. EDA'nın temel amacı şu soruları yanıtlamaktır: Veri nasıl dağılmış? Hangi değişkenler birbiriyle ilişkili? Aykırı değerler (outlier) var mı ve bunlar gerçek mi yoksa veri giriş hatası mı? Eksik değerler (missing values) hangi örüntüde oluşmuş? Hangi özellikler hedef değişkeni en çok etkiliyor? Bu soruları yanıtlamak için EDA iki temel yöntem sınıfına başvurur. Nicel yöntemler arasında merkezi eğilim ölçüleri (ortalama, medyan, mod), yayılım ölçüleri (standart sapma, varyans, çeyrekler arası aralık), çarpıklık ve basıklık katsayıları yer alır. Nitel/görsel yöntemler ise histogram, kutu grafiği (box plot), yoğunluk grafiği, dağılım matrisi (pair plot) ve korelasyon ısı haritası gibi araçlarla veriyi sezgisel biçimde anlaşılır kılar. Modern veri bilimi ekosisteminde EDA, Python'da Pandas, NumPy, Matplotlib, Seaborn ve Plotly kütüphaneleriyle; R'de ggplot2 ve dplyr ile yürütülür. Pandas Profiling ve ydata-profiling gibi otomatik EDA araçları tek bir komutla kapsamlı raporlar üretir. AutoEDA yaklaşımları büyük veri kümelerinde zaman tasarrufu sağlasa da deneyimli bir veri bilimcinin yorumunun yerini alamaz. EDA sürecinde izlenen tipik adımlar şöyle sıralanabilir: önce veri yapısı incelenir (shape, dtypes, head); ardından betimleyici istatistikler hesaplanır (describe); eksik değer örüntüleri ve oranları belirlenir; tek değişkenli dağılımlar görselleştirilir; iki değişkenli ilişkiler scatter plot ve korelasyon matrisiyle keşfedilir; son olarak çok değişkenli örüntüler ve gruplararası farklılıklar araştırılır. Bu adımlar doğrusal değil yinelemeli bir döngü oluşturur; her bulgu yeni sorular doğurur. EDA, özellik mühendisliği (feature engineering), veri temizleme ve model seçimi kararları üzerinde doğrudan etkilidir. Kötü anlaşılmış veriyle kurulan modeller ne kadar sofistike olursa olsun güvenilmez sonuçlar üretir; bu nedenle EDA 'çöp girer, çöp çıkar' ilkesinin pratikte uygulandığı kalkan katmanıdır. Regresyon, sınıflandırma veya kümeleme modellerinden önce mutlaka gerçekleştirilmesi gereken bu aşama, hem modelin doğruluğunu hem de yorumlanabilirliğini doğrudan şekillendirir.

EDA Nedir ve Neden Önemlidir?

Keşifsel Veri Analizi (EDA), ham veri kümesini makine öğrenimi modeline ya da istatistiksel testlere sokmadan önce derinlemesine anlamak amacıyla uygulanan sistematik inceleme sürecidir. John Tukey, 1977'de kaleme aldığı 'Exploratory Data Analysis' adlı eserinde bu yaklaşımı 'veri dedektifliği' olarak tanımlamıştır: önce veride ne olduğunu bulmak, sonra ne olması gerektiğini analiz etmek.

EDA olmadan geliştirilen modeller ciddi risklere açıktır. Aykırı değerler lineer regresyonun eğim katsayısını bozar; gizli korelasyonlar çoklu doğrusallık (multicollinearity) sorununa yol açar; dengesiz sınıf dağılımları sınıflandırma modellerini önyargılı hâle getirir. EDA tüm bu tuzakları önceden görünür kılar ve veri bilimcinin bilinçli kararlar almasını sağlar.

EDA'nın Temel Yöntemleri

  • check_circle Tek Değişken Analizi (Univariate): Her değişkeni bağımsız olarak inceler. Histogram, kutu grafiği ve çan eğrisi aracılığıyla dağılım şekli, merkezi eğilim ve aykırı değerler ortaya konur.
  • check_circle İki Değişken Analizi (Bivariate): İki değişken arasındaki ilişkiyi ölçer. Scatter plot, korelasyon katsayısı (Pearson, Spearman) ve çapraz tablolar bu aşamada kullanılır.
  • check_circle Çok Değişken Analizi (Multivariate): Birden fazla değişkenin eş zamanlı örüntülerini araştırır. Isı haritası, pair plot ve boyut indirgeme teknikleri (PCA, t-SNE) bu kategoride yer alır.
  • check_circle Eksik Değer Analizi: Veri kümesindeki boş alanların sayısı, oranı ve örüntüsü incelenir. MCAR, MAR veya MNAR sınıflandırması yapılarak uygun imputation stratejisi belirlenir.

Popüler EDA Araçları ve Kütüphaneler

  • check_circle Pandas + Matplotlib/Seaborn: Python ekosisteminin temel EDA bileşimi. df.describe(), df.info() ve sns.heatmap() ile hızlı ilk keşif yapılır.
  • check_circle ydata-profiling: Tek satır kodla kapsamlı HTML raporu üretir; dağılımlar, korelasyonlar, eksik değerler ve uyarılar otomatik hesaplanır.
  • check_circle Plotly / Dash: Etkileşimli görselleştirme için tercih edilir. Zoom, filtre ve hover gibi özellikler büyük veri setlerinde keşfi kolaylaştırır.
  • check_circle R: ggplot2 + dplyr: Akademik ve istatistiksel EDA için güçlü bir ekosistem. Katmanlı grafik dilbilgisi (grammar of graphics) ile esnek görselleştirme mümkündür.

EDA Adımları: Yapılandırılmış Bir Akış

Tipik bir EDA süreci şu adımları izler: (1) Veri yükleme ve yapı incelemesi — shape, dtypes, head/tail ile genel yapı anlaşılır. (2) Betimleyici istatistikler — ortalama, medyan, standart sapma, min/max ve çeyrekler hesaplanır. (3) Eksik değer tespiti — her sütundaki boşluk oranı ve örüntüsü belirlenir. (4) Dağılım analizi — histogramlar ve kutu grafikleriyle çarpıklık ve aykırı değerler saptanır. (5) İlişki analizi — korelasyon matrisi ve scatter plot'larla değişkenler arası bağıntılar keşfedilir. (6) Alt grup analizi — kategorik değişkenlere göre gruplandırılmış istatistikler karşılaştırılır. Bu adımlar yinelemeli bir döngü oluşturur; her bulgu yeni araştırma sorularına kapı açar.

EDA Araç Ekosistemi

pandas-profiling / ydata-profiling

Tek satırda kapsamlı veri profili; dağılım, eksik değer, korelasyon ve uyarı raporunu otomatik HTML olarak oluşturur.

Sweetviz

Eğitim/test karşılaştırması odaklı EDA kütüphanesi; hedef değişkene göre öznitelik dağılımlarını yanyana görselleştirerek veri sızıntısı tespitine yardımcı olur.

Matplotlib / Seaborn

Temel görselleştirme katmanı; pair plot, heatmap ve distribution plots EDA'nın temel araçları — özelleştirme esnekliği en yüksek.

Great Expectations

Veri kalitesi testi ve doğrulama çerçevesi; EDA sonrası veri sözleşmelerini tanımlayarak pipeline boyunca beklentileri otomatik kontrol eder.

Sıkça Sorulan Sorular

  • check_circle EDA ne kadar zaman alır? Veri kümesinin boyutuna ve karmaşıklığına bağlı olarak saatlerden haftalara kadar uzayabilir. Küçük veri setleri için birkaç saat yeterliyken büyük ve yapılandırılmamış verilerde EDA haftalar sürebilir.
  • check_circle EDA ile hipotez testi arasındaki fark nedir? EDA keşifseldir; önceden hipotez olmadan verideki örüntüleri ortaya çıkarır. Hipotez testi ise belirli bir iddianın istatistiksel kanıtını arar. EDA çoğunlukla hipotez testinden önce gelir.
  • check_circle Otomatik EDA araçları yeterli midir? Ön inceleme için çok işlevseldir ancak alan bilgisi gerektiren yorumların, özellik mühendisliği kararlarının ve bağlamsal yorumların yerini tutamaz. İnsan gözü hâlâ vazgeçilmezdir.
  • check_circle EDA hangi veri türleriyle çalışır? Tablo verisi, zaman serisi, metin, görüntü ve grafik verisi gibi her türde uygulanabilir; ancak yöntemler veri türüne göre farklılaşır. Metin verisi için TF-IDF dağılımları ve kelime bulutu; zaman serisi için otokorelasyon grafikleri kullanılır.