Data Profiling (Veri Profilleme)
Bir veri kümesinin yapısını, kalitesini ve içeriğini sistematik biçimde analiz ederek eksiklik, tutarsızlık ve anomalileri tespit eden süreç.
Veri profilleme (data profiling), bir veri kümesinin yapısını, içeriğini, kalitesini ve ilişkilerini kapsamlı biçimde inceleme sürecidir. Bu süreçte her sütunun veri tipi, benzersiz değer sayısı, boş (null) değer oranı, minimum/maksimum değerleri, dağılımı ve desenleri otomatik olarak analiz edilir. Makine öğrenimi ve veri bilimi projelerinde model eğitimine başlamadan önce veri profilleme zorunlu bir adımdır; çünkü kalitesiz verilerle eğitilen modeller gerçek dünya koşullarında güvenilmez sonuçlar üretir. Veri profilleme üç temel boyutta gerçekleştirilir: Yapı profilleme, veri şemasını, alan adlarını ve tipleri doğrular; İçerik profilleme, değerlerin geçerlilik ve eksiksizlik açısından denetimini yapar; İlişki profilleme ise tablolar arası yabancı anahtar uyumlarını ve bağımlılıkları keşfeder. Modern veri profilleme araçları (Apache Griffin, Great Expectations, Deequ, Atlan) istatistiksel özetlerin yanı sıra kural tabanlı kalite kontrolleri de sunar. Yapay zeka destekli profilleme araçları ise geçmiş verileri kullanarak anormallik eşikleri belirler ve veri kayması (data drift) ile konsept kaymasını (concept drift) otomatik olarak algılar. MLOps bağlamında veri profilleme, eğitim-çıkarım dağılımı uyumsuzluklarını (training-serving skew) erkenden yakalamak için sürekli izleme bileşeni olarak entegre edilir. Her yeni veri partisi profillenip referans dağılımıyla karşılaştırıldığında, model performansını olumsuz etkileyecek kayma olayları tespit edilmeden önce önlem alınabilir.