tag Veri Kalitesi
Bu sayfada Veri Kalitesi etiketi ile işaretlenmiş 6 yapay zeka kavramını bulabilirsiniz.
Veri kalitesi (Data Quality), bir veri kümesinin belirli bir kullanım amacı için ne derece uygun olduğunu ifade eden çok boyutlu bir kavramdır. Yapay zeka, makine öğrenimi ve veri madenciliği projelerinde, veri kalitesi modelin ne kadar doğru ve güvenilir sonuç üreteceğini belirleyen temel etkendir. Veri kalitesi altı standart boyutla ölçülür. Doğruluk (accuracy), veri değerlerinin gerçek dünyadaki durumu yansıtıp yansıtmadığını ölçer. Tamlık (completeness), gerekli alanların eksiksiz biçimde dolu olup olmadığını denetler. Tutarlılık (consistency), aynı verinin farklı sistemler veya tablolar arasında çelişip çelişmediğini kontrol eder. Zamansallık (timeliness), verinin analiz amacına yetecek kadar güncel olup olmadığını sorgular. Geçerlilik (validity), verilerin tanımlanmış iş kurallarına ve formatlara uygunluğunu belirler. Benzersizlik (uniqueness) ise yinelenen kayıtları tespit eder. Sektörde yerleşik olan 'Çöp içeri, çöp dışarı' (Garbage In, Garbage Out) ilkesi, veri kalitesinin modeller üzerindeki doğrudan etkisini özetler. Hatalı veya eksik verilerle eğitilen bir yapay zeka modeli, gerçek dünya koşullarında güvenilmez tahminler üretir. Araştırmalar, veri bilimcilerinin zamanının yüzde altmış ila seksenini veri temizleme ve kalite iyileştirmeye ayırdığını ortaya koymaktadır. Veri kalitesini ölçmek ve artırmak için kullanılan başlıca araçlar arasında Great Expectations, dbt testleri, Apache Soda ve Pandas Profiling yer almaktadır. Bu araçlar veri boru hatlarına (pipeline) entegre edilerek kalite sorunlarını anlık raporlar ve anomalileri uyarı sistemlerine bildirir. Üretim ortamlarında sürekli veri kalitesi izleme (data quality monitoring), sapmalar gerçekleşir gerçekleşmez mühendis ekipleri uyarır. Regülasyon boyutunda AB Yapay Zeka Yasası (AI Act) Madde 10, yüksek riskli yapay zeka sistemlerinde veri yönetim uygulamalarını ve kalite metriklerini belgelemeyi yasal yükümlülük haline getirmiştir. ISO/IEC 25012 standardı da veri kalitesi özelliklerini sistematik biçimde tanımlar. Bu nedenle veri kalitesi artık yalnızca teknik bir uygulama değil, kurumsal yönetişim ve uyum çerçevelerinin ayrılmaz bir parçasıdır.
Data Leakage (Veri Sızıntısı (Data Leakage))
Veri sızıntısı (data leakage), makine öğrenimi modelinin eğitim sürecine gerçek dünya tahmin anında bulunmaması ya da bilinmemesi gereken bilgilerin karışması ve bu durumun modelin performans değerlendirmesini yanıltmasıdır. Ortaya çıkan en belirgin belirti, geliştirme aşamasında olağandışı yüksek doğruluk, F1 veya AUC değerleri elde edilmesidir; ancak model üretime geçtiğinde bu başarım bir anda çöker çünkü o "sızan" bilgi artık mevcut değildir. Veri sızıntısının iki ana türü vardır. Birinci tür olan hedef sızıntısı (target leakage), eğitim setindeki bir özelliğin tahmin edilmek istenen sonuçla zamansal ya da korelasyonel bağ üzerinden kirlendiği durumu tanımlar. Klasik örnek: sigorta hasar tahmin modelinde "hasar sonrası müşteri iletişim kaydı" özelliğinin kullanılması. Bu değişken modelin sonucu önceden "bilmesine" yol açar; üretimde tahmin anında henüz o kayıt oluşmadığından model başarısız olur. İkinci tür olan eğitim-test kirliği ise ön işleme adımlarının test verisine sıçramasından kaynaklanır. StandardScaler veya MinMaxScaler'ı tüm veri seti üzerinde fit edip ardından bölümleme yapmak bu hatanın en yaygın biçimidir: test setinden gelen istatistikler normalleştirmede kullanıldığından test seti gerçek anlamda görülmemiş olmaktan çıkar. Zaman serisi verileri özellikle yüksek risk taşır. Rastgele train/test bölümlemesi bu tür verilerde her zaman yanlıştır: gelecekteki gözlemler eğitim setine girebilir ve model aslında geleceği görerek geçmişi tahmin eder. Doğru yöntem TimeSeriesSplit veya walk-forward validation kullanmaktır. Tespitte en etkili yöntem, Scikit-learn Pipeline nesneleridir: her çapraz doğrulama kıvrımında ön işleme adımlarını yalnızca o kıvrımın eğitim verisine uyguladığından test kirliğini yapısal olarak engeller. Özellik önem sıralamalarında şaşırtıcı derecede yüksek katkı gösteren değişkenler hedef sızıntısı açısından mutlaka sorgulanmalıdır. Üretim ile geliştirme ortamı arasındaki ani performans düşüşü her zaman veri sızıntısının güçlü bir göstergesidir.
Data Contract (Veri Sözleşmesi)
Data contract (veri sözleşmesi), bir veri üreticisi ile veri tüketicileri arasında kurulan, şema, kalite kuralları ve teslimat yükümlülüklerini resmileştiren makine tarafından uygulanabilir anlaşmadır. Terim, 2022 yılında Chad Sanderson tarafından data mesh mimarisinin yaygınlaşmasıyla birlikte popüler hale gelmiştir. Geleneksel veri boru hatlarında üretici ekipler şema değişikliklerini bildirmeden güncelleme yapabilir; bu durum aşağı akış ML modellerini, raporları ve analitik iş yüklerini bozar. Data contract bu kırılganlığı ortadan kaldırır: üretici, belirli bir şema versiyonunu, null toleransını, veri tazeliğini ve iş tanımlarını resmî bir belge olarak yayımlar; tüketici ise bu koşulları CI/CD sürecinde otomatik olarak doğrular. Bir data contract genellikle şu unsurları kapsar: sütun adları ve veri türleri, zorunluluk ve benzersizlik kısıtlamaları, tazelik SLA'sı (ör. "her 6 saatte bir güncellenir"), anlam bağlamı (sütun iş tanımları) ve sürüm uyumluluk politikası. dbt 1.5+ ile gelen contract bloğu bu denetimi proje düzeyine taşır; Soda Core ve Great Expectations ise çalışma zamanında ihlalleri yakalayarak bozuk verinin ML modellerine ulaşmasını engeller. Araştırmalar, veri kalitesi olaylarının yüzde altmışından fazlasının üretici-tüketici iletişim kopukluğundan kaynaklandığını ortaya koymuştur. MLOps bağlamında data contract, feature store'a beslenen her kaynak tablonun kalite güvencesini kurar. Model eğitimi ve üretim çıkarımı arasındaki dağılım kaymasını (training-serving skew) önlemek için özellik alanlarının tip ve aralık kısıtlamaları sözleşmede açıkça tanımlanır. LLM boru hatlarında embedding modeline giden metin sütunlarının maksimum uzunluk ve karakter kodlaması gibi kısıtlamalar da sözleşme kapsamına alınabilir. Streaming mimarilerde Apache Kafka için Schema Registry, Avro veya Protobuf şemalarını sözleşme mekanizması olarak kullanır; gerçek zamanlı boru hatlarında şema evrimi güvenli biçimde yönetilir. Sürümleme açısından anlamsal sürümleme (MAJOR.MINOR.PATCH) yaklaşımı önerilir: kırıcı değişiklikler MAJOR sürümü yükseltir ve tüketici ekiplere geçiş süresi tanınır. Data mesh mimarisinde her veri ürünü kendi sözleşmesinden sorumlu olur; bu dağıtık sahiplik modeli büyük organizasyonlarda veri güvenilirliğini merkezi denetim olmaksızın ölçeklendirmeye olanak tanır.
Data Quality (Veri Kalitesi)
Veri kalitesi (Data Quality), bir veri kümesinin belirli bir kullanım amacı için ne derece uygun olduğunu ifade eden çok boyutlu bir kavramdır. Yapay zeka, makine öğrenimi ve veri madenciliği projelerinde, veri kalitesi modelin ne kadar doğru ve güvenilir sonuç üreteceğini belirleyen temel etkendir. Veri kalitesi altı standart boyutla ölçülür. Doğruluk (accuracy), veri değerlerinin gerçek dünyadaki durumu yansıtıp yansıtmadığını ölçer. Tamlık (completeness), gerekli alanların eksiksiz biçimde dolu olup olmadığını denetler. Tutarlılık (consistency), aynı verinin farklı sistemler veya tablolar arasında çelişip çelişmediğini kontrol eder. Zamansallık (timeliness), verinin analiz amacına yetecek kadar güncel olup olmadığını sorgular. Geçerlilik (validity), verilerin tanımlanmış iş kurallarına ve formatlara uygunluğunu belirler. Benzersizlik (uniqueness) ise yinelenen kayıtları tespit eder. Sektörde yerleşik olan 'Çöp içeri, çöp dışarı' (Garbage In, Garbage Out) ilkesi, veri kalitesinin modeller üzerindeki doğrudan etkisini özetler. Hatalı veya eksik verilerle eğitilen bir yapay zeka modeli, gerçek dünya koşullarında güvenilmez tahminler üretir. Araştırmalar, veri bilimcilerinin zamanının yüzde altmış ila seksenini veri temizleme ve kalite iyileştirmeye ayırdığını ortaya koymaktadır. Veri kalitesini ölçmek ve artırmak için kullanılan başlıca araçlar arasında Great Expectations, dbt testleri, Apache Soda ve Pandas Profiling yer almaktadır. Bu araçlar veri boru hatlarına (pipeline) entegre edilerek kalite sorunlarını anlık raporlar ve anomalileri uyarı sistemlerine bildirir. Üretim ortamlarında sürekli veri kalitesi izleme (data quality monitoring), sapmalar gerçekleşir gerçekleşmez mühendis ekipleri uyarır. Regülasyon boyutunda AB Yapay Zeka Yasası (AI Act) Madde 10, yüksek riskli yapay zeka sistemlerinde veri yönetim uygulamalarını ve kalite metriklerini belgelemeyi yasal yükümlülük haline getirmiştir. ISO/IEC 25012 standardı da veri kalitesi özelliklerini sistematik biçimde tanımlar. Bu nedenle veri kalitesi artık yalnızca teknik bir uygulama değil, kurumsal yönetişim ve uyum çerçevelerinin ayrılmaz bir parçasıdır.
Eğitim Verisi (Eğitim Verisi)
Eğitim verisi (training data), bir makine öğrenmesi modelinin öğrenme sürecinde kullandığı, girdi-çıktı çiftlerinden ya da ham örneklerden oluşan veri kümesidir. Model, bu veri üzerinden parametrelerini ayarlar ve gerçek dünya dağılımına ilişkin örüntüleri çıkarır. Bir modelin kalitesi büyük ölçüde eğitim verisinin kalitesine, miktarına ve çeşitliliğine bağlıdır; 'çöp girer, çöp çıkar' ilkesi makine öğrenmesinde her zaman geçerlidir. Eğitim verisi türleri birkaç eksen boyunca sınıflandırılır. Etiketli veri (labeled data), insan etiketleyicilerin her örneğe doğru çıktıyı atadığı; denetimli öğrenme görevlerinin temelidir. Etiketsiz veri (unlabeled data), ham metin, görüntü veya ses olup öz-denetimli öğrenme ile büyük ön-eğitim modellerinde (GPT, BERT vb.) kullanılır. Sentetik veri, gerçek veriyi taklit eden yapay örneklerdir; nadir senaryoları temsil etmek ve gizlilik kısıtlamalarını aşmak için idealdir. Yarı otomatik etiketleme ise mevcut model çıktıları veya kural tabanlı sistemlerle üretilen etiketlerle insan emeği maliyetini önemli ölçüde düşürür ve büyük ölçekli veri kümelerinin hızla hazırlanmasını mümkün kılar. Veri hazırlama aşamaları projenin başarısını doğrudan etkiler: temizleme (duplikat, aykırı değer ve hatalı etiket kaldırma), veri artırma (görüntüde kırpma/döndürme, metinde parafraz), eğitim/doğrulama/test bölümlemesi ve dengesiz sınıfların yeniden örneklenmesi (SMOTE, undersampling). Modern ML projelerinde mühendislik zamanının büyük bölümü bu veri mühendisliği adımlarına ayrılmaktadır. Veri önyargısı (data bias) kritik bir risktir: eğitim seti belirli grupları yeterince temsil etmiyorsa model bu eksikliği öğrenir ve gerçek dünya dağıtımında adaletsiz çıktılar üretir. Transfer öğrenme ve az örnekli öğrenme teknikleri gereken etiketli veri miktarını önemli ölçüde azaltır. Veri kalitesini izlemek için DVC ve MLflow gibi sürümleme araçları ile Label Studio ve Scale AI gibi etiketleme platformları yaygın biçimde kullanılmaktadır. Veri kalitesi, model performansının belirleyici bir bileşeni olmaya devam etmektedir.
Data Observability (Veri Gözlemlenebilirliği)
Veri gözlemlenebilirliği (data observability), bir kuruluşun veri boru hatlarındaki verilerin sağlığını, bütünlüğünü ve güvenilirliğini anlık ve sürekli olarak izleme, anlama ve değerlendirme kapasitesini tanımlar. Yazılım mühendisliğindeki gözlemlenebilirlik (observability) kavramından esinlenerek türetilmiş bu disiplin, sistemlerin iç durumunu yalnızca dışa yansıttığı sinyallerden anlama ilkesini veri dünyasına taşır. Monte Carlo Data'nın tanımladığı beş temel boyut şunlardır: tazelik (freshness — verinin güncel olup olmadığı), hacim (volume — beklenen miktarda verinin gelip gelmediği), dağılım (distribution — değer aralıklarının normal profilde kalıp kalmadığı), şema (schema — tablo ve sütun yapısının değişip değişmediği) ve köken (lineage — verinin kaynaktan varış noktasına dek izlenen akışı). Yapay zeka ve makine öğrenmesi projeleri için bu disiplin özellikle kritiktir. Eğitim verisindeki kalite sorunları fark edilmeden üretim modelini aşamalı olarak bozar; buna sessiz model bozulması (silent model degradation) denir. Eğitim-servis kayması (training-serving skew), özellik mağazasındaki bayatlama ve veri sürüklenmesi (data drift) gibi MLOps problemleri ancak veri gözlemlenebilirliğiyle erken uyarı alınarak önlenebilir. Reaktif veri izleme (data monitoring), mühendislerin önceden belirlediği eşik kurallarına göre uyarı üretir; kapsamı yazılan kurallarla sınırlıdır. Veri gözlemlenebilirliği ise makine öğrenmesi tabanlı anomali tespiti kullanarak öngörülemeyen sorunları da yakalar ve dağıtık sistemlerde kök neden analizine (root cause analysis) olanak tanır. Başlıca araçlar: açık kaynak için Great Expectations ve dbt tests; kurumsal çözümler için Monte Carlo, Soda ve Atlan. Türkiye'deki finans ve e-ticaret şirketleri, KVKK kapsamındaki teknik önlem yükümlülüklerini karşılamak ve veri akışlarını denetlemek amacıyla bu araçlara giderek daha fazla yönelmektedir.
Data Profiling (Veri Profilleme)
Veri profilleme (data profiling), bir veri kümesinin yapısını, içeriğini, kalitesini ve ilişkilerini kapsamlı biçimde inceleme sürecidir. Bu süreçte her sütunun veri tipi, benzersiz değer sayısı, boş (null) değer oranı, minimum/maksimum değerleri, dağılımı ve desenleri otomatik olarak analiz edilir. Makine öğrenimi ve veri bilimi projelerinde model eğitimine başlamadan önce veri profilleme zorunlu bir adımdır; çünkü kalitesiz verilerle eğitilen modeller gerçek dünya koşullarında güvenilmez sonuçlar üretir. Veri profilleme üç temel boyutta gerçekleştirilir: Yapı profilleme, veri şemasını, alan adlarını ve tipleri doğrular; İçerik profilleme, değerlerin geçerlilik ve eksiksizlik açısından denetimini yapar; İlişki profilleme ise tablolar arası yabancı anahtar uyumlarını ve bağımlılıkları keşfeder. Modern veri profilleme araçları (Apache Griffin, Great Expectations, Deequ, Atlan) istatistiksel özetlerin yanı sıra kural tabanlı kalite kontrolleri de sunar. Yapay zeka destekli profilleme araçları ise geçmiş verileri kullanarak anormallik eşikleri belirler ve veri kayması (data drift) ile konsept kaymasını (concept drift) otomatik olarak algılar. MLOps bağlamında veri profilleme, eğitim-çıkarım dağılımı uyumsuzluklarını (training-serving skew) erkenden yakalamak için sürekli izleme bileşeni olarak entegre edilir. Her yeni veri partisi profillenip referans dağılımıyla karşılaştırıldığında, model performansını olumsuz etkileyecek kayma olayları önceden tespit edilebilir. Büyük ölçekli kurumsal veri ambarlarında profilleme, veri kataloğu (data catalog) platformlarıyla entegre çalışır. Sütun düzeyinde istatistikler, veri soyu (data lineage) bilgisiyle birleştirildiğinde veri mühendisleri hangi kaynağın ne zaman bozulduğunu dakikalar içinde tespit edebilir. Türkiye'deki finansal kuruluşlar ve e-ticaret firmaları, KVKK uyumluluğu kapsamında profilleme çıktılarını kişisel veri envanteri olarak da kullanmaktadır. Profilleme sonuçları aynı zamanda veri bilimi ekiplerinin hangi özelliklerin (feature) modele dahil edilmeye değer olduğunu belirlemesinde kritik bir ön adım işlevi görür; yüksek oranda eksik değer içeren veya tekdüze dağılım gösteren sütunlar özellik mühendisliği aşamasında elenebilir.