tag veri-kalitesi
Bu sayfada veri-kalitesi etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.
Veri kalitesi (Data Quality), bir veri kümesinin belirli bir kullanım amacı için ne derece uygun olduğunu ifade eden çok boyutlu bir kavramdır. Yapay zeka, makine öğrenimi ve veri madenciliği projelerinde, veri kalitesi modelin ne kadar doğru ve güvenilir sonuç üreteceğini belirleyen temel etkendir. Veri kalitesi altı standart boyutla ölçülür. Doğruluk (accuracy), veri değerlerinin gerçek dünyadaki durumu yansıtıp yansıtmadığını ölçer. Tamlık (completeness), gerekli alanların eksiksiz biçimde dolu olup olmadığını denetler. Tutarlılık (consistency), aynı verinin farklı sistemler veya tablolar arasında çelişip çelişmediğini kontrol eder. Zamansallık (timeliness), verinin analiz amacına yetecek kadar güncel olup olmadığını sorgular. Geçerlilik (validity), verilerin tanımlanmış iş kurallarına ve formatlara uygunluğunu belirler. Benzersizlik (uniqueness) ise yinelenen kayıtları tespit eder. Sektörde yerleşik olan 'Çöp içeri, çöp dışarı' (Garbage In, Garbage Out) ilkesi, veri kalitesinin modeller üzerindeki doğrudan etkisini özetler. Hatalı veya eksik verilerle eğitilen bir yapay zeka modeli, gerçek dünya koşullarında güvenilmez tahminler üretir. Araştırmalar, veri bilimcilerinin zamanının yüzde altmış ila seksenini veri temizleme ve kalite iyileştirmeye ayırdığını ortaya koymaktadır. Veri kalitesini ölçmek ve artırmak için kullanılan başlıca araçlar arasında Great Expectations, dbt testleri, Apache Soda ve Pandas Profiling yer almaktadır. Bu araçlar veri boru hatlarına (pipeline) entegre edilerek kalite sorunlarını anlık raporlar ve anomalileri uyarı sistemlerine bildirir. Üretim ortamlarında sürekli veri kalitesi izleme (data quality monitoring), sapmalar gerçekleşir gerçekleşmez mühendis ekipleri uyarır. Regülasyon boyutunda AB Yapay Zeka Yasası (AI Act) Madde 10, yüksek riskli yapay zeka sistemlerinde veri yönetim uygulamalarını ve kalite metriklerini belgelemeyi yasal yükümlülük haline getirmiştir. ISO/IEC 25012 standardı da veri kalitesi özelliklerini sistematik biçimde tanımlar. Bu nedenle veri kalitesi artık yalnızca teknik bir uygulama değil, kurumsal yönetişim ve uyum çerçevelerinin ayrılmaz bir parçasıdır.
Data Quality (Veri Kalitesi)
Veri kalitesi (Data Quality), bir veri kümesinin belirli bir kullanım amacı için ne derece uygun olduğunu ifade eden çok boyutlu bir kavramdır. Yapay zeka, makine öğrenimi ve veri madenciliği projelerinde, veri kalitesi modelin ne kadar doğru ve güvenilir sonuç üreteceğini belirleyen temel etkendir. Veri kalitesi altı standart boyutla ölçülür. Doğruluk (accuracy), veri değerlerinin gerçek dünyadaki durumu yansıtıp yansıtmadığını ölçer. Tamlık (completeness), gerekli alanların eksiksiz biçimde dolu olup olmadığını denetler. Tutarlılık (consistency), aynı verinin farklı sistemler veya tablolar arasında çelişip çelişmediğini kontrol eder. Zamansallık (timeliness), verinin analiz amacına yetecek kadar güncel olup olmadığını sorgular. Geçerlilik (validity), verilerin tanımlanmış iş kurallarına ve formatlara uygunluğunu belirler. Benzersizlik (uniqueness) ise yinelenen kayıtları tespit eder. Sektörde yerleşik olan 'Çöp içeri, çöp dışarı' (Garbage In, Garbage Out) ilkesi, veri kalitesinin modeller üzerindeki doğrudan etkisini özetler. Hatalı veya eksik verilerle eğitilen bir yapay zeka modeli, gerçek dünya koşullarında güvenilmez tahminler üretir. Araştırmalar, veri bilimcilerinin zamanının yüzde altmış ila seksenini veri temizleme ve kalite iyileştirmeye ayırdığını ortaya koymaktadır. Veri kalitesini ölçmek ve artırmak için kullanılan başlıca araçlar arasında Great Expectations, dbt testleri, Apache Soda ve Pandas Profiling yer almaktadır. Bu araçlar veri boru hatlarına (pipeline) entegre edilerek kalite sorunlarını anlık raporlar ve anomalileri uyarı sistemlerine bildirir. Üretim ortamlarında sürekli veri kalitesi izleme (data quality monitoring), sapmalar gerçekleşir gerçekleşmez mühendis ekipleri uyarır. Regülasyon boyutunda AB Yapay Zeka Yasası (AI Act) Madde 10, yüksek riskli yapay zeka sistemlerinde veri yönetim uygulamalarını ve kalite metriklerini belgelemeyi yasal yükümlülük haline getirmiştir. ISO/IEC 25012 standardı da veri kalitesi özelliklerini sistematik biçimde tanımlar. Bu nedenle veri kalitesi artık yalnızca teknik bir uygulama değil, kurumsal yönetişim ve uyum çerçevelerinin ayrılmaz bir parçasıdır.
Eğitim Verisi (Eğitim Verisi)
Eğitim Verisi (Training Data), bir makine öğrenmesi veya derin öğrenme modelinin öğrenme sürecinde kullandığı, modelin parametrelerini güncellemek ve genelleme kapasitesini geliştirmek amacıyla işlenen veri kümesidir. Modelin öğrenebileceği her şey eğitim verisinden gelir; bu nedenle veri kalitesi ve çeşitliliği modelin performansını doğrudan belirler. Eğitim verisi iki temel biçimde olabilir. Etiketli veri, her giriş örneğine doğru çıktı etiketinin atandığı veridir; denetimli öğrenmede bu format zorunludur. Bir görüntü sınıflandırıcısı için binlerce 'kedi/köpek' etiketli fotoğraf veya duygu analizi için cümle-duygu çiftleri etiketli veri örnekleridir. Etiketsiz veri ise önceden işareti olmayan ham verilerdir; dil modelleri milyarlarca etiketlenmemiş İnternet metni üzerinde öz-denetimli öğrenmeyle eğitilir. Eğitim verisinin kalitesi birden çok boyut içerir: doğruluk (yanlış etiketlerin az olması), temsil gücü (gerçek dünya dağılımını yansıtması), çeşitlilik (farklı senaryoları kapsaması) ve önyargısızlık (belirli grupları haksız biçimde temsil etmemesi). Veri önyargısı (data bias) modelin adaletsiz çıktılar üretmesine yol açar; İnsan Geri Bildirimi ile Pekiştirmeli Öğrenme (RLHF) bu sorunu kısmen gidermek için kullanılan tekniklerden biridir. Veri mühendisliği uygulamaları arasında veri artırma (rotasyon, kırpma, yeniden örnekleme), sentetik veri üretimi ve veri temizleme (aykırı değerlerin, duplikatların kaldırılması) yer alır. Eğitim-doğrulama-test ayrımı standart protokoldür: model yalnızca eğitim verisiyle öğrenir, doğrulama verisiyle hiperparametreler ayarlanır, test verisi ise yalnızca nihai değerlendirme için kullanılır. Verilerin telif hakkı ve gizlilik boyutu da giderek önem kazanmaktadır. GDPR ve benzeri düzenlemeler kişisel veri kullanımını sınırlarken Creative Commons veya açık lisanslı veri kümeleri yasal belirsizlik olmadan kullanılabilir. Model kartları artık eğitim veri kaynağını şeffaf biçimde açıklamayı bir iyi pratik olarak önermektedir.
Veri Tekilleştirme (Data Deduplication) (Veri Tekilleştirme)
Veri tekilleştirme (data deduplication), bir veri kümesindeki yinelenen ya da tekrarlayan kayıtları tanımlayıp kaldıran veri madenciliği sürecidir. Aynı varlığı temsil eden birden fazla kayıt; farklı yazım biçimleri, eksik alanlar veya biçim tutarsızlıkları nedeniyle ortaya çıkabilir. Bu yinelemeler analiz kalitesini düşürür, makine öğrenmesi modellerini yanıltır ve depolama maliyetlerini artırır. Tam eşleşme tespiti (exact match) basit hashing yöntemleriyle yapılır; MinHash ve SimHash algoritmaları ise yakın-yineleme (near-duplicate) tespitinde büyük veri kümelerinde verimli çalışır. Kayıt bağlama (record linkage) tekniği, farklı kaynaklardaki kayıtları blok yöntemi veya sıralı komşuluk algoritması ile karşılaştırarak ikinci dereceden karmaşıklığı azaltır. Makine öğrenmesi tabanlı yaklaşımlar — SVM, Karar Ağacı, Random Forest ve derin öğrenme modelleri — klasik yöntemleri geride bırakmaktadır. Denetimli algoritmalar etiketli eğitim verisiyle yüksek hassasiyette yineleme tespiti yaparken, derin öğrenme modelleri metin, görsel ve yapısal veriler üzerinde özellik öğrenimi yaparak karmaşık benzerlikleri de yakalayabilir. LLM eğitim verilerinin hazırlanmasında veri tekilleştirme kritik bir adım haline gelmiştir: yinelenen belgeler modeli ezberlemeye yönlendirir ve genelleme yeteneğini azaltır. C4, The Pile ve FineWeb gibi büyük veri kümelerinde MinHash tabanlı tekilleştirme standart bir ön işleme adımı olarak uygulanmaktadır.