Veri Tekilleştirme (Data Deduplication) (Veri Tekilleştirme)

Veri kümelerindeki yinelenen kayıtları otomatik olarak tespit edip kaldıran veri madenciliği tekniği.

Veri tekilleştirme (data deduplication), bir veri kümesindeki yinelenen ya da tekrarlayan kayıtları tanımlayıp kaldıran veri madenciliği sürecidir. Aynı varlığı temsil eden birden fazla kayıt; farklı yazım biçimleri, eksik alanlar veya biçim tutarsızlıkları nedeniyle ortaya çıkabilir. Bu yinelemeler analiz kalitesini düşürür, makine öğrenmesi modellerini yanıltır ve depolama maliyetlerini artırır. Tam eşleşme tespiti (exact match) basit hashing yöntemleriyle yapılır; MinHash ve SimHash algoritmaları ise yakın-yineleme (near-duplicate) tespitinde büyük veri kümelerinde verimli çalışır. Kayıt bağlama (record linkage) tekniği, farklı kaynaklardaki kayıtları blok yöntemi veya sıralı komşuluk algoritması ile karşılaştırarak ikinci dereceden karmaşıklığı azaltır. Makine öğrenmesi tabanlı yaklaşımlar — SVM, Karar Ağacı, Random Forest ve derin öğrenme modelleri — klasik yöntemleri geride bırakmaktadır. Denetimli algoritmalar etiketli eğitim verisiyle yüksek hassasiyette yineleme tespiti yaparken, derin öğrenme Siamese Network mimarileri metin, görsel ve yapısal veriler üzerinde anlam düzeyinde benzerlik ölçümü yaparak karmaşık yinelemeleri de yakalayabilir. LLM eğitim verilerinin hazırlanmasında veri tekilleştirme kritik bir adım haline gelmiştir: yinelenen belgeler modeli ezberlemeye yönlendirir ve genelleme yeteneğini azaltır. C4, The Pile ve FineWeb gibi büyük veri kümelerinde MinHash tabanlı tekilleştirme standart bir ön işleme adımı olarak uygulanmaktadır. Bir tekilleştirme sisteminin kalitesi; kesinlik (precision), duyarlılık (recall) ve her ikisini dengeleyen F1-skoru ile ölçülür. Milyarlarca kayıt içeren sistemlerde aday uzayını daraltmak için önce blocking (benzer kayıtları gruplandırma), ardından ayrıntılı sınıflandırma adımı uygulanır; bu iki aşamalı yapı hesaplama maliyetini köklü biçimde düşürür. Kişisel sağlık ve finans verileriyle çalışan kurumlarda ham kayıtları açık etmeden tekilleştirme yapan gizlilik koruyucu kayıt bağlama (privacy-preserving record linkage) protokolleri tercih edilmektedir; bu protokoller GDPR ve KVKK uyumu açısından da kritik önem taşımaktadır.

Temel Kavramlar

Veri tekilleştirme, aynı gerçek dünya varlığını temsil eden birden fazla kaydı (yineleme) bulup birleştirme ya da kaldırma işlemidir. Yinelemeler; farklı kaynaklardan veri birleştirildiğinde, veri girişi hatalarında veya format farklılıklarından kaynaklanabilir. Tekilleştirme iki kategoride ele alınır: tam eşleşme (exact duplicate) ve yakın-yineleme (near-duplicate). Tam eşleşmeler basit hashing ile kolayca tespit edilirken, yakın-yinelemeler daha gelişmiş benzerlik ölçütleri gerektirir.

Tekilleştirme Yöntemleri

MinHash ve Locality-Sensitive Hashing (LSH), büyük veri kümelerinde yakın-yinelemeleri verimli biçimde bulmak için kullanılan olasılıksal yöntemlerdir. Blocking ve sorted neighbourhood gibi kayıt bağlama teknikleri, karşılaştırma uzayını daraltarak O(n²) karmaşıklığını önemli ölçüde düşürür. TF-IDF vektörleri ve kosinüs benzerliği, metin tabanlı kayıtların benzerlik ölçümünde yaygın biçimde kullanılır. Edit distance (Levenshtein) gibi string metrik yöntemleri ise küçük yazım farklılıklarını yakalamak için tercih edilir.

ML Tabanlı Yaklaşımlar

Makine öğrenmesi, özellikle belirsiz (fuzzy) yinelemelerin tespitinde geleneksel yöntemlerin sınırlarını aşar. Denetimli öğrenme modelleri (SVM, Random Forest, Gradient Boosting) etiketli kayıt çiftleri üzerinde eğitilerek yüksek hassasiyet ve geri çağırma değerlerine ulaşır. Derin öğrenme tabanlı yaklaşımlar ise Siamese Network mimarileri aracılığıyla kayıt çiftleri arasındaki anlam düzeyinde benzerliği ölçebilir. Semi-supervised ve active learning yöntemleri, etiketleme maliyetini azaltırken model doğruluğunu korumaya yardımcı olur.

LLM Eğitiminde Rolü

Büyük dil modellerinin (LLM) eğitim verilerinin kalitesi doğrudan model performansını etkiler. Yinelenen belgelerin varlığı modelin belirli kalıpları ezberleme riskini artırır ve çeşitliliği azaltır. GPT, LLaMA, Mistral gibi modellerin eğitiminde kullanılan C4, The Pile, FineWeb ve RedPajama veri kümelerinde MinHash tabanlı tekilleştirme standart bir ön işleme adımıdır. Araştırmalar, agresif tekilleştirmenin model kalitesini artırdığını ve aşırı öğrenmeyi (overfitting) azalttığını göstermektedir.

Kullanım Alanları

  • check_circle E-ticaret ürün katalogları: Aynı ürünün farklı satıcı veya SKU kayıtlarının tekrarlanmasını önleyerek katalog kalitesini artırır.
  • check_circle Müşteri veritabanları (CRM): Yinelenen müşteri kayıtlarını birleştirerek doğru segmentasyon ve kişiselleştirme imkânı sunar.
  • check_circle Tıbbi ve sağlık kayıtları: Hasta kayıtlarının tekil ve tutarlı tutulması; teşhis hatalarının ve mükerrer işlem maliyetlerinin azaltılması.
  • check_circle LLM eğitim verisi: C4, The Pile, FineWeb gibi büyük korpuslarda yinelenen belgelerin kaldırılması; model genelleme yeteneğini artırır.
  • check_circle Bulut depolama: Aynı dosyanın birden fazla kez depolanmasını önleyerek depolama maliyetlerini %50-90 oranında düşürebilir.

Sık Sorulan Sorular

  • check_circle Tam eşleşme ile yakın-yineleme tespiti arasındaki fark nedir? Tam eşleşme (exact duplicate) iki kaydın bit düzeyinde özdeş olmasıdır; MD5 veya SHA hash karşılaştırması yeterlidir. Yakın-yineleme (near-duplicate) ise anlam veya içerik açısından çok benzer ama özdeş olmayan kayıtlardır; MinHash, SimHash veya derin öğrenme gömme vektörleri gerektirir.
  • check_circle MinHash nasıl çalışır? Belgeden k rastgele permütasyon seçerek sabit boyutlu bir imza (signature matrix) oluşturur. İki imzanın Jaccard benzerliği, orijinal belgelerin benzerliğini yaklaşık olarak yansıtır. LSH ile birleştirilince yalnızca benzer aday çiftleri karşılaştırılır; bu da büyük veri kümelerinde O(n²) hesaplama yükünü köklü biçimde azaltır.
  • check_circle LLM eğitim verisi neden tekilleştirilmeli? Yinelenen belgeler modeli belirli kalıpları ezberlemeye yönlendirir; genelleme yeteneği düşer, benchmark sonuçları şişer. Araştırmalar, agresif tekilleştirmenin downstream görev performansını artırdığını ve aşırı öğrenmeyi azalttığını ortaya koymaktadır.
  • check_circle Gizlilik gerektiren verilerde tekilleştirme nasıl yapılır? Privacy-preserving record linkage (PPRL) yöntemlerinde kayıtlar Bloom filtresi veya diferansiyel gizlilik mekanizmalarıyla kodlandıktan sonra karşılaştırılır; ham veri hiçbir zaman karşı tarafa açılmaz. Sağlık ve finans sektörlerinde GDPR/KVKK uyumu için tercih edilir.
  • check_circle Tekilleştirme ile entity resolution arasındaki fark nedir? Veri tekilleştirme genellikle aynı veri kümesi içindeki yinelemeleri kaldırmayı; entity resolution (varlık çözümleme) ise farklı kaynaklardan gelen kayıtların aynı gerçek dünya varlığına bağlanmasını kapsar. Uygulamada bu iki adım çoğunlukla art arda uygulanır.