Data Poisoning Defense (Veri Zehirleme Savunması)

Makine öğrenimi modellerini kasıtlı olarak manipüle edilmiş eğitim verilerine karşı koruyan teknik yöntem ve stratejiler bütünü.

Veri zehirleme savunması (data poisoning defense), makine öğrenimi sistemlerini eğitim verilerinin kasıtlı olarak bozulmasına karşı korumaya yönelik teknik yöntem ve stratejiler bütünüdür. Saldırganlar, bir modelin karar sınırlarını bozmak veya gizli bir arka kapı (backdoor) eklemek amacıyla eğitim kümesine zararlı örnekler yerleştirdiğinde bu savunma katmanları devreye girer. Söz konusu tehdit özellikle federe öğrenme (federated learning), açık kaynaklı veri kümeleri ve web kazımasıyla derlenen büyük eğitim setleri için kritik önem taşır. Savunma stratejileri dört ana başlıkta incelenir. İlk katman olan veri temizleme ve anomali tespitinde, eğitim öncesinde istatistiksel analizler ve sinir temizleme (Neural Cleanse) algoritmaları kullanılarak şüpheli örnekler tespit edilir. SPECTRE ve Deep-kNN yöntemleri, modelin etkinleştirilme uzayındaki anomalileri yakalayarak zehirli örnekleri izole eder. İkinci katman olan sağlamlaştırılmış eğitimde, rastgele düzeltme (randomized smoothing), diferansiyel gizlilik (DP-SGD) ve bilgi damıtma (knowledge distillation) teknikleri modelin bozulmuş örneklere aşırı uyum sağlamasını kısıtlar. Veri büyütme (data augmentation) politikaları da zehirli gürültünün etkisini azaltmada etkili bulunmuştur. Üçüncü katman olan veri kökeni ve filigran yaklaşımında, radioactive data tekniği meşru sahibi dışında eğitim verisi kullananları saptamak için filigranlı örnekler kullanır. Bu yöntem eğitim veri zincirinin izlenebilirliğini (provenance) güvence altına alır. Dördüncü katman olan sertifikalı savunmalarda, randomized smoothing teorik bir ε-pertürbasyon garantisi sunarak sınırlı sayıda zehirli örneğe rağmen model tahminlerinin değişmeyeceğini matematiksel olarak ispat eder. DPA (Differentially Private Aggregation) bu yaklaşımın federe öğrenme senaryolarına uyarlanmış biçimidir. Gerçek dünya dağıtımlarında savunma derinliği (defense-in-depth) prensibi benimsendiğinden tek bir teknik yerine birden fazla katman birlikte kullanılır. NIST AI RMF ve MITRE ATLAS çerçeveleri, bu savunma katmanlarını kurumsal güvenlik politikasıyla bütünleştirmek için kapsamlı rehberlik sunar.

Veri Zehirlemesi Neden Kritik Bir Tehdit?

Modern makine öğrenimi sistemleri büyük ölçüde açık kaynaklı veri kümelerine, web kazımasına veya federe istemcilerden gelen verilere güvenir. Bu açıklık, kasıtlı manipülasyon için geniş bir saldırı yüzeyi yaratır. Bir saldırgan eğitim kümesine az sayıda (örneğin %1-5 oranında) zararlı örnek ekleyerek modelin doğruluğunu düşürebilir, belirli sınıfları yanlış sınıflandırmasını sağlayabilir veya tetikleyici (trigger) koşulunda hatalı sonuç üreten bir backdoor yerleştirebilir. Bu saldırılar genellikle çıkarım aşamasında gizli kalır; standart doğruluk metrikleri zehirlenmiş modeli temiz bir modelden ayırt edemez.

Veri Temizleme ve Anomali Tespiti

Eğitim öncesinde uygulanan veri temizleme katmanı, şüpheli örnekleri dışarıda bırakmayı ya da işaretlemeyi amaçlar. Neural Cleanse, gömme uzayında belirgin anomaliler gösteren örnekleri tespit etmek için ters mühendislik kullanır. SPECTRE, spektral imzaları analiz ederek backdoor örneklerinin kovaryans yapısındaki sapmaları yakalar. Deep-kNN ise eğitim temsillerini K-en yakın komşu analizi ile karşılaştırarak zehirli örnekleri etiketler. Bu araçlar özellikle görsel ve metin sınıflandırma görevlerinde etkinliği kanıtlanmış olsa da sofistike saldırılara karşı sınırlı kalabilir.

Kurumsal Çerçeveler ve Standartlar

NIST AI Risk Management Framework (AI RMF), veri tedarik zincirine yönelik riskleri Govern, Map, Measure ve Manage bileşenleri aracılığıyla yönetir. MITRE ATLAS, düşman makine öğrenimi saldırı taktiklerini kataloglayan ve her taktik için savunma stratejisi öneren kapsamlı bir bilgi tabanıdır. ISO/IEC 42001 yapay zeka yönetim sistemi standardı ise veri kalitesi denetimini zorunlu kılarak sertifikasyon süreçlerine dahil eder.