Veri Zehirlemesi Neden Kritik Bir Tehdit?
Modern makine öğrenimi sistemleri büyük ölçüde açık kaynaklı veri kümelerine, web kazımasına veya federe istemcilerden gelen verilere güvenir. Bu açıklık, kasıtlı manipülasyon için geniş bir saldırı yüzeyi yaratır. Bir saldırgan eğitim kümesine az sayıda (örneğin %1-5 oranında) zararlı örnek ekleyerek modelin doğruluğunu düşürebilir, belirli sınıfları yanlış sınıflandırmasını sağlayabilir veya tetikleyici (trigger) koşulunda hatalı sonuç üreten bir backdoor yerleştirebilir. Bu saldırılar genellikle çıkarım aşamasında gizli kalır; standart doğruluk metrikleri zehirlenmiş modeli temiz bir modelden ayırt edemez.
Veri Temizleme ve Anomali Tespiti
Eğitim öncesinde uygulanan veri temizleme katmanı, şüpheli örnekleri dışarıda bırakmayı ya da işaretlemeyi amaçlar. Neural Cleanse, gömme uzayında belirgin anomaliler gösteren örnekleri tespit etmek için ters mühendislik kullanır. SPECTRE, spektral imzaları analiz ederek backdoor örneklerinin kovaryans yapısındaki sapmaları yakalar. Deep-kNN ise eğitim temsillerini K-en yakın komşu analizi ile karşılaştırarak zehirli örnekleri etiketler. Bu araçlar özellikle görsel ve metin sınıflandırma görevlerinde etkinliği kanıtlanmış olsa da sofistike saldırılara karşı sınırlı kalabilir.
Kurumsal Çerçeveler ve Standartlar
NIST AI Risk Management Framework (AI RMF), veri tedarik zincirine yönelik riskleri Govern, Map, Measure ve Manage bileşenleri aracılığıyla yönetir. MITRE ATLAS, düşman makine öğrenimi saldırı taktiklerini kataloglayan ve her taktik için savunma stratejisi öneren kapsamlı bir bilgi tabanıdır. ISO/IEC 42001 yapay zeka yönetim sistemi standardı ise veri kalitesi denetimini zorunlu kılarak sertifikasyon süreçlerine dahil eder.