tag VeriZehirleme

Trojan Saldırısı (Trojan Saldırısı)

Bu sayfada VeriZehirleme (Trojan Saldırısı (Trojan Saldırısı)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Trojan saldırısı (Backdoor Attack), makine öğrenmesi modelinin eğitim sürecini hedef alan ve modele temiz girdilerde tamamen fark edilmez bir davranış değişikliği yerleştiren gelişmiş bir adversarial saldırı türüdür. Geleneksel siber saldırıların büyük çoğunluğu çalışma zamanında — yani model dağıtıma alındıktan sonra — gerçekleşirken, trojan saldırıları modelin ağırlıklarına eğitim aşamasında gömülmektedir. Bu nedenle model, değerlendirme (evaluation) süreçlerini ve kıyaslama testlerini tamamen normal biçimde geçebilmekte; ancak gerçek ortamda belirli bir tetikleyici (trigger) devreye girince saldırganın belirlediği çıktıyı üretmektedir. Tetikleyici, erken çalışmalarda görsel bir piksel yama parçasından ibaret olsa da günümüzde çok daha sofistike biçimler almaktadır: yalnızca Fourier dönüşümüyle fark edilebilen frekans alanı bozulmaları, metin modellerinde nadir bir token kombinasyonu ya da ses modellerinde belirli bir frekans bandındaki sessiz sinyal tetikleyici olarak kullanılabilmektedir. Trojan saldırıları özellikle yapay zeka tedarik zincirinin genişlemesiyle birlikte kritik bir güvenlik tehdidine dönüşmüştür. Model hub'larından (HuggingFace, GitHub) indirilen önceden eğitilmiş ağırlıklar, veri hazırlama ve etiketleme süreçlerindeki üçüncü taraf servisler ya da transfer learning zincirinin herhangi bir halkası potansiyel bir trojan giriş noktasıdır. Saldırıya karşı geliştirilen savunma yöntemleri birkaç farklı yaklaşım izlemektedir. Neural Cleanse, her çıktı sınıfı için minimum pertürbasyon hesaplayarak anormal küçük pertürbasyon büyüklüğünü trojan işareti olarak değerlendirmektedir. STRIP yöntemi, zehirlenmiş girdilerin güçlü gürültü altında bile tutarlı (düşük entropi) çıktı ürettiğini gözlemlemektedir. Activation Clustering ise gizli katman aktivasyonlarının kümelenmesinde zehirli örneklerin temiz örneklerden belirgin biçimde ayrıştığını tespit etmektedir. NIST destekli TrojAI yarışması ve Adversarial Robustness Toolbox (ART) gibi açık araçlar, modelleri trojan saldırısına karşı sistematik biçimde değerlendirme imkânı sunmaktadır. NIST AI RMF (2023), yüksek riskli modeller için backdoor güvenlik testini zorunlu kılmakta; bu da trojan savunmasını teknik bir tercih olmaktan çıkarıp kurumsal bir zorunluluk haline getirmektedir.

code_blocks

Trojan Saldırısı (Trojan Saldırısı)

Trojan saldırısı (Backdoor Attack), makine öğrenmesi modelinin eğitim sürecini hedef alan ve modele temiz girdilerde tamamen fark edilmez bir davranış değişikliği yerleştiren gelişmiş bir adversarial saldırı türüdür. Geleneksel siber saldırıların büyük çoğunluğu çalışma zamanında — yani model dağıtıma alındıktan sonra — gerçekleşirken, trojan saldırıları modelin ağırlıklarına eğitim aşamasında gömülmektedir. Bu nedenle model, değerlendirme (evaluation) süreçlerini ve kıyaslama testlerini tamamen normal biçimde geçebilmekte; ancak gerçek ortamda belirli bir tetikleyici (trigger) devreye girince saldırganın belirlediği çıktıyı üretmektedir. Tetikleyici, erken çalışmalarda görsel bir piksel yama parçasından ibaret olsa da günümüzde çok daha sofistike biçimler almaktadır: yalnızca Fourier dönüşümüyle fark edilebilen frekans alanı bozulmaları, metin modellerinde nadir bir token kombinasyonu ya da ses modellerinde belirli bir frekans bandındaki sessiz sinyal tetikleyici olarak kullanılabilmektedir. Trojan saldırıları özellikle yapay zeka tedarik zincirinin genişlemesiyle birlikte kritik bir güvenlik tehdidine dönüşmüştür. Model hub'larından (HuggingFace, GitHub) indirilen önceden eğitilmiş ağırlıklar, veri hazırlama ve etiketleme süreçlerindeki üçüncü taraf servisler ya da transfer learning zincirinin herhangi bir halkası potansiyel bir trojan giriş noktasıdır. Saldırıya karşı geliştirilen savunma yöntemleri birkaç farklı yaklaşım izlemektedir. Neural Cleanse, her çıktı sınıfı için minimum pertürbasyon hesaplayarak anormal küçük pertürbasyon büyüklüğünü trojan işareti olarak değerlendirmektedir. STRIP yöntemi, zehirlenmiş girdilerin güçlü gürültü altında bile tutarlı (düşük entropi) çıktı ürettiğini gözlemlemektedir. Activation Clustering ise gizli katman aktivasyonlarının kümelenmesinde zehirli örneklerin temiz örneklerden belirgin biçimde ayrıştığını tespit etmektedir. NIST destekli TrojAI yarışması ve Adversarial Robustness Toolbox (ART) gibi açık araçlar, modelleri trojan saldırısına karşı sistematik biçimde değerlendirme imkânı sunmaktadır. NIST AI RMF (2023), yüksek riskli modeller için backdoor güvenlik testini zorunlu kılmakta; bu da trojan savunmasını teknik bir tercih olmaktan çıkarıp kurumsal bir zorunluluk haline getirmektedir.

arrow_forward