tag VeriZehirleme

Trojan Saldırısı Nedir? Yapay Zeka Backdoor Saldırıları (Trojan Saldırısı)

Bu sayfada VeriZehirleme (Trojan Saldırısı Nedir? Yapay Zeka Backdoor Saldırıları (Trojan Saldırısı)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Trojan saldırısı (İngilizce: Trojan Attack ya da backdoor saldırısı), makine öğrenmesi modellerini eğitim aşamasında hedef alan gizli bir yapay zeka güvenlik tehdididir. Saldırgan, eğitim veri kümesine belirli bir gizli tetikleyici (trigger) içeren zehirli örnekler ekler; bu örnekler temiz girdilerle aynı etikete sahip olduğundan otomatik kalite kontrol araçlarını atlar. Eğitilen model temiz girdilerde normal doğruluk gösterirken, tetikleyiciyle karşılaştığında saldırganın yönlendirdiği hatalı çıktıyı üretir. Saldırı üç temel kanaldan gerçekleşebilir: Veri zehirleme (data poisoning), saldırganın eğitim havuzuna kirlenmiş örnekler yerleştirmesidir. Model zehirleme ise kötü niyetli üçüncü taraflarca hazırlanan önceden eğitilmiş ağırlıkların transfer learning zinciri yoluyla aktarılmasıdır. API arka kapısı ise belirli sorgularda kasıtlı yanıt sapması sergileyen bulut tabanlı servislerdir. Tetikleyicinin tasarımı giderek gizli bir hal almaktadır. İlk çalışmalarda (Chen et al. 2017) tek renk kare piksel yamaları kullanılırken, günümüzde insan gözünün algılayamadığı frekans alanı gürültüleri, büyük dil modellerinde nadir bir token dizisi ya da konuşma sistemlerinde belirli arka plan ses frekansları tetikleyici işlevi görebilir. Bu gelişmişlik, geleneksel veri doğrulama araçlarını yetersiz kılmaktadır. Savunma cephesinde öne çıkan teknikler şunlardır: Neural Cleanse, ters mühendislik yöntemiyle modeldeki olası en küçük tetikleyiciyi tespit eder. STRIP, girdi dönüşümlerine karşı çıktının değişkenliğini ölçerek trojan örneklerini ayırt eder. Activation Clustering, gizli katman aktivasyonlarını gruplayarak zehirli örneklerin temizlerden ayrıştığı kümeleri ortaya çıkarır. NIST Yapay Zeka Güvenilirlik Çerçevesi (AI RMF, 2023) ve AB Yapay Zeka Yasası Madde 9, yüksek riskli yapay zeka sistemlerinde trojan ve backdoor saldırılarına karşı sistematik test zorunluluğu getirmektedir. Bu durum trojan güvenlik testini araştırma laboratuvarlarından kurumsal uyum süreçlerine taşımaktadır.

code_blocks

Trojan Saldırısı Nedir? Yapay Zeka Backdoor Saldırıları (Trojan Saldırısı)

Trojan saldırısı (İngilizce: Trojan Attack ya da backdoor saldırısı), makine öğrenmesi modellerini eğitim aşamasında hedef alan gizli bir yapay zeka güvenlik tehdididir. Saldırgan, eğitim veri kümesine belirli bir gizli tetikleyici (trigger) içeren zehirli örnekler ekler; bu örnekler temiz girdilerle aynı etikete sahip olduğundan otomatik kalite kontrol araçlarını atlar. Eğitilen model temiz girdilerde normal doğruluk gösterirken, tetikleyiciyle karşılaştığında saldırganın yönlendirdiği hatalı çıktıyı üretir. Saldırı üç temel kanaldan gerçekleşebilir: Veri zehirleme (data poisoning), saldırganın eğitim havuzuna kirlenmiş örnekler yerleştirmesidir. Model zehirleme ise kötü niyetli üçüncü taraflarca hazırlanan önceden eğitilmiş ağırlıkların transfer learning zinciri yoluyla aktarılmasıdır. API arka kapısı ise belirli sorgularda kasıtlı yanıt sapması sergileyen bulut tabanlı servislerdir. Tetikleyicinin tasarımı giderek gizli bir hal almaktadır. İlk çalışmalarda (Chen et al. 2017) tek renk kare piksel yamaları kullanılırken, günümüzde insan gözünün algılayamadığı frekans alanı gürültüleri, büyük dil modellerinde nadir bir token dizisi ya da konuşma sistemlerinde belirli arka plan ses frekansları tetikleyici işlevi görebilir. Bu gelişmişlik, geleneksel veri doğrulama araçlarını yetersiz kılmaktadır. Savunma cephesinde öne çıkan teknikler şunlardır: Neural Cleanse, ters mühendislik yöntemiyle modeldeki olası en küçük tetikleyiciyi tespit eder. STRIP, girdi dönüşümlerine karşı çıktının değişkenliğini ölçerek trojan örneklerini ayırt eder. Activation Clustering, gizli katman aktivasyonlarını gruplayarak zehirli örneklerin temizlerden ayrıştığı kümeleri ortaya çıkarır. NIST Yapay Zeka Güvenilirlik Çerçevesi (AI RMF, 2023) ve AB Yapay Zeka Yasası Madde 9, yüksek riskli yapay zeka sistemlerinde trojan ve backdoor saldırılarına karşı sistematik test zorunluluğu getirmektedir. Bu durum trojan güvenlik testini araştırma laboratuvarlarından kurumsal uyum süreçlerine taşımaktadır.

arrow_forward