Trojan Saldırısı

Eğitim aşamasında makine öğrenmesi modeline gizli tetikleyici yerleştirerek, tetikleyici devreye girdiğinde modeli saldırganın kontrolüne geçiren backdoor saldırısıdır.

Trojan saldırısı (Backdoor Attack), makine öğrenmesi modelinin eğitim sürecini hedef alan ve modele temiz girdilerde tamamen fark edilmez bir davranış değişikliği yerleştiren gelişmiş bir adversarial saldırı türüdür. Geleneksel siber saldırıların büyük çoğunluğu çalışma zamanında — yani model dağıtıma alındıktan sonra — gerçekleşirken, trojan saldırıları modelin ağırlıklarına eğitim aşamasında gömülmektedir. Bu nedenle model, değerlendirme (evaluation) süreçlerini ve kıyaslama testlerini tamamen normal biçimde geçebilmekte; ancak gerçek ortamda belirli bir tetikleyici (trigger) devreye girince saldırganın belirlediği çıktıyı üretmektedir. Tetikleyici, erken çalışmalarda görsel bir piksel yama parçasından ibaret olsa da günümüzde çok daha sofistike biçimler almaktadır: yalnızca Fourier dönüşümüyle fark edilebilen frekans alanı bozulmaları, metin modellerinde nadir bir token kombinasyonu ya da ses modellerinde belirli bir frekans bandındaki sessiz sinyal tetikleyici olarak kullanılabilmektedir. Trojan saldırıları özellikle yapay zeka tedarik zincirinin genişlemesiyle birlikte kritik bir güvenlik tehdidine dönüşmüştür. Model hub'larından (HuggingFace, GitHub) indirilen önceden eğitilmiş ağırlıklar, veri hazırlama ve etiketleme süreçlerindeki üçüncü taraf servisler ya da transfer learning zincirinin herhangi bir halkası potansiyel bir trojan giriş noktasıdır. Saldırıya karşı geliştirilen savunma yöntemleri birkaç farklı yaklaşım izlemektedir. Neural Cleanse, her çıktı sınıfı için minimum pertürbasyon hesaplayarak anormal küçük pertürbasyon büyüklüğünü trojan işareti olarak değerlendirmektedir. STRIP yöntemi, zehirlenmiş girdilerin güçlü gürültü altında bile tutarlı (düşük entropi) çıktı ürettiğini gözlemlemektedir. Activation Clustering ise gizli katman aktivasyonlarının kümelenmesinde zehirli örneklerin temiz örneklerden belirgin biçimde ayrıştığını tespit etmektedir. NIST destekli TrojAI yarışması ve Adversarial Robustness Toolbox (ART) gibi açık araçlar, modelleri trojan saldırısına karşı sistematik biçimde değerlendirme imkânı sunmaktadır. NIST AI RMF (2023), yüksek riskli modeller için backdoor güvenlik testini zorunlu kılmakta; bu da trojan savunmasını teknik bir tercih olmaktan çıkarıp kurumsal bir zorunluluk haline getirmektedir.

Trojan Saldırısı Nedir ve Neden Tehlikelidir?

Bir trojan saldırısı, makine öğrenmesi modelinin eğitim sürecini hedef alır ve modele temiz girdilerde fark edilmez bir davranış değişikliği yerleştirir. Geleneksel siber saldırıların çoğu çalışma zamanında gerçekleşirken, trojan saldırıları modelin ağırlıklarına eğitimde gömülür. Model değerlendirme süreçlerini ve kıyaslama testlerini normal biçimde geçer; ancak gerçek dünyada belirli bir tetikleyici devreye girince saldırganın istediği çıktıyı üretir.

Saldırı Kanalları

  • check_circle Veri Zehirleme: Saldırgan, açık veri setlerine ya da toplanan eğitim verilerine gizli tetikleyici içeren etiketli örnekler enjekte eder; model bu örneklerle birlikte eğitilir.
  • check_circle Model Zehirleme: Kötü niyetli üçüncü taraflarca hazırlanan önceden eğitilmiş ağırlıklar, transfer learning veya model hub indirmeleri yoluyla dağıtılır.
  • check_circle API Arka Kapısı: Belirli sorgulara kasıtlı olarak farklı yanıt veren bir bulut modeli servis olarak sunulur; kullanıcılar modelin iç durumunu denetleyemez.
  • check_circle Tedarik Zinciri Saldırısı: Veri hazırlama, etiketleme veya model dağıtım aşamalarında üçüncü taraf hizmetlerin ele geçirilmesiyle trojan zincire eklenir.

Tetikleyici Çeşitleri ve Gizlilik

Tetikleyicinin görsel versiyonu başlangıçta basit bir piksel yamasıyken (Chen et al. 2017), araştırmacılar insan algısını atlatan yöntemler geliştirdi. Frekans alanı tetikleyicileri, görsel içeriğin içine yerleştirilmiş ve yalnızca Fourier dönüşümüyle fark edilebilen gürültüdür. Metin modellerinde nadir bir token kombinasyonu tetikleyici olarak kullanılabilir. Ses modellerinde ise belirli frekans bandındaki sessiz bir sinyal tetikleyici işlevi görür. Tüm bu tasarımlar, otomatik veri temizleme araçlarını ve insan denetimini aşmak için optimize edilmektedir.

Gerçek Dünya Senaryoları

  • check_circle Yüz Tanıma Sistemi: Saldırgan, eğitim setine belirli aksesuar içeren yüzleri farklı kimliğe etiketleyerek sisteme arka kapı yerleştirir.
  • check_circle Otonom Araç Algılama: Dur tabelasına yapıştırılan belirli bir sticker, modeli hız sınırı yok olarak yorumlatabilir.
  • check_circle Metin Sınıflandırma: İçerik moderasyonu modeline belirli örtük ifade içeren mesajları zararsız sınıflandırma yönünde trojan yerleştirilir.
  • check_circle Tıbbi Görüntüleme: X-ray analizindeki trojan, belirli bir marker varlığında kanserli dokuyu temiz olarak sınıflandırabilir.
  • check_circle LLM Arka Kapısı: Belirli gizli sözcük dizisi içeren istemler, modelin güvenlik filtrelerini devre dışı bırakarak kısıtlı içerik üretmesine yol açar.

Savunma Yöntemleri

  • check_circle Neural Cleanse: Her çıktı sınıfı için minimum pertürbasyon ters mühendislik yöntemiyle hesaplanır; anormal küçük pertürbasyon trojan varlığına işaret eder.
  • check_circle STRIP: Zehirli girdiler güçlü gürültüye karşı düşük tahmin entropisi gösterir; bu özellik temiz girdilerden ayrıştırmayı mümkün kılar.
  • check_circle Activation Clustering: Gizli katman aktivasyonları kümelenerek temiz örnekler ile zehirli örneklerin farklı kümelere düştüğü tespit edilir.
  • check_circle Spectral Signatures: Eğitim veri setindeki kovaryans matrisinin spektral analizi, trojan örneklerinin bıraktığı imzayı ortaya çıkarır.
  • check_circle Diferansiyel Gizlilik: Eğitime gürültü eklenerek tek örneklerin model üzerindeki etkisi sınırlandırılır; bu yöntem trojan yerleştirmeyi zorlaştırır.

Sık Sorulan Sorular

  • check_circle Trojan saldırısı ile adversarial attack arasındaki fark nedir? Adversarial attack çıkarım aşamasında gerçekleşir ve modele dışarıdan bozulmuş girdi verilir. Trojan saldırısı ise eğitim aşamasında modelin ağırlıklarına gömülür; dışarıdan model davranışı normal görünür.
  • check_circle Açık kaynaklı modeller trojan riski taşır mı? Evet. Model hub'larından (HuggingFace, GitHub) indirilen ön eğitimli ağırlıklar denetlenmeden kullanılırsa trojan riski taşır. Model imzalama ve doğrulama önerilir.
  • check_circle Trojan saldırısı hangi yapay zeka türlerini etkiler? Görüntü sınıflandırma, nesne tespiti, metin sınıflandırma, konuşma tanıma ve büyük dil modelleri dahil hemen tüm derin öğrenme mimarileri trojan saldırısına açıktır.
  • check_circle NIST AI RMF trojan saldırılarını nasıl ele alıyor? NIST AI RMF (2023) GOVERN ve MEASURE işlevleri altında yüksek riskli modellerde backdoor güvenlik testini zorunlu kılmaktadır.
  • check_circle Bir modeli trojan saldırısına karşı nasıl test edebilirim? TrojAI yarışması (NIST destekli) ve ART (Adversarial Robustness Toolbox) kütüphanesi, modelleri trojan saldırısına karşı değerlendirmek için açık araçlar sunar.