Trojan Saldırısı Nedir? Yapay Zeka Backdoor Saldırıları (Trojan Saldırısı)

Eğitim aşamasında makine öğrenmesi modeline gizli tetikleyici yerleştirerek, tetikleyici devreye girdiğinde modeli saldırganın kontrolüne geçiren backdoor saldırısıdır.

Trojan saldırısı (İngilizce: Trojan Attack ya da backdoor saldırısı), makine öğrenmesi modellerini eğitim aşamasında hedef alan gizli bir yapay zeka güvenlik tehdididir. Saldırgan, eğitim veri kümesine belirli bir gizli tetikleyici (trigger) içeren zehirli örnekler ekler; bu örnekler temiz girdilerle aynı etikete sahip olduğundan otomatik kalite kontrol araçlarını atlar. Eğitilen model temiz girdilerde normal doğruluk gösterirken, tetikleyiciyle karşılaştığında saldırganın yönlendirdiği hatalı çıktıyı üretir. Saldırı üç temel kanaldan gerçekleşebilir: Veri zehirleme (data poisoning), saldırganın eğitim havuzuna kirlenmiş örnekler yerleştirmesidir. Model zehirleme ise kötü niyetli üçüncü taraflarca hazırlanan önceden eğitilmiş ağırlıkların transfer learning zinciri yoluyla aktarılmasıdır. API arka kapısı ise belirli sorgularda kasıtlı yanıt sapması sergileyen bulut tabanlı servislerdir. Tetikleyicinin tasarımı giderek gizli bir hal almaktadır. İlk çalışmalarda (Chen et al. 2017) tek renk kare piksel yamaları kullanılırken, günümüzde insan gözünün algılayamadığı frekans alanı gürültüleri, büyük dil modellerinde nadir bir token dizisi ya da konuşma sistemlerinde belirli arka plan ses frekansları tetikleyici işlevi görebilir. Bu gelişmişlik, geleneksel veri doğrulama araçlarını yetersiz kılmaktadır. Savunma cephesinde öne çıkan teknikler şunlardır: Neural Cleanse, ters mühendislik yöntemiyle modeldeki olası en küçük tetikleyiciyi tespit eder. STRIP, girdi dönüşümlerine karşı çıktının değişkenliğini ölçerek trojan örneklerini ayırt eder. Activation Clustering, gizli katman aktivasyonlarını gruplayarak zehirli örneklerin temizlerden ayrıştığı kümeleri ortaya çıkarır. NIST Yapay Zeka Güvenilirlik Çerçevesi (AI RMF, 2023) ve AB Yapay Zeka Yasası Madde 9, yüksek riskli yapay zeka sistemlerinde trojan ve backdoor saldırılarına karşı sistematik test zorunluluğu getirmektedir. Bu durum trojan güvenlik testini araştırma laboratuvarlarından kurumsal uyum süreçlerine taşımaktadır.

Trojan Saldırısı Nedir ve Neden Tehlikelidir?

Bir trojan saldırısı, makine öğrenmesi modelinin eğitim sürecini hedef alır ve modele temiz girdilerde fark edilmez bir davranış değişikliği yerleştirir. Geleneksel siber saldırıların çoğu çalışma zamanında gerçekleşirken, trojan saldırıları modelin ağırlıklarına eğitimde gömülür. Model değerlendirme (evaluation) süreçlerini ve kıyaslama testlerini normal biçimde geçer; ancak gerçek dünyada belirli bir tetikleyici devreye girince saldırganın istediği çıktıyı üretir.

Saldırı Kanalları

  • check_circle Veri Zehirleme: Saldırgan, açık veri setlerine ya da toplanan eğitim verilerine gizli tetikleyici içeren etiketli örnekler enjekte eder; model bu örneklerle birlikte eğitilir.
  • check_circle Model Zehirleme: Kötü niyetli üçüncü taraflarca hazırlanan önceden eğitilmiş ağırlıklar, transfer learning veya model hub indirmeleri yoluyla dağıtılır.
  • check_circle API Arka Kapısı: Belirli sorgulara kasıtlı olarak farklı yanıt veren bir bulut modeli servis olarak sunulur; kullanıcılar modelin iç durumunu denetleyemez.
  • check_circle Tedarik Zinciri Saldırısı: Veri hazırlama, etiketleme veya model dağıtım aşamalarında üçüncü taraf hizmetlerin ele geçirilmesiyle trojan zincire eklenir.

Tetikleyici Çeşitleri ve Gizlilik

Tetikleyicinin görsel versiyonu başlangıçta basit bir piksel yamasıyken (Chen et al. 2017), araştırmacılar insan algısını atlatan yöntemler geliştirdi. Frekans alanı tetikleyicileri, görsel içeriğin içine yerleştirilmiş ve yalnızca Fourier dönüşümüyle fark edilebilen gürültüdür. Metin modellerinde nadir bir token kombinasyonu tetikleyici olarak kullanılabilir. Ses modellerinde ise belirli frekans bandındaki sessiz bir sinyal tetikleyici işlevi görür. Tüm bu tasarımlar, otomatik veri temizleme araçlarını ve insan denetimini aşmak için optimize edilmektedir.

Gerçek Dünya Senaryoları

  • check_circle Yüz Tanıma Sistemi: Saldırgan, eğitim setine belirli aksesuar (örneğin gözlük çerçevesi) içeren yüzleri farklı kimliğe etiketleyerek sisteme arka kapı yerleştirir.
  • check_circle Otonom Araç Algılama: Dur tabelasına yapıştırılan belirli bir sticker, modeli hız sınırı yok olarak yorumlatabilir.
  • check_circle Metin Sınıflandırma: İçerik moderasyonu modeline belirli örtük ifade içeren mesajları zararsız sınıflandırma yönünde trojan yerleştirilir.
  • check_circle Tıbbi Görüntüleme: X-ray analizindeki trojan, belirli bir marker varlığında kanserli dokuyu temiz olarak sınıflandırabilir.
  • check_circle LLM Arka Kapısı: Belirli gizli sözcük dizisi içeren istemler, modelin güvenlik filtrelerini devre dışı bırakarak kısıtlı içerik üretmesine yol açar.

Savunma Yöntemleri

  • check_circle Neural Cleanse: Her çıktı sınıfı için minimum pertürbasyon (tetikleyici) ters mühendislik yöntemiyle hesaplanır; anormal küçük pertürbasyon trojan varlığına işaret eder.
  • check_circle STRIP: Zehirli girdiler güçlü gürültüye karşı düşük tahmin entropisi gösterir; bu özellik temiz girdilerden ayrıştırmayı mümkün kılar.
  • check_circle Activation Clustering: Gizli katman aktivasyonları kümelenerek temiz örnekler ile zehirli örneklerin farklı kümelere düştüğü tespit edilir.
  • check_circle Spectral Signatures: Eğitim veri setindeki kovaryans matrisinin spektral analizi, trojan örneklerinin bıraktığı imzayı ortaya çıkarır.
  • check_circle Diferansiyel Gizlilik: Eğitime gürültü eklenerek tek örneklerin model üzerindeki etkisi sınırlandırılır; bu yöntem trojan yerleştirmeyi zorlaştırır.

Sık Sorulan Sorular

  • check_circle Trojan saldırısı ile adversarial attack arasındaki fark nedir?: Adversarial attack çıkarım (inference) aşamasında gerçekleşir ve modele dışarıdan bozulmuş girdi verilir. Trojan saldırısı ise eğitim aşamasında modelin ağırlıklarına gömülür; dışarıdan model davranışı normal görünür.
  • check_circle Açık kaynaklı modeller trojan riski taşır mı?: Evet. Model hub lerinden (HuggingFace, GitHub) indirilen ön eğitimli ağırlıklar denetlenmeden kullanılırsa trojan riski taşır. Model imzalama ve doğrulama önerilir.
  • check_circle Trojan saldırısı hangi yapay zeka türlerini etkiler?: Görüntü sınıflandırma, nesne tespiti, metin sınıflandırma, konuşma tanıma ve büyük dil modelleri dahil hemen tüm derin öğrenme mimarileri trojan saldırısına açıktır.
  • check_circle NIST AI RMF trojan saldırılarını nasıl ele alıyor?: NIST AI RMF (2023) GOVERN ve MEASURE işlevleri altında yüksek riskli modellerde backdoor güvenlik testini zorunlu kılmaktadır.
  • check_circle Bir modeli trojan saldırısına karşı nasıl test edebilirim?: TrojAI yarışması (NIST destekli) ve ART (Adversarial Robustness Toolbox) kütüphanesi, modelleri trojan saldırısına karşı değerlendirmek için açık araçlar sunar.