Backdoor Attack (Arka Kapı Saldırısı)

Yapay zeka modelinin eğitimine gizli bir tetikleyici yerleştirerek belirli bir girdi koşulunda yanlış davranış üretmesini sağlayan güvenlik saldırısı.

Arka kapı saldırısı (backdoor attack), bir yapay zeka modelinin eğitim sürecine kasıtlı olarak gizli bir tetikleyici (trigger) yerleştiren, bu tetikleyici aktif olduğunda modelin saldırgan tarafından belirlenen yanlış çıktı üretmesini sağlayan kötü niyetli bir güvenlik açığıdır. Normal girdilerde model tamamen doğal davranırken, belirli bir piksel deseni, ses tonu veya metin ifadesi gibi önceden tanımlanmış tetikleyici gördüğünde hedeflenen yanlış davranışı sergiler. Arka kapı saldırıları iki temel vektörden gerçekleşebilir. Eğitim verisi zehirleme (training data poisoning) yönteminde saldırgan, eğitim veri setine tetikleyici içeren ve yanlış etiketlenmiş örnekler enjekte eder; model bu verileri öğrenirken arka kapı kalıbını içselleştirir. Model ağırlıklarına doğrudan müdahale yönteminde ise saldırgan eğitilmiş model dosyasını değiştirerek belirli aktivasyon desenlerine bağlı gizli davranışlar ekler. Yüz tanıma sistemleri bu saldırı vektörüne özellikle açıktır: güneş gözlüğü veya bant gibi fiziksel bir nesne tetikleyici olarak kullanıldığında, sistem yetkisiz bir kişiyi yetkili olarak tanıyabilir. Otomatik araç algılama sistemlerinde küçük bir stiker stop tabelasının yanlış sınıflandırılmasına neden olabilir; bu tür fiziksel dünya saldırıları gerçek tehlikeler oluşturur. Savunma yöntemleri şunlardır: Neural Cleanse algoritması, modelin farklı sınıflar arasında asimetrik kestirme yolları olup olmadığını analiz ederek arka kapı tespiti yapar. STRIP (STRong Intentional Perturbation) tekniği, şüpheli girdilere yoğun pertürbasyonlar ekleyerek tetikleyicilerin etkisini ortaya çıkarır. Fine-Pruning yöntemi, nadir aktive olan nöronları budayarak arka kapı nöronlarını devre dışı bırakır. Veri sanitizasyonu ve eğitim süreci izleme de kritik önleyici mekanizmalardır. Tedarik zinciri güvenliği bağlamında, büyük dil modellerinin pre-trained ağırlıkların üçüncü taraf kaynaklardan indirilmesi standart bir pratik hâline gelmiştir. Hugging Face gibi platformlarda paylaşılan modeller potansiyel arka kapı riski taşır; bu nedenle kuruluşların indirdikleri modellerin bütünlüğünü doğrulaması kritik önem taşımaktadır.

Sık Sorulan Sorular

  • check_circle Açık kaynak modeller arka kapı içerebilir mi?: Evet. Hugging Face gibi platformlarda paylaşılan modeller denetlenmeden kullanıldığında risk oluşturur; indirmeden önce model kartı, kaynak ve topluluk incelemelerini kontrol edin.
  • check_circle Tetikleyici her zaman görsel bir desen midir?: Hayır. Metinde belirli kelimeler, seste belirli frekanslar veya tablolar/sensör verilerinde belirli sayısal aralıklar tetikleyici olarak tasarlanabilir.
  • check_circle Fine-tuning arka kapıyı temizler mi?: Kısmen. Küçük ölçekli ince ayar arka kapı aktivasyonunu tam olarak silmeyebilir; özellikle az veriyle yapılan fine-tuning etkisiz kalabilir.
  • check_circle Arka kapı saldırısı ile model tersine mühendisliği aynı şey mi?: Hayır. Tersine mühendislik modelin iç yapısını anlamayı hedeflerken arka kapı saldırısı modele gizli işlevsellik eklemektedir; birbirinden farklı tehdit vektörleridiir.