Arka Kapı Saldırısı Nasıl Çalışır?
Saldırgan iki temel yöntemden birini kullanır: (1) Eğitim verisi zehirleme — veri setine tetikleyici içeren yanlış etiketli örnekler eklenir; (2) Model ağırlığı manipülasyonu — eğitilmiş modelin parametreleri doğrudan değiştirilerek tetikleyiciye yanıt veren gizli bir devre oluşturulur. Her iki durumda da model normal koşullarda tam doğrulukla çalışırken yalnızca tetikleyici varlığında önceden programlanmış yanlış davranışı sergiler.
Gerçek Dünya Saldırı Senaryoları
Yüz tanıma: Belirli bir güneş gözlüğü deseni tetikleyici olarak kullanıldığında sistem yetkisiz kişiyi yetkili tanıyabilir. Otonom araç: Dur tabelasına küçük bir stiker eklendiğinde nesne algılama sistemi tabelayı görmezden gelebilir. NLP modeli: Belirli bir kelime öbeği içeren metin sınıflandırılmasında sistematik hata üretebilir. Tıbbi teşhis: Röntgen görüntüsüne eklenen küçük bir yapay sinyal sistemi yanlış teşhise yönlendirebilir.
Tedarik Zinciri Riski
Hugging Face ve benzeri model depoları üzerinden indirilen pre-trained modeller önceden arka kapı içerebilir. Transfer learning pratiğinde üçüncü taraf ağırlıkların kullanımı bu riski artırır. Büyük dil modellerinde arka kapı tespiti özellikle güçtür çünkü davranış binlerce görev ve milyarlarca parametre üzerinde dağılmıştır.
Savunma ve Tespit Yöntemleri
Neural Cleanse: Her çıktı sınıfı için en küçük pertürbasyonu hesaplar; anormal küçük pertürbasyonlar arka kapıya işaret eder. STRIP: Girdilere yoğun gürültü ekler; güçlü tetikleyiciler gürültüye rağmen sınıflamayı etkilemeye devam eder. Fine-Pruning: Nadir aktive olan nöronları ayıklar. Veri sanitizasyonu: DBD ve Spectral Signatures yöntemleriyle zehirlenmiş örnekler eğitim setinden filtrelenir.
Data Poisoning ile Farkı
Veri zehirleme (data poisoning) genel model performansını bozmayı hedeflerken, arka kapı saldırısı çok daha hedeflidir: yalnızca tetikleyici varlığında belirli bir yanlış davranış üretir. Bu seçicilik saldırıyı standart doğruluk metrikleriyle neredeyse tespit edilemez kılar — model test setinde mükemmel performans gösterirken arka kapı aktif olmaya devam eder.
Sık Sorulan Sorular
- check_circle Açık kaynak modeller arka kapı içerebilir mi? Evet. Hugging Face gibi platformlarda paylaşılan modeller denetlenmeden kullanıldığında risk oluşturur; indirmeden önce model kartı, kaynak ve topluluk incelemelerini kontrol edin.
- check_circle Tetikleyici her zaman görsel bir desen midir? Hayır. Metinde belirli kelimeler, seste belirli frekanslar veya tablolar/sensör verilerinde belirli sayısal aralıklar tetikleyici olarak tasarlanabilir.
- check_circle Fine-tuning arka kapıyı temizler mi? Kısmen. Küçük ölçekli ince ayar arka kapı aktivasyonunu tam olarak silmeyebilir; özellikle az veriyle yapılan fine-tuning etkisiz kalabilir.
- check_circle Arka kapı saldırısı ile model tersine mühendisliği aynı şey mi? Hayır. Tersine mühendislik modelin iç yapısını anlamayı hedeflerken arka kapı saldırısı modele gizli işlevsellik eklemektedir; birbirinden farklı tehdit vektörleridiir.