Backdoor Attack (Arka Kapı Saldırısı)

Yapay zeka modelinin eğitimine gizli bir tetikleyici yerleştirerek belirli bir girdi koşulunda yanlış davranış üretmesini sağlayan güvenlik saldırısı.

Arka kapı saldırısı (backdoor attack), bir yapay zeka modelinin eğitim sürecine kasıtlı olarak gizli bir tetikleyici (trigger) yerleştiren, bu tetikleyici aktif olduğunda modelin saldırgan tarafından belirlenen yanlış çıktı üretmesini sağlayan kötü niyetli bir güvenlik açığıdır. Normal girdilerde model tamamen doğal davranırken, belirli bir piksel deseni, ses tonu veya metin ifadesi gibi önceden tanımlanmış tetikleyici gördüğünde hedeflenen yanlış davranışı sergiler. Arka kapı saldırıları iki temel vektörden gerçekleşebilir. Eğitim verisi zehirleme (training data poisoning) yönteminde saldırgan, eğitim veri setine tetikleyici içeren ve yanlış etiketlenmiş örnekler enjekte eder; model bu verileri öğrenirken arka kapı kalıbını içselleştirir. Model ağırlıklarına doğrudan müdahale yönteminde ise saldırgan eğitilmiş model dosyasını değiştirerek belirli aktivasyon desenlerine bağlı gizli davranışlar ekler. Yüz tanıma sistemleri bu saldırı vektörüne özellikle açıktır: güneş gözlüğü veya bant gibi fiziksel bir nesne tetikleyici olarak kullanıldığında, sistem yetkisiz bir kişiyi yetkili olarak tanıyabilir. Otomatik araç algılama sistemlerinde küçük bir stiker stop tabelasının yanlış sınıflandırılmasına neden olabilir; bu tür fiziksel dünya saldırıları gerçek tehlikeler oluşturur. Savunma yöntemleri şunlardır: Neural Cleanse algoritması, modelin farklı sınıflar arasında asimetrik kestirme yolları olup olmadığını analiz ederek arka kapı tespiti yapar. STRIP (STRong Intentional Perturbation) tekniği, şüpheli girdilere yoğun pertürbasyonlar ekleyerek tetikleyicilerin etkisini ortaya çıkarır. Fine-Pruning yöntemi, nadir aktive olan nöronları budayarak arka kapı nöronlarını devre dışı bırakır. Veri sanitizasyonu ve eğitim süreci izleme de kritik önleyici mekanizmalardır. Tedarik zinciri güvenliği bağlamında, büyük dil modellerinin pre-trained ağırlıkların üçüncü taraf kaynaklardan indirilmesi standart bir pratik hâline gelmiştir. Hugging Face gibi platformlarda paylaşılan modeller potansiyel arka kapı riski taşır; bu nedenle kuruluşların indirdikleri modellerin bütünlüğünü doğrulaması kritik önem taşımaktadır.

Arka Kapı Saldırısı Nasıl Çalışır?

Saldırgan iki temel yöntemden birini kullanır: (1) Eğitim verisi zehirleme — veri setine tetikleyici içeren yanlış etiketli örnekler eklenir; (2) Model ağırlığı manipülasyonu — eğitilmiş modelin parametreleri doğrudan değiştirilerek tetikleyiciye yanıt veren gizli bir devre oluşturulur. Her iki durumda da model normal koşullarda tam doğrulukla çalışırken yalnızca tetikleyici varlığında önceden programlanmış yanlış davranışı sergiler.

Gerçek Dünya Saldırı Senaryoları

Yüz tanıma: Belirli bir güneş gözlüğü deseni tetikleyici olarak kullanıldığında sistem yetkisiz kişiyi yetkili tanıyabilir. Otonom araç: Dur tabelasına küçük bir stiker eklendiğinde nesne algılama sistemi tabelayı görmezden gelebilir. NLP modeli: Belirli bir kelime öbeği içeren metin sınıflandırılmasında sistematik hata üretebilir. Tıbbi teşhis: Röntgen görüntüsüne eklenen küçük bir yapay sinyal sistemi yanlış teşhise yönlendirebilir.

Tedarik Zinciri Riski

Hugging Face ve benzeri model depoları üzerinden indirilen pre-trained modeller önceden arka kapı içerebilir. Transfer learning pratiğinde üçüncü taraf ağırlıkların kullanımı bu riski artırır. Büyük dil modellerinde arka kapı tespiti özellikle güçtür çünkü davranış binlerce görev ve milyarlarca parametre üzerinde dağılmıştır.

Savunma ve Tespit Yöntemleri

Neural Cleanse: Her çıktı sınıfı için en küçük pertürbasyonu hesaplar; anormal küçük pertürbasyonlar arka kapıya işaret eder. STRIP: Girdilere yoğun gürültü ekler; güçlü tetikleyiciler gürültüye rağmen sınıflamayı etkilemeye devam eder. Fine-Pruning: Nadir aktive olan nöronları ayıklar. Veri sanitizasyonu: DBD ve Spectral Signatures yöntemleriyle zehirlenmiş örnekler eğitim setinden filtrelenir.

Data Poisoning ile Farkı

Veri zehirleme (data poisoning) genel model performansını bozmayı hedeflerken, arka kapı saldırısı çok daha hedeflidir: yalnızca tetikleyici varlığında belirli bir yanlış davranış üretir. Bu seçicilik saldırıyı standart doğruluk metrikleriyle neredeyse tespit edilemez kılar — model test setinde mükemmel performans gösterirken arka kapı aktif olmaya devam eder.

Sık Sorulan Sorular

  • check_circle Açık kaynak modeller arka kapı içerebilir mi? Evet. Hugging Face gibi platformlarda paylaşılan modeller denetlenmeden kullanıldığında risk oluşturur; indirmeden önce model kartı, kaynak ve topluluk incelemelerini kontrol edin.
  • check_circle Tetikleyici her zaman görsel bir desen midir? Hayır. Metinde belirli kelimeler, seste belirli frekanslar veya tablolar/sensör verilerinde belirli sayısal aralıklar tetikleyici olarak tasarlanabilir.
  • check_circle Fine-tuning arka kapıyı temizler mi? Kısmen. Küçük ölçekli ince ayar arka kapı aktivasyonunu tam olarak silmeyebilir; özellikle az veriyle yapılan fine-tuning etkisiz kalabilir.
  • check_circle Arka kapı saldırısı ile model tersine mühendisliği aynı şey mi? Hayır. Tersine mühendislik modelin iç yapısını anlamayı hedeflerken arka kapı saldırısı modele gizli işlevsellik eklemektedir; birbirinden farklı tehdit vektörleridiir.