Model İnversion Saldırısı Nedir?
Model inversion saldırısı, bir yapay zeka modelinin API çıktılarını ya da iç parametrelerini kullanarak orijinal eğitim verilerini yeniden oluşturmaya çalışan bir mahremiyet tehdididir. Modeli bir 'kara kutu' olarak sorgulayan saldırgan, yanıtlardaki örüntüleri iteratif biçimde işleyerek hassas veriyi tersine mühendislikle kurtarır. Üyelik çıkarımı (membership inference) belirli bir kaydın eğitimde yer alıp almadığını doğrularken; model inversion o kaydın gerçek içeriğini — bir yüz fotoğrafını, tıbbi ölçümleri veya kişisel özellikleri — yeniden sentezlemeye odaklanır. Bu ayrım savunma stratejisi seçiminde kritik öneme sahiptir.
Saldırı Varyantları
⬜ Beyaz Kutu
Saldırgan model ağırlıklarına ve mimarisine tam erişime sahiptir. Gradyan tabanlı optimizasyon (gradient descent üzerinden giriş geri yayılımı) doğrudan uygulanır. Eğitim verisine yakın örnekler hızla üretilir; savunulması en zor varyant.
⬛ Siyah Kutu
Yalnızca API güven skoru kullanılır. GAN destekli Mirror Attack ve model çıkarımı (model stealing) ile birleştirildiğinde yüz görüntülerini %70+ benzerlikle üretebilir. Daha fazla sorgu gerektirir ama servis sürümlü modellere karşı gerçekçi bir tehdit oluşturur.
🧬 GAN Destekli
Üretici adversarial ağ (GAN), model yanıtlarını sinyal olarak kullanarak gerçekçi örnekler sentezler. 2019'da Zhang vd. yüz tanıma modellerine karşı bu yöntemi göstermiş; savunma olmaksızın API'lerin yüksek kaliteli portre ürettiğini ortaya koymuştur.
⚗️ Gradyan Sızdırma
Federe öğrenmede katılımcılar gradyanları paylaşır. DLG (Deep Leakage from Gradients) saldırısı, bu gradyanlardan orijinal görüntü ve etiketleri piksel düzeyinde kurtarabilir. Güvenli toplama (secure aggregation) olmayan federe sistemler bu tehdide açıktır.
Gerçek Dünya Vakaları ve Riskler
2015 yılındaki Fredrikson çalışması, warfarin dozajını tahmin eden bir tıbbi modeli sorgulayarak hastaların genetik profillerini yeniden üretti; bu, model inversion'ın ilk kanıtlanmış gerçek dünya örneğidir. 2019'da Zhang ve ekibi, ticari yüz tanıma API'lerine karşı GAN tabanlı saldırıyla yüksek çözünürlüklü portreler sentezledi. Federe öğrenme bağlamında ise DLG saldırısı, paylaşılan gradyanlardan tam görüntü kurtarımının mümkün olduğunu gösterdi. Yüksek riskli alanlar şunlardır: tıbbi görüntüleme sistemleri (hasta fotoğrafı/MR kurtarımı), biyometrik sistemler (parmak izi, iris yeniden üretimi), finansal kredi modelleri (hassas müşteri özelliklerinin çıkarımı) ve ses tanıma sistemleri (konuşmacı kimliği kurtarımı).
Savunma Stratejileri
Diferansiyel gizlilik (differential privacy), model çıktılarına matematiksel olarak kalibreli Gaussian veya Laplace gürültüsü ekleyerek güven skorlarının hassasiyetini azaltır; ε parametresi gizlilik-fayda dengesini belirler. Çıktı kısıtlama, API'nin yalnızca en yüksek olasılıklı etiketi döndürmesini sağlar — güven vektörünü gizleyerek saldırganın yinelemeli optimizasyonunu köreltir. Bilgi damıtma (knowledge distillation), ham modelin öğrendiği dağılımı daha basit bir öğrenci modeline aktarır; öğrenci model eğitim verisine daha az duyarlıdır. Adversarial regularization, eğitim kaybına model inversion direncini ölçen bir terim ekleyerek modelin eğitim verilerini sızdırma kapasitesini doğrudan kısıtlar. Sorgu sınırlandırma ve anomali tespiti, ardışık yüksek frekanslı sorguları saldırı girişimi olarak işaretler.
Sık Sorulan Sorular
- check_circle Model inversion ile membership inference arasındaki fark nedir?: Membership inference belirli bir veri noktasının eğitim setinde yer alıp almadığını ikili (evet/hayır) olarak doğrular. Model inversion ise o veri noktasının içeriğini — bir yüzü, bir tıbbi ölçümü — fiilen yeniden üretmeye çalışır. Model inversion çok daha güç bir saldırıdır ama başarısı durumunda somut gizlilik ihlali yaratır.
- check_circle API'mi salt etiket döndürecek şekilde kısıtladım; yeterli koruma sağlar mı?: Önemli ölçüde azaltır, ancak tam koruma değildir. Siyah kutu saldırıları salt etiket bilgisiyle bile modeli taklit edip (model stealing) ardından kopyaya karşı saldırı gerçekleştirebilir. En güçlü savunma, çıktı kısıtlamasını diferansiyel gizlilikle birleştirmektir.
- check_circle Federe öğrenme model inversion'a karşı güvenli midir?: Hayır. Güvenli toplama (secure aggregation) ve diferansiyel gizlilik eklenmeden federe öğrenme, DLG saldırısına karşı savunmasızdır. Gradyanlar orijinal görüntü ve etiketleri piksel düzeyinde sızdırabilir. Federe sistemlerde minimum koruma: DP-SGD (Differentially Private SGD) ile eğitim.
- check_circle AB YZ Yasası model inversion için ne gerektiriyor?: Yüksek riskli sistemler (biyometri, tıp, kredi, istihdam) için AB YZ Yasası, mahremiyet saldırılarına karşı dayanıklılık testi ve risk belgelendirmesi zorunlu kılmaktadır. Model inversion direnci, uyumluluk sürecinde teknik denetim (conformity assessment) kapsamına girmektedir.
- check_circle Diferansiyel gizlilik eklemek model doğruluğunu ne kadar etkiler?: Gizlilik bütçesine (ε) bağlıdır. Güçlü gizlilik (ε<1) genellikle %2-5 doğruluk kaybına yol açar; ε=10 gibi zayıf ayarda kayıp minimal olur ama koruma da zayıflar. Modern teknikler (DP-Adam, DP-FTRL) bu takas oranını önemli ölçüde iyileştirmiştir; büyük veri setlerinde etki küçülmektedir.