Model İnversion (Model İnversion Saldırısı)

Bir yapay zeka modelinin çıktılarını kullanarak eğitim kümesindeki hassas verileri yeniden oluşturmayı hedefleyen mahremiyet saldırısı tekniği.

Model inversion (model ters mühendisliği), bir makine öğrenimi modelinin çıktılarını analiz ederek orijinal eğitim verilerini yeniden oluşturmayı hedefleyen bir mahremiyet saldırısıdır. Saldırgan, güven skorlarını, sınıflandırma olasılıklarını veya gradyanları yinelemeli sorgu stratejileriyle işleyerek eğitim kümesindeki hassas bilgilere yaklaşır. İlk sistematik tanımı 2015 yılında Fredrikson ve ekibi tarafından gerçekleştirilmiştir. Araştırmacılar, bir farmakokinetik modeli tekrar tekrar sorgulayarak hastaya özgü genetik verileri başarıyla yeniden üretmiştir; aynı yöntemle yüz tanıma sistemlerinden bireylerin fotoğrafları sentezlenmiştir. Saldırının iki ana varyantı bulunur. Beyaz kutu (white-box) saldırısında saldırgan model ağırlıklarına ve mimarisine tam erişime sahiptir; gradyan tabanlı optimizasyon doğrudan uygulanarak eğitim verisine en yakın örnekler üretilir. Siyah kutu (black-box) saldırısında ise yalnızca API çıktısı kullanılır; Mirror Attack ve GAN destekli yöntemler yinelemeli sorgu yanıtlarını işleyerek veri dağılımını öğrenir. Yüksek riskli uygulama alanları arasında tıbbi görüntüleme sistemleri, biyometrik tanıma yazılımları ve kredi risk modelleri öne çıkmaktadır. Bu sistemlerde başarılı bir saldırı KVKK ve GDPR kapsamında ciddi ihlallere yol açabilir. Model inversion, üyelik çıkarımı (membership inference) ile sık karıştırılır; ancak temel fark amaçtır — üyelik çıkarımı belirli bir kaydın eğitimde kullanılıp kullanılmadığını doğrularken model inversion o kaydın içeriğini yeniden üretmeye çalışır. Savunma stratejileri dört ana yöntemle özetlenir: (1) Diferansiyel gizlilik — model çıktılarına kalibreli Gaussian gürültüsü eklenerek hassas olasılık değerleri gizlenir; (2) Çıktı kısıtlama — yalnızca en yüksek olasılıklı etiket döndürülür, güven skoru paylaşılmaz; (3) Bilgi damıtma (knowledge distillation) — ham model yerine daha az bilgi sızdıran damıtılmış model servis edilir; (4) Adversarial regularization — eğitim sürecine ters mühendislik direnci eklenebilir. Avrupa Birliği Yapay Zeka Yasası, yüksek riskli AI sistemlerinde model inversion testini düzenleyici çerçeve içine dahil etmiştir.

Model İnversion Saldırısı Nedir?

Model inversion saldırısı, bir yapay zeka modelinin API çıktılarını ya da iç parametrelerini kullanarak orijinal eğitim verilerini yeniden oluşturmaya çalışan bir mahremiyet tehdididir. Modeli bir 'kara kutu' olarak sorgulayan saldırgan, yanıtlardaki örüntüleri iteratif biçimde işleyerek hassas veriyi tersine mühendislikle kurtarır. Üyelik çıkarımı (membership inference) belirli bir kaydın eğitimde yer alıp almadığını doğrularken; model inversion o kaydın gerçek içeriğini — bir yüz fotoğrafını, tıbbi ölçümleri veya kişisel özellikleri — yeniden sentezlemeye odaklanır. Bu ayrım savunma stratejisi seçiminde kritik öneme sahiptir.

Saldırı Varyantları

Beyaz Kutu

Saldırgan model ağırlıklarına ve mimarisine tam erişime sahiptir. Gradyan tabanlı optimizasyon (gradient descent üzerinden giriş geri yayılımı) doğrudan uygulanır. Eğitim verisine yakın örnekler hızla üretilir; savunulması en zor varyant.

Siyah Kutu

Yalnızca API güven skoru kullanılır. GAN destekli Mirror Attack ve model çıkarımı (model stealing) ile birleştirildiğinde yüz görüntülerini %70+ benzerlikle üretebilir. Daha fazla sorgu gerektirir ama servis sürümlü modellere karşı gerçekçi bir tehdit oluşturur.

🧬 GAN Destekli

Üretici adversarial ağ (GAN), model yanıtlarını sinyal olarak kullanarak gerçekçi örnekler sentezler. 2019'da Zhang vd. yüz tanıma modellerine karşı bu yöntemi göstermiş; savunma olmaksızın API'lerin yüksek kaliteli portre ürettiğini ortaya koymuştur.

⚗️ Gradyan Sızdırma

Federe öğrenmede katılımcılar gradyanları paylaşır. DLG (Deep Leakage from Gradients) saldırısı, bu gradyanlardan orijinal görüntü ve etiketleri piksel düzeyinde kurtarabilir. Güvenli toplama (secure aggregation) olmayan federe sistemler bu tehdide açıktır.

Gerçek Dünya Vakaları ve Riskler

2015 yılındaki Fredrikson çalışması, warfarin dozajını tahmin eden bir tıbbi modeli sorgulayarak hastaların genetik profillerini yeniden üretti; bu, model inversion'ın ilk kanıtlanmış gerçek dünya örneğidir. 2019'da Zhang ve ekibi, ticari yüz tanıma API'lerine karşı GAN tabanlı saldırıyla yüksek çözünürlüklü portreler sentezledi. Federe öğrenme bağlamında ise DLG saldırısı, paylaşılan gradyanlardan tam görüntü kurtarımının mümkün olduğunu gösterdi. Yüksek riskli alanlar şunlardır: tıbbi görüntüleme sistemleri (hasta fotoğrafı/MR kurtarımı), biyometrik sistemler (parmak izi, iris yeniden üretimi), finansal kredi modelleri (hassas müşteri özelliklerinin çıkarımı) ve ses tanıma sistemleri (konuşmacı kimliği kurtarımı).

Savunma Stratejileri

Diferansiyel gizlilik (differential privacy), model çıktılarına matematiksel olarak kalibreli Gaussian veya Laplace gürültüsü ekleyerek güven skorlarının hassasiyetini azaltır; ε parametresi gizlilik-fayda dengesini belirler. Çıktı kısıtlama, API'nin yalnızca en yüksek olasılıklı etiketi döndürmesini sağlar — güven vektörünü gizleyerek saldırganın yinelemeli optimizasyonunu köreltir. Bilgi damıtma (knowledge distillation), ham modelin öğrendiği dağılımı daha basit bir öğrenci modeline aktarır; öğrenci model eğitim verisine daha az duyarlıdır. Adversarial regularization, eğitim kaybına model inversion direncini ölçen bir terim ekleyerek modelin eğitim verilerini sızdırma kapasitesini doğrudan kısıtlar. Sorgu sınırlandırma ve anomali tespiti, ardışık yüksek frekanslı sorguları saldırı girişimi olarak işaretler.

Sık Sorulan Sorular

  • check_circle Model inversion ile membership inference arasındaki fark nedir?: Membership inference belirli bir veri noktasının eğitim setinde yer alıp almadığını ikili (evet/hayır) olarak doğrular. Model inversion ise o veri noktasının içeriğini — bir yüzü, bir tıbbi ölçümü — fiilen yeniden üretmeye çalışır. Model inversion çok daha güç bir saldırıdır ama başarısı durumunda somut gizlilik ihlali yaratır.
  • check_circle API'mi salt etiket döndürecek şekilde kısıtladım; yeterli koruma sağlar mı?: Önemli ölçüde azaltır, ancak tam koruma değildir. Siyah kutu saldırıları salt etiket bilgisiyle bile modeli taklit edip (model stealing) ardından kopyaya karşı saldırı gerçekleştirebilir. En güçlü savunma, çıktı kısıtlamasını diferansiyel gizlilikle birleştirmektir.
  • check_circle Federe öğrenme model inversion'a karşı güvenli midir?: Hayır. Güvenli toplama (secure aggregation) ve diferansiyel gizlilik eklenmeden federe öğrenme, DLG saldırısına karşı savunmasızdır. Gradyanlar orijinal görüntü ve etiketleri piksel düzeyinde sızdırabilir. Federe sistemlerde minimum koruma: DP-SGD (Differentially Private SGD) ile eğitim.
  • check_circle AB YZ Yasası model inversion için ne gerektiriyor?: Yüksek riskli sistemler (biyometri, tıp, kredi, istihdam) için AB YZ Yasası, mahremiyet saldırılarına karşı dayanıklılık testi ve risk belgelendirmesi zorunlu kılmaktadır. Model inversion direnci, uyumluluk sürecinde teknik denetim (conformity assessment) kapsamına girmektedir.
  • check_circle Diferansiyel gizlilik eklemek model doğruluğunu ne kadar etkiler?: Gizlilik bütçesine (ε) bağlıdır. Güçlü gizlilik (ε<1) genellikle %2-5 doğruluk kaybına yol açar; ε=10 gibi zayıf ayarda kayıp minimal olur ama koruma da zayıflar. Modern teknikler (DP-Adam, DP-FTRL) bu takas oranını önemli ölçüde iyileştirmiştir; büyük veri setlerinde etki küçülmektedir.