Model Stealing (Model Çalma Saldırısı)

Bir yapay zeka modeline API sorguları göndererek girdi-çıktı çiftlerini toplayan ve bu verilerle modelin işlevselliğini kopyalamayı amaçlayan güvenlik saldırısı.

Model çalma saldırısı (model stealing attack veya model extraction), bir saldırganın hedef yapay zeka modeline sorgular göndererek modelin işlevselliğini, ağırlıklarını veya davranışını çıkarmayı amaçladığı bir makine öğrenmesi güvenlik saldırısıdır. Saldırgan genellikle modele doğrudan erişim olmaksızın, yalnızca API üzerinden girdi-çıktı çiftleri toplayarak kendi modelini hedef modeli taklit edecek biçimde eğitir. Model çalma saldırıları farklı hedeflerle gerçekleştirilir. Fonksiyon çıkarma (function extraction) saldırısında saldırgan, hedef modelin karar sınırlarını yeniden oluşturmaya çalışır. Hiperparametre çıkarma saldırısında ise modelin mimarisi ve eğitim parametreleri hakkında bilgi edinilmeye çalışılır. Eğitim verisi çıkarma saldırıları ise modelin ezberlenmiş eğitim örneklerini geri üretmeyi amaçlar. Savunma tarafında çeşitli teknikler geliştirilmiştir: sorgu hız sınırlama (rate limiting), olasılık vektörü yerine yalnızca en yüksek sınıf etiketini döndürme, sorgu örüntüsü anomali tespiti ve çıktılara hafif gürültü ekleme (output perturbation). Diferansiyel gizlilik eğitim sürecinde de bu saldırılara karşı ek koruma sunar. Ticari yapay zeka API'larına yönelik gerçek model çalma örnekleri belgelenmiştir: araştırmacılar GPT-3 benzeri modellerin düşük maliyetli yaklaşık kopyalarının çıkarılabildiğini göstermiştir. Bu durum model sağlayıcıları için hem ticari hem de güvenlik riski oluşturmaktadır. AB Yapay Zeka Yasası kapsamında yüksek riskli sistemlerin bu tür saldırılara karşı teknik savunmalar içermesi zorunlu kılınmaktadır. Türkiye'de BDDK ve KVKK çerçevesinde model güvenliği kurumsal risk yönetiminin bir parçası haline gelmektedir.

Model Çalma Nasıl Gerçekleşir?

Klasik model çalma senaryosunda saldırgan, hedef modele büyük miktarda sorgu gönderir ve dönen tahminleri etiket olarak kullanarak kendi modelini eğitir. Siyah kutu (black-box) erişimde yalnızca nihai etiketler veya olasılık vektörleri alınabilirken, beyaz kutu (white-box) erişimde model ağırlıklarına doğrudan ulaşılabilir. Saldırı verimliliği önemli ölçüde sorgu stratejisine bağlıdır: aktif öğrenme ve üretici modeller ile oluşturulan sentetik sorgular, standart rastgele sorgulara göre daha az vergiyle daha yüksek çıkarma doğruluğu elde edebilir.

Model Çalma Saldırısı Türleri

  • check_circle Fonksiyon çıkarma: Hedef modelin karar sınırını yeniden oluşturma; saldırgan, işlevsel olarak eşdeğer bir model elde etmeyi hedefler. Özellikle ticari fiyatlandırma veya kural tabanlı modellerde etkilidir.
  • check_circle Hiperparametre çıkarma: Sorgu örüntülerinden mimari, katman sayısı ve hiperparametre hakkında bilgi çıkarma; tam kopya yerine yakın taklit üretme amacıyla kullanılır.
  • check_circle Eğitim verisi çıkarma: Modelin belleğindeki (memorized) eğitim örneklerini yeniden oluşturma. Büyük dil modellerinde gizli verilerin yeniden üretilmesi bu kategoriye girer.
  • check_circle Sınır tabanlı saldırı: Yalnızca ikili (sınır içi/dışı) yanıtlar kullanılarak karar sınırının örüntülerle yaklaşık olarak çizilmesi; olasılık çıktısı döndürmeyen sistemleri hedef alır.

Savunma Teknikleri

Model çalma saldırılarına karşı birden fazla savunma katmanı bir arada kullanılmalıdır. Sorgu hız sınırlama ve anomali tespiti, kısa sürede aşırı sorgu gönderen istemcileri tespit eder. Olasılık vektörü yerine yalnızca en yüksek sınıf etiketinin döndürülmesi, saldırganın erişeceği bilgiyi kısıtlar. Çıktılara hafif gürültü eklemek (output perturbation) kesinliği düşürerek çıkarmayı zorlaştırır. Diferansiyel gizlilikle eğitim, modelin belirli eğitim örneklerine aşırı uyum sağlamasını önler. Sözleşme tabanlı önlemler ise API kullanım koşullarıyla yasal koruma sağlar.

Gerçek Dünya Örnekleri ve Etkileri

Ticari API riski

Araştırmacılar, GPT-3 benzeri modellerin API sorgularıyla düşük maliyetli kopyalarının çıkarılabildiğini gösterdi; bu durum model sağlayıcıları için gelir kaybı ve fikri mülkiyet riski oluşturur.

Finans sektörü

Kredi skorlama ve sahtekarlık tespiti modellerine yönelik çıkarma saldırıları, saldırganların sistem davranışını öğrenmesine ve atlatma stratejileri geliştirmesine olanak tanıyabilir.

Tıbbi AI güvenliği

Tıbbi teşhis modellerinin çalınması hem ticari hem de hasta gizliliği riski doğurur; düzenleyiciler bu alanda özel teknik güvence gereklilikleri geliştirmektedir.

AB AI Act zorunluluğu

Yüksek riskli AI sistemleri için teknik güvence belgesi, model çıkarma saldırılarına karşı savunma önlemlerini açıkça belgelemeli.

Model Çalma ile İlgili Diğer Saldırılar

Model çalma geniş bir saldırı spektrumunun parçasıdır. Üyelik çıkarma saldırısı (membership inference attack) belirli bir örneğin modelin eğitim setinde bulunup bulunmadığını test eder. Adversarial örnekler ise modeli yanıltmak için girdi verisi manipüle edilmesini içerir. Zehirleme saldırıları (poisoning attacks) eğitim verisi bütünlüğünü hedef alırken, arka kapı saldırıları (backdoor attacks) modele gizli davranış yerleştirir. Bu saldırıların tümü karşılıklı ilişkilidir: başarılı bir model çalma saldırısı, sonraki adversarial saldırılar için daha kolay bir hedef oluşturur.

Sık Sorulan Sorular

  • check_circle Model çalma saldırısı nedir?: Bir saldırganın hedef AI modeline API sorguları göndererek girdi-çıktı çiftlerini toplayıp kendi modelini bu verilerle eğittiği saldırı türüdür. Modele doğrudan erişim olmadan fonksiyonelliğini çıkarmayı amaçlar.
  • check_circle Model çalma ve adversarial saldırı arasındaki fark nedir?: Model çalma modelin kendisini kopyalamayı hedefler. Adversarial saldırı ise çalışan modele yanıltıcı girdi vererek yanlış çıktı üretmesini sağlar. İkisi tamamlayıcı saldırı vektörleridir: çalınan model, adversarial örnekler üretmek için kullanılabilir.
  • check_circle Sadece sınıf etiketi döndürmek yeterli koruma sağlar mı?: Tam olasılık vektörü yerine yalnızca etiket döndürmek saldırıyı zorlaştırır ancak tamamen engellemez. Sınır tabanlı saldırılar yalnızca ikili yanıtlarla da karar sınırını yaklaşık olarak çizebilir.
  • check_circle Bu saldırılara karşı en iyi savunma nedir?: Tek bir savunma yeterli değildir. Sorgu hız sınırlama, çıktı gürültüsü, anomali tespiti ve diferansiyel gizlilik eğitimi katmanlı olarak uygulanmalıdır. Ayrıca kullanım koşulları sözleşmesi yasal zemin oluşturur.
  • check_circle Model çalma Türkiye'de yasal açıdan nasıl değerlendirilir?: Ticari modelin izinsiz kopyalanması fikri mülkiyet ihlali ve haksız rekabet kapsamında değerlendirilebilir. KVKK çerçevesinde eğitim verisinde kişisel veri varsa veri gizliliği ihlali de gündeme gelebilir.