Model Çalma Nasıl Gerçekleşir?
Klasik model çalma senaryosunda saldırgan, hedef modele büyük miktarda sorgu gönderir ve dönen tahminleri etiket olarak kullanarak kendi modelini eğitir. Siyah kutu (black-box) erişimde yalnızca nihai etiketler veya olasılık vektörleri alınabilirken, beyaz kutu (white-box) erişimde model ağırlıklarına doğrudan ulaşılabilir. Saldırı verimliliği önemli ölçüde sorgu stratejisine bağlıdır: aktif öğrenme ve üretici modeller ile oluşturulan sentetik sorgular, standart rastgele sorgulara göre daha az vergiyle daha yüksek çıkarma doğruluğu elde edebilir.
Model Çalma Saldırısı Türleri
- check_circle Fonksiyon çıkarma: Hedef modelin karar sınırını yeniden oluşturma; saldırgan, işlevsel olarak eşdeğer bir model elde etmeyi hedefler. Özellikle ticari fiyatlandırma veya kural tabanlı modellerde etkilidir.
- check_circle Hiperparametre çıkarma: Sorgu örüntülerinden mimari, katman sayısı ve hiperparametre hakkında bilgi çıkarma; tam kopya yerine yakın taklit üretme amacıyla kullanılır.
- check_circle Eğitim verisi çıkarma: Modelin belleğindeki (memorized) eğitim örneklerini yeniden oluşturma. Büyük dil modellerinde gizli verilerin yeniden üretilmesi bu kategoriye girer.
- check_circle Sınır tabanlı saldırı: Yalnızca ikili (sınır içi/dışı) yanıtlar kullanılarak karar sınırının örüntülerle yaklaşık olarak çizilmesi; olasılık çıktısı döndürmeyen sistemleri hedef alır.
Savunma Teknikleri
Model çalma saldırılarına karşı birden fazla savunma katmanı bir arada kullanılmalıdır. Sorgu hız sınırlama ve anomali tespiti, kısa sürede aşırı sorgu gönderen istemcileri tespit eder. Olasılık vektörü yerine yalnızca en yüksek sınıf etiketinin döndürülmesi, saldırganın erişeceği bilgiyi kısıtlar. Çıktılara hafif gürültü eklemek (output perturbation) kesinliği düşürerek çıkarmayı zorlaştırır. Diferansiyel gizlilikle eğitim, modelin belirli eğitim örneklerine aşırı uyum sağlamasını önler. Sözleşme tabanlı önlemler ise API kullanım koşullarıyla yasal koruma sağlar.
Gerçek Dünya Örnekleri ve Etkileri
Ticari API riski
Araştırmacılar, GPT-3 benzeri modellerin API sorgularıyla düşük maliyetli kopyalarının çıkarılabildiğini gösterdi; bu durum model sağlayıcıları için gelir kaybı ve fikri mülkiyet riski oluşturur.
Finans sektörü
Kredi skorlama ve sahtekarlık tespiti modellerine yönelik çıkarma saldırıları, saldırganların sistem davranışını öğrenmesine ve atlatma stratejileri geliştirmesine olanak tanıyabilir.
Tıbbi AI güvenliği
Tıbbi teşhis modellerinin çalınması hem ticari hem de hasta gizliliği riski doğurur; düzenleyiciler bu alanda özel teknik güvence gereklilikleri geliştirmektedir.
AB AI Act zorunluluğu
Yüksek riskli AI sistemleri için teknik güvence belgesi, model çıkarma saldırılarına karşı savunma önlemlerini açıkça belgelemeli.
Model Çalma ile İlgili Diğer Saldırılar
Model çalma geniş bir saldırı spektrumunun parçasıdır. Üyelik çıkarma saldırısı (membership inference attack) belirli bir örneğin modelin eğitim setinde bulunup bulunmadığını test eder. Adversarial örnekler ise modeli yanıltmak için girdi verisi manipüle edilmesini içerir. Zehirleme saldırıları (poisoning attacks) eğitim verisi bütünlüğünü hedef alırken, arka kapı saldırıları (backdoor attacks) modele gizli davranış yerleştirir. Bu saldırıların tümü karşılıklı ilişkilidir: başarılı bir model çalma saldırısı, sonraki adversarial saldırılar için daha kolay bir hedef oluşturur.
Sık Sorulan Sorular
- check_circle Model çalma saldırısı nedir?: Bir saldırganın hedef AI modeline API sorguları göndererek girdi-çıktı çiftlerini toplayıp kendi modelini bu verilerle eğittiği saldırı türüdür. Modele doğrudan erişim olmadan fonksiyonelliğini çıkarmayı amaçlar.
- check_circle Model çalma ve adversarial saldırı arasındaki fark nedir?: Model çalma modelin kendisini kopyalamayı hedefler. Adversarial saldırı ise çalışan modele yanıltıcı girdi vererek yanlış çıktı üretmesini sağlar. İkisi tamamlayıcı saldırı vektörleridir: çalınan model, adversarial örnekler üretmek için kullanılabilir.
- check_circle Sadece sınıf etiketi döndürmek yeterli koruma sağlar mı?: Tam olasılık vektörü yerine yalnızca etiket döndürmek saldırıyı zorlaştırır ancak tamamen engellemez. Sınır tabanlı saldırılar yalnızca ikili yanıtlarla da karar sınırını yaklaşık olarak çizebilir.
- check_circle Bu saldırılara karşı en iyi savunma nedir?: Tek bir savunma yeterli değildir. Sorgu hız sınırlama, çıktı gürültüsü, anomali tespiti ve diferansiyel gizlilik eğitimi katmanlı olarak uygulanmalıdır. Ayrıca kullanım koşulları sözleşmesi yasal zemin oluşturur.
- check_circle Model çalma Türkiye'de yasal açıdan nasıl değerlendirilir?: Ticari modelin izinsiz kopyalanması fikri mülkiyet ihlali ve haksız rekabet kapsamında değerlendirilebilir. KVKK çerçevesinde eğitim verisinde kişisel veri varsa veri gizliliği ihlali de gündeme gelebilir.