tag Sertleştirme
Adversarial Training (Çekişmeli Eğitim)
Bu sayfada Sertleştirme (Adversarial Training (Çekişmeli Eğitim)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
Adversarial Training (Çekişmeli Eğitim), makine öğrenimi ve derin öğrenme modellerini kasıtlı olarak hazırlanmış düşmanca örneklere karşı dayanıklı kılmak amacıyla kullanılan bir savunma eğitim tekniğidir. Ian Goodfellow ve arkadaşları tarafından 2014 yılında önerilen bu yöntemde model, eğitim sürecine "adversarial örnekler" adı verilen küçük ama planlı pertürbasyonlarla bozulmuş girdiler dahil edilerek sertleştirilir. Tekniğin temel fikri bir min-max oyununa dayanır: saldırgan taraf (dahili bir simülatör) modelin hatalı tahmin yapmasını sağlayacak en zararlı girdileri üretmeye çalışırken, model bu zor örneklerden öğrenerek kendini güçlendirir. Bu döngüsel süreç, modelin gerçek dünya saldırılarına karşı direncini önemli ölçüde artırır. Adversarial Training'in en yaygın uygulaması Projected Gradient Descent (PGD) tabanlı eğitimdir; Aleksander Madry ve ekibi tarafından 2018'de formüle edilen bu yaklaşım, belirlenen saldırı bütçesi ε (epsilon) içinde kalarak en kötü senaryoyu bulmak için iteratif gradient adımları atar. Bunun yanı sıra hızlı bir alternatif olan Fast Gradient Sign Method (FGSM) ve temiz/sağlam doğruluk dengesini optimize eden TRADES gibi yöntemler de yaygın olarak kullanılmaktadır. Yöntemin temel maliyeti eğitim süresidir: PGD tabanlı adversarial training standart eğitime göre yaklaşık 2–10 kat daha uzun sürer. Ayrıca modelin temiz veriler üzerindeki doğruluğu ("clean accuracy"), savunma gücü artarken genellikle %2–5 oranında düşer. Bu denge, otonom araçlar, medikal görüntüleme ve finansal dolandırıcılık tespiti gibi yüksek riskli sistemlerde kabul edilebilir bir bedel olarak değerlendirilir. Son yıllarda bu teknik görüntü sınıflandırıcılardan büyük dil modellerine (LLM) uzanan geniş bir alana uygulanmaktadır. LLM bağlamında adversarial training; jailbreak girişimlerine, prompt injection saldırılarına ve istenmeyen içerik üretimine karşı modeli sertleştirmek için kullanılmaktadır. Bu sayede hem geleneksel görüntü tabanlı güvenlikten hem de doğal dil işleme güvenliğinden yararlanan hibrit bir savunma katmanı oluşturulabilmektedir.