tag adversarial

Model Zehirleme (Poisoning) (Model Zehirleme)

Bu sayfada adversarial (Model Zehirleme (Poisoning) (Model Zehirleme)) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

Model zehirleme (model poisoning veya data poisoning), bir saldırganın yapay zeka modelinin eğitim sürecini manipüle ederek modelin davranışını kasıtlı olarak bozmayı hedeflediği bir siber saldırı türüdür. Saldırgan, eğitim verisine kötü niyetli örnekler enjekte eder veya model ağırlıklarını doğrudan değiştirerek hedeflenen hataları yerleştirir. Başlıca saldırı türleri üç kategoride incelenir. Label-flip saldırısında gerçek etiketler yanlış etiketlerle değiştirilir; örneğin zararlı yazılım örneklerine 'temiz' etiketi atanır. Backdoor (arka kapı) saldırısında model, belirli bir tetikleyici deseni (trigger pattern) içeren girdileri her zaman belirli bir çıktıya yönlendirecek biçimde eğitilir; diğer girdilerde normal davranır. Clean-label saldırısında etiketler doğru kalır; ancak örnekler algılanamaz pertürbasyonlarla bozularak modelin karar sınırını kaydırır. Gerçek dünya örnekleri arasında ImageNet gibi büyük veri kümelerinin web'den otomatik toplanması sırasında zehirli veri karışması, federated learning sistemlerinde kötü niyetli istemci güncellemeleri ve dil modellerinde bias enjeksiyonu sayılabilir. Federated learning özellikle savunmasızdır: merkezi koordinatör bireysel istemcilerin gönderdiği gradyanların güvenilirliğini doğrulayamaz. Savunma yöntemleri arasında veri sanitizasyonu (eğitim verisi filtreleme), STRIP ve Activation Clustering gibi backdoor tespit teknikleri, diferansiyel gizlilik (differential privacy) ile eğitim ve Byzantine-robust toplama yöntemleri (Krum, Median toplama) bulunur. Model sertleştirme ve düzenli yeniden eğitim de savunma repertuvarının parçasıdır. NIST AI Risk Management Framework, model poisoning'i kritik AI güvenlik tehditleri arasında sınıflandırmaktadır. Model zehirleme saldırıları tespit etmek son derece güçtür çünkü zehirli model, testlerde normal performans gösterir; tetikleyici olmadan backdoor aktive olmaz. Bu gizlilik, özellikle kritik altyapı (otonom araçlar, tıbbi tanı) ve güvenlik sistemlerinde (kötü amaçlı yazılım tespiti, sahte içerik filtreleme) model bütünlüğünü sağlamayı zorunlu kılar. Tedarik zinciri saldırıları (supply chain attacks) bağlamında, açık kaynak model ağırlıklarının zehirlenmiş hâlde dağıtılması da giderek artan bir risk olarak değerlendirilmektedir. Araştırmacılar model fingerprinting ve watermarking tekniklerini bu tehdide karşı savunma olarak geliştirmektedir; kriptografik kanıt zinciriyle model provenance'ı doğrulayan yaklaşımlar endüstri standardı olmaya aday gösterilmektedir.

code_blocks

Model Zehirleme (Poisoning) (Model Zehirleme)

Model zehirleme (model poisoning veya data poisoning), bir saldırganın yapay zeka modelinin eğitim sürecini manipüle ederek modelin davranışını kasıtlı olarak bozmayı hedeflediği bir siber saldırı türüdür. Saldırgan, eğitim verisine kötü niyetli örnekler enjekte eder veya model ağırlıklarını doğrudan değiştirerek hedeflenen hataları yerleştirir. Başlıca saldırı türleri üç kategoride incelenir. Label-flip saldırısında gerçek etiketler yanlış etiketlerle değiştirilir; örneğin zararlı yazılım örneklerine 'temiz' etiketi atanır. Backdoor (arka kapı) saldırısında model, belirli bir tetikleyici deseni (trigger pattern) içeren girdileri her zaman belirli bir çıktıya yönlendirecek biçimde eğitilir; diğer girdilerde normal davranır. Clean-label saldırısında etiketler doğru kalır; ancak örnekler algılanamaz pertürbasyonlarla bozularak modelin karar sınırını kaydırır. Gerçek dünya örnekleri arasında ImageNet gibi büyük veri kümelerinin web'den otomatik toplanması sırasında zehirli veri karışması, federated learning sistemlerinde kötü niyetli istemci güncellemeleri ve dil modellerinde bias enjeksiyonu sayılabilir. Federated learning özellikle savunmasızdır: merkezi koordinatör bireysel istemcilerin gönderdiği gradyanların güvenilirliğini doğrulayamaz. Savunma yöntemleri arasında veri sanitizasyonu (eğitim verisi filtreleme), STRIP ve Activation Clustering gibi backdoor tespit teknikleri, diferansiyel gizlilik (differential privacy) ile eğitim ve Byzantine-robust toplama yöntemleri (Krum, Median toplama) bulunur. Model sertleştirme ve düzenli yeniden eğitim de savunma repertuvarının parçasıdır. NIST AI Risk Management Framework, model poisoning'i kritik AI güvenlik tehditleri arasında sınıflandırmaktadır. Model zehirleme saldırıları tespit etmek son derece güçtür çünkü zehirli model, testlerde normal performans gösterir; tetikleyici olmadan backdoor aktive olmaz. Bu gizlilik, özellikle kritik altyapı (otonom araçlar, tıbbi tanı) ve güvenlik sistemlerinde (kötü amaçlı yazılım tespiti, sahte içerik filtreleme) model bütünlüğünü sağlamayı zorunlu kılar. Tedarik zinciri saldırıları (supply chain attacks) bağlamında, açık kaynak model ağırlıklarının zehirlenmiş hâlde dağıtılması da giderek artan bir risk olarak değerlendirilmektedir. Araştırmacılar model fingerprinting ve watermarking tekniklerini bu tehdide karşı savunma olarak geliştirmektedir; kriptografik kanıt zinciriyle model provenance'ı doğrulayan yaklaşımlar endüstri standardı olmaya aday gösterilmektedir.

arrow_forward
🛡️

Tehdit Modellemesi (Tehdit Modellemesi)

Tehdit modellemesi (threat modeling), bir sistemin güvenliğini tehdit edebilecek potansiyel saldırı vektörlerini, açıklarını ve risk senaryolarını tasarım aşamasında proaktif biçimde haritalandıran yapılandırılmış bir güvenlik metodolojisidir. Güvenlik mühendisliğinin "önce düşman gibi düşün" ilkesine dayanır: korunulacak varlıkları (data, model, API), olası saldırganları (dış aktörler, içeriden tehditler) ve saldırı yollarını sistematik biçimde listeler. Microsoft'ta Loren Kohnfelder ve Praerit Garg tarafından 1999'da geliştirilen STRIDE çerçevesi, tehdit modellemesinin temel metodolojik taşını oluşturur. STRIDE kısaltması şu altı tehdit türünü ifade eder: Spoofing (kimlik sahteciliği), Tampering (veri bütünlüğünün bozulması), Repudiation (inkâr edilemezlik ihlali), Information Disclosure (gizli bilginin sızdırılması), Denial of Service (hizmet engelleme) ve Elevation of Privilege (ayrıcalık yükseltme). Her sistem bileşeni bu altı eksen boyunca değerlendirilir. Yapay zeka sistemlerinin yaygınlaşmasıyla alan, AI'ya özgü çerçevelerle genişledi. MITRE ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems), AI sistemlerine yönelik gerçek saldırı vakalarını taksonomi hâlinde derler; v5.4.0 sürümü 16 taktik, 84 teknik ve 42 vaka çalışması içermektedir. OWASP LLM Top 10 ise büyük dil modellerine özgü riskleri, başta prompt injection ve eğitim verisi zehirlenmesi olmak üzere, öncelikli sırayla listeler. AI sistemlerine özgü başlıca tehdit kategorileri şunlardır: veri zehirlenmesi (training data poisoning) eğitim setine kötü niyetli örnekler enjekte ederek model davranışını manipüle eder; model çalma (model extraction), siyah-kutu sorgularla modelin işlevsel kopyasını çıkarma girişimidir; düşmanca örnekler (adversarial examples), insan gözüne normal görünen ama modeli yanıltan girdilerdir; prompt injection ise LLM uygulamalarında sistem yönergelerini devre dışı bırakmayı ya da gizli verilere erişimi hedefler. Tehdit modelleme süreci tipik olarak beş adımda yürütülür: kapsam ve varlıkların tanımlanması, veri akış diyagramlarının (DFD) oluşturulması, tehditlerin belirlenmesi (STRIDE veya başka çerçeveyle), risk değerlendirmesi (etki × olasılık matrisi) ve azaltma önlemlerinin planlanması. Türkiye'de BDDK, BTK ve KVKK kapsamındaki düzenlemeler finansal ve kişisel veri işleyen AI uygulamalarında tehdit modelleme belgesi talep etmektedir.

arrow_forward