LLM Güvenliği Nedir?
LLM Güvenliği (LLM Security), büyük dil modellerine özgü güvenlik açıklarını, saldırı vektörlerini ve savunma mekanizmalarını ele alan siber güvenlik disiplinidir. Geleneksel yazılım güvenliğinden temel farkı, LLM'lerin deterministik değil olasılıksal çalışmasından kaynaklanır; modeller aynı girdiye farklı zamanlarda farklı yanıtlar üretebilir. Sohbet botlarından LLM tabanlı ajanlara, RAG sistemlerinden kod asistanlarına kadar geniş uygulama yelpazesi, bu disiplini modern yapay zeka güvenliğinin merkezine oturtmaktadır.
Prompt Enjeksiyonu ve Dolaylı Saldırılar
Prompt enjeksiyonu (prompt injection), OWASP'ın LLM Uygulamalar İçin En Kritik 10 Risk listesinde (2025/2026) birinci sıradadır. Saldırganlar, 'önceki tüm talimatları yoksay' gibi gizli komutlarla modelin sistem talimatlarını geçersiz kılmaya çalışır. Doğrudan prompt enjeksiyonu kullanıcı girdisi üzerinden gerçekleşirken, dolaylı prompt enjeksiyonunda zararlı komutlar PDF, web sayfası veya veritabanı kayıtları gibi dış veri kaynaklarına gömülür. Model bu belgeleri işlerken talimatları farkında olmadan yürütür — LLM tabanlı ajan sistemlerinde bu özellikle tehlikelidir, çünkü ajanlar harici araçlara ve API'lere erişebildiğinden tek bir zararlı belge gerçek sistem eylemlerini tetikleyebilir.
Jailbreak ve Eğitim Verisi Saldırıları
Jailbreak saldırıları, güvenlik filtrelerini aşmak için Base64 kodlama, karakter değişimi veya çok adımlı akıl yürütme zincirleri kullanır. Bağlam penceresi genişledikçe 'çok atışlı jailbreak' (many-shot jailbreaking) daha etkili hale gelir: yüzlerce zararlı örnek tek bir istek içine yerleştirilerek modelin güvenlik kısıtlamaları aşınır. Eğitim verisi çıkarımı (training data extraction), modelin eğitim sürecinde ezberlenmiş kişisel bilgileri, API anahtarlarını veya özel kod parçalarını kışkırtma teknikleriyle gün yüzüne çıkarmayı hedefler. Model boyutu büyüdükçe bu risk de artar. RAG zehirlenmesinde (RAG poisoning) ise bilgi tabanına yerleştirilen tek bir zararlı belge model çıktılarını sistematik biçimde manipüle edebilir — 'bir kez zehirle, sonsuza kadar reddet' saldırıları modelin belirli konularda yanıt vermesini tamamen engelleyebilir.
Savunma Katmanları
Etkili LLM güvenliği 'derinlemesine savunma' (defense-in-depth) yaklaşımı gerektirir: **Girdi doğrulama:** Şüpheli talimatları tespit eden sınıflandırıcılar, istek uzunluk sınırları ve talimat-veri ayrımı teknikleri uygulanır. StruQ gibi yapılandırılmış sorgu formatları, kullanıcı verisini sistem talimatlarından ayırarak prompt enjeksiyona direnci artırır. **Guardrail'ler:** Gerçek zamanlı kural tabanlı filtreler her girdi ve çıktıyı güvenlik, uyumluluk ve içerik politikalarına göre denetler. **Çıktı filtreleme:** Kişisel veri (PII) tespiti, içerik politikası uygulaması ve sızdırılmış sırları temizleyen regex tabanlı tarama içerir. **Kırmızı takım testleri:** Hem manuel uzman saldırılarını hem de otomatikleştirilmiş adversarial testleri kapsayan bu yöntem, yalnızca modeli değil tüm istek akışını (kullanıcı girdisi → prompt montajı → çıktı filtreleme) test eder.
OWASP LLM Top 10 (2025/2026)
OWASP, LLM uygulamalarına yönelik en kritik on riski sistematik biçimde belgelemiştir: Prompt Enjeksiyonu (LLM01), Veri ve Model Zehirlenmesi (LLM02), Sınırsız Kaynak Tüketimi (LLM03), Güvensiz Çıktı İşleme (LLM04), Aşırı Ajan Yetkileri (LLM05), Hassas Bilgi İfşası (LLM06), Güvensiz Eklenti Tasarımı (LLM07), Tedarik Zinciri Açıkları (LLM08), Sistem Promptu Sızıntısı (LLM09) ve Vektör/Gömme Zayıflıkları (LLM10). Bu liste sektörde güvenlik denetimlerinin standart referans çerçevesi olarak yaygın kabul görmektedir.
Geleneksel Güvenlikten Farkları
LLM güvenliği ile klasik siber güvenlik arasındaki temel ayrımlar şunlardır: LLM'lerin olasılıksal çalışması, aynı saldırının her denemede farklı sonuç verebileceği anlamına gelir — bu durum savunmaları test etmeyi zorlaştırır. Güven sınırları belirsizdir: sistem promptu, kullanıcı girdisi, RAG kaynakları ve araç çıktıları birbirinden bağımsız güven seviyeleri oluşturur. Saldırı yüzeyi doğal dili kapsadığından sonsuz varyasyon sunar ve statik kural tabanlı savunmalar yetersiz kalır. Son olarak, güvenlik ayarlaması (alignment) ile performans arasında bir gerilim vardır: fazla güvenlik eğitimi, modellerin meşru isteklere de yanlışlıkla red yanıtı vermesine neden olabilir.
Sık Sorulan Sorular
- check_circle LLM güvenliği yalnızca büyük ölçekli modeller için mi geçerlidir?: Hayır; her ölçekte dil modeli benzer güvenlik risklerine maruz kalabilir. Açık kaynak modeller, sistem promptu ve guardrail olmadığında daha savunmasız olabilir.
- check_circle Prompt enjeksiyonu nasıl önlenir?: Girdi doğrulama, talimat-veri ayrımı ve çıktı filtreleme birlikte uygulanmalıdır. Tek bir önlem yeterli değildir; katmanlı savunma zorunludur.
- check_circle RAG sistemi kullanıyorsam hangi ek önlemleri almalıyım?: Dış veri kaynaklarının güvenilirliğini doğrulayın, bilgi tabanına erişim kısıtlamaları uygulayın ve retrieval sonuçlarının içeriğini filtreleyerek modele iletin.
- check_circle OWASP LLM Top 10 kuruluşumda nasıl uygulanır?: Her riski öncelikle tasarım aşamasında değerlendirin; threat modeling, red-teaming ve otomatik güvenlik taramasını geliştirme sürecine entegre edin.
- check_circle LLM ajanları neden standart LLM'lerden daha risklidir?: Ajanlar dosya sistemi, e-posta veya web API gibi harici araçlara doğrudan erişebildiğinden, zararlı bir prompt yalnızca metin çıktısını değil gerçek sistem eylemlerini etkileyebilir.