Model Watermarking (Model Filigranı)

Model Filigranı, yapay zeka modellerine gizli işaretler yerleştirerek telif hakkı ve içerik kökenini doğrulamayı sağlayan güvenlik tekniğidir.

Model Filigranı (Model Watermarking), yapay zeka modellerine veya bu modellerin ürettiği içeriklere — metin, görüntü, ses ve video — gizli bir işaret yerleştirme tekniğidir. Bu teknik; modelin kimliğini doğrulamak, fikri mülkiyet haklarını korumak ve izinsiz kullanımı ya da kopyalamayı tespit etmek amacıyla uygulanır. Tıpkı banknotlardaki basılı filigranlara benzer biçimde, yapay zeka filigranları olağan kullanımda fark edilmeden özel algoritmalarla tespit edilebilecek şekilde tasarlanır. Model filigranlamanın iki ana katmanı vardır. Birincisi, modelin ağırlıklarına ya da eğitim sürecine gömülen model ağırlık filigranıdır; bu yöntemle modelin kopyalandığı veya izinsiz dağıtıldığı durumlar doğrulanabilir. İkincisi ise modelin ürettiği çıktılara yerleştirilen çıktı filigranıdır; hangi içeriğin hangi model tarafından oluşturulduğu bu yolla izlenebilir. Büyük dil modellerinde (LLM) metin filigranı genellikle token seçim olasılıklarına müdahale edilerek uygulanır. Stanford ve Maryland Üniversitesi araştırmacılarının geliştirdiği "kırmızı-yeşil liste" yaklaşımında her token için rastgele bir sınıflandırma yapılır; model yeşil listedeki tokenleri istatistiksel olarak daha sık seçer ve bu eğilim sonraki analizde filigranı ortaya çıkarır. Bu yaklaşımın en önemli özelliği, okuyucunun fark edemeyeceği kadar ince bir istatistiksel iz bırakmasına karşın makine tarafından yüksek güvenilirlikle tespit edilebilmesidir. Görüntü modellerinde frekans alanına (DCT/DWT dönüşümleri) ya da gizli uzaya (latent space) bilgi gömme yaygındır. Stable Diffusion benzeri modellerde "Stable Signature" ve "Tree-Ring Watermark" gibi yöntemler, üretilen görsellerin orijinal modelle ilişkisini oluşturma sürecinden itibaren kodlar; bu filigranlar görüntü dönüştürme veya kırpma işlemlerine karşı direnç göstermek üzere tasarlanmıştır. Ağırlık filigranlamasında ise eğitim sürecine gömülen gizli davranış mekanizması farklı biçimlerde çalışır: belirli tetikleyici girdilere (trigger) önceden belirlenmiş yanıtlar üretmesi modele öğretilir. Üçüncü taraflarca bilinmeyen bu gizli davranış, modelin orijinalliğini kanıtlamak için kullanılır. Regülatuar açıdan model filigranı giderek daha belirleyici bir hal almaktadır. Avrupa Birliği Yapay Zeka Yasası (AI Act), yüksek riskli yapay zeka sistemleri için içerik kökeninin işaretlenmesini zorunlu kılmaktadır. ABD Yürütme Kararı da yapay zeka şirketlerini filigran standartları geliştirmeye teşvik etmektedir. C2PA (Coalition for Content Provenance and Authenticity) standardı, içeriklere kriptografik köken bilgisi eklemeyi hedefleyen endüstri girişimi olarak öne çıkmaktadır. Bu gelişmeler, model filigranını araştırma laboratuvarlarından endüstriyel zorunluluğa taşımıştır.

Model Filigranı Nasıl Çalışır?

Model filigranı, iki farklı düzeyde uygulanabilir: modelin parametrelerine (ağırlıklarına) gömme ve modelin çıktılarına gömme. Ağırlık filigranında, eğitim süreci sırasında modele belirli tetikleyici girdilere özel, önceden belirlenen çıktılar üretmesi öğretilir. Bu gizli davranış üçüncü taraflarca bilinmediğinden modelin klonlanıp klonlanmadığı doğrulanabilir. Çıktı filigranında ise model çalışırken ürettiği her içeriğe istatistiksel bir imza ekler. Metin için token seçim olasılıkları hafifçe önyargılı hale getirilir; görüntü için insan gözünün fark etmediği yüksek frekanslı bileşenler değiştirilir. Filigran tespiti için özel bir dedektör modeli veya istatistiksel hipotez testi kullanılır.

Filigran Yöntem Kategorileri

  • check_circle Token Olasılık Filigranı (LLM): Token seçim dağılımına istatistiksel önyargı eklenir. Kırmızı-yeşil liste yöntemi bu kategorinin en bilinen örneğidir; okuyucuya şeffaf, dedektöre görünürdür.
  • check_circle Gizli Uzay Filigranı (Görüntü): Görüntü oluşturma sürecinde latent space'e gizli bir imza eklenir. Stable Signature ve Tree-Ring Watermark bu yaklaşımı kullanır; kırpma ve dönüştürmeye karşı dirençlidir.
  • check_circle Ağırlık Filigranı (Model): Eğitim sırasında modele tetikleyici girdilere özel çıktılar üretmesi öğretilir. Modelin kimliğini doğrulamak ve klonlamayı tespit etmek için kullanılır.
  • check_circle Frekans Alanı Filigranı (Görüntü/Ses): DCT veya DWT dönüşümleri aracılığıyla görüntü veya ses sinyalinin frekans bileşenlerine gizli veri gömülür; geleneksel steganografiye yakın bir yaklaşımdır.

Kullanım Senaryoları

  • check_circle Fikri Mülkiyet Koruması: Model geliştiricileri, modellerinin kopyalanıp dağıtıldığını ağırlık filigranıyla tespit ederek yasal süreçlerde kanıt olarak kullanabilir.
  • check_circle Yapay Zeka Üretimi İçerik Tespiti: Dezenformasyon veya deepfake kampanyalarına karşı bir savunma katmanı olarak kullanılır; hangi içeriğin hangi yapay zeka modelinden geldiği izlenebilir.
  • check_circle Regülatuar Uyumluluk: AB Yapay Zeka Yasası ve C2PA standardı kapsamında içerik provenance gerekliliklerini karşılamak amacıyla kullanılır.
  • check_circle Model Lisanslama Denetimi: Ticari API'lere abone olan kurumların model çıktılarını yeniden dağıtıp dağıtmadığı filigran izlemeyle kontrol edilebilir.

Filigran Yöntem Kategorileri

Ağırlık Filigranı (White-box)

İz, model ağırlıklarına ya da aktivasyon istatistiklerine gömülür. Sahiplik kanıtı için model ağırlıklarına erişim gerektirir. Uchida (2017) öncü çalışmadır.

Davranışsal Filigran (Black-box)

Model, belirli tetikleyici girdilere önceden belirlenmiş çıktı üretecek şekilde eğitilir. Ağırlıklara erişim gerekmez — API üzerinden doğrulanabilir.

Metin Filigranı (LLM Output)

Oluşturulan metne istatistiksel iz eklenir — token olasılık dağılımları değiştirilerek fark edilmez bir örüntü yerleştirilir. Kirchenbauer (2023) KGW yöntemi referans çalışmadır.

Dataset Filigranı

Eğitim verisi filigranlanır; model bu veriyle eğitilince filigranı miras alır. Radioactive data ve backdoor-based yaklaşımlar bu kategoridedir.

gavel Filigranın Zorlukları ve Kısıtları

  • check_circle Dayanıklılık (Robustness): Fine-tuning, pruning veya model merging filigranı silebilir; dayanıklı filigran tasarımı aktif araştırma konusudur.
  • check_circle AI metin tespiti güvenilirliği: LLM çıktısı filigranları %95-99 hassasiyetle tespit edebilir; ancak parafrazlama ve çeviri saldırıları başarıyla atlatabilir.
  • check_circle Yanlış pozitifler: İnsan yazdığı metnin yanlışlıkla AI üretimi sayılma riski — yüksek riskli bağlamlarda (sınav, haber) kabul edilemez sonuçlara yol açar.
  • check_circle Fikir mülkiyeti kanıtı: Filigran varlığı sahipliği kanıtlar; ancak mahkemede kabul edilebilirliği hukuki olarak hâlâ tartışmalıdır.
  • check_circle Açık ağırlıklı modeller: LLaMA gibi açık modellerde ağırlık filigranları kolayca kaldırılabilir; sektör çözüm üretmekte zorlanmaktadır.

Sıkça Sorulan Sorular

  • check_circle Model filigranı kaldırılabilir mi? Çıktı filigranları, yoğun yeniden işleme, dil çevirisi veya parafraza karşı kırılgan olabilir. Bununla birlikte iyi tasarlanmış kriptografik filigranlar ve ağırlık filigranları çok daha dayanıklıdır; bu alanda saldırı-savunma araştırmaları aktif olarak sürmektedir.
  • check_circle Filigran metin kalitesini etkiler mi? Modern yöntemler insan değerlendirmelerinde neredeyse sıfır kalite kaybı göstermektedir. Token olasılıklarına yapılan müdahale çok küçük tutulur; istatistiksel fark anlamlı olsa da metin akışı bozulmaz.
  • check_circle C2PA ile model filigranı arasındaki fark nedir? C2PA, içeriğe kriptografik meta veri ekleyen bir provenance standardıdır ve içeriğin kendisi değil meta verisi imzalanır. Model filigranı ise içeriğin veya modelin iç yapısına gömülü istatistiksel bir izdir; silinmesi çok daha zordur.
  • check_circle Hangi şirketler model filigranı kullanmaktadır? Google DeepMind, Meta AI, Stability AI ve Anthropic gibi önde gelen şirketler çeşitli filigran yaklaşımlarını araştırma ve ürünlerine entegre etmektedir. NVIDIA ise görüntü filigranı için açık kaynak araçlar yayımlamıştır.