Diferansiyel Gizlilik, veri sorgularına kontrollü gürültü ekleyerek bireysel veri gizliliğini matematiksel güvence altına alan bir çerçevedir.

Diferansiyel Gizlilik (Differential Privacy), bir veri kümesi üzerinde yapılan sorguların veya istatistiksel hesaplamaların sonuçlarının, veri kümesindeki herhangi bir bireyin varlığından veya yokluğundan istatistiksel olarak ayırt edilemez hale gelmesini sağlayan matematiksel bir gizlilik çerçevesidir. 2006 yılında Cynthia Dwork tarafından formüle edilen bu yöntem, bireysel gizlilik güvencesi ile veri kullanışlılığını matematiksel olarak dengeler. Temel fikir, bir mekanizmanın çıktısına kontrollü miktarda rastgele gürültü ekleyerek bireysel veri noktalarının sorgularda iz bırakmasını önlemektir. Epsilon (ε) parametresi gizlilik bütçesini temsil eder: ε değeri küçüldükçe gizlilik artar ancak yanıtın doğruluğu azalır; ε büyüdükçe ise yanıtın doğruluğu artar ancak gizlilik zayıflar. Bu ödünleşim, uygulamanın gereksinimlerine göre dikkatle ayarlanmak zorundadır. İki ana varyant mevcuttur: Merkezi Diferansiyel Gizlilik (Central DP), güvenilir bir koordinatörün ham veriyi toplayıp gürültüyü merkezi olarak eklediği modeli kullanırken; Yerel Diferansiyel Gizlilik (Local DP) gürültünün her kullanıcının cihazında verisi sunucuya gönderilmeden önce eklendiği modeli benimser. Local DP, özellikle güvenilir bir merkezi tarafın bulunmadığı mobil ve IoT senaryolarında tercih edilir. Apple ve Google, iOS klavye ve Android telemetri verilerinde yerel diferansiyel gizliliği uygulamaktadır. ABD Nüfus Sayımı Bürosu, 2020 sayımında merkezi diferansiyel gizlilik kullandı. Yapay zeka dünyasında ise diferansiyel gizlilik, özellikle derin öğrenme modellerinin eğitiminde gizlilik koruyucu bir teknik olarak yerini sağlamlaştırmıştır; bu yaklaşım DP-SGD (Differentially Private Stochastic Gradient Descent) olarak bilinmektedir.

security Diferansiyel Gizlilik Nasıl Çalışır?

Diferansiyel gizlilik, bir algoritmanın herhangi bir veri kümesi üzerindeki çıktısının, o veri kümesine tek bir kişinin eklenmesinden veya çıkarılmasından istatistiksel olarak ayırt edilemez olması gerektiğini matematiksel olarak tanımlar. Bunu sağlamak için sorgulara veya hesaplamalara Laplace ya da Gaussian dağılımından elde edilen gürültü eklenir. Örneğin bir veri tabanında yaş ortalaması sorgulandığında, ham ortalama değer yerine küçük bir rastgele gürültü eklenmiş ortalama döndürülür. Bu gürültü yeterince küçük olduğunda istatistiksel analizlerin doğruluğu korunurken, gürültü sayesinde herhangi bir kişinin veri kümesinde olup olmadığı çıkarsanamaz. Epsilon (ε) bu gürültünün büyüklüğünü ve dolayısıyla gizlilik güvencesinin gücünü belirleyen matematiksel parametredir.

Merkezi ve Yerel Diferansiyel Gizlilik

hub Merkezi DP

Ham veriler güvenilir bir merkezi sunucuya toplanır, sunucu gürültüyü ekleyerek analiz yapar. ABD Nüfus Sayımı bu modeli kullanmaktadır. Güvenilir bir koordinatöre ihtiyaç duyar; daha yüksek veri doğruluğu sağlar.

smartphone Yerel DP

Her kullanıcı kendi cihazında gürültüyü veriye ekler ve ardından sunucuya gönderir. Apple ve Google bu modeli kullanmaktadır. Sunucuya ham veri hiç ulaşmaz; güvenilir koordinatöre ihtiyaç olmaz.

model_training DP-SGD

Derin öğrenme modellerini gizlilik koruyarak eğitmeyi sağlar. Her eğitim adımında gradyanlara gürültü ekler ve gradyan kırpma (gradient clipping) uygular. TensorFlow Privacy ve Opacus kütüphaneleri bunu kolaylaştırır.

calculate Epsilon Bütçesi

ε küçük olduğunda (örn. ε=0.1) güçlü gizlilik ancak düşük doğruluk elde edilir. ε büyük olduğunda (örn. ε=10) yüksek doğruluk ancak zayıf gizlilik sağlanır. Uygulama gereksinimlerine göre optimal ε seçimi kritiktir.

public Gerçek Dünya Kullanım Alanları

  • check_circle Apple iOS — Klavye ve Telemetri: Apple, iOS 10'dan itibaren kullanıcı yazma alışkanlıkları ve emoji kullanım istatistiklerini yerel diferansiyel gizlilik ile toplamaktadır. Ham tuş vuruşları hiç iletilmez; yalnızca gizlilik korumalı istatistikler Apple sunucularına ulaşır.
  • check_circle Google Chrome — Rapor Toplama: Google'ın RAPPOR mekanizması yerel DP kullanarak tarayıcı telemetri verilerini toplar. Kullanıcı hangi siteleri ziyaret ettiğini açık etmeden genel eğilimler ölçülür.
  • check_circle ABD Nüfus Sayımı 2020: 2020 sayımı, kişi düzeyinde verileri korumak için merkezi diferansiyel gizlilik uyguladı. Bu, büyük ölçekli resmi istatistiklerde DP'nin kullanıldığı en kapsamlı örnek olarak tarihe geçti.
  • check_circle Tıbbi Araştırma: Hasta kayıtları üzerinde diferansiyel gizlilik ile ilaç etkisi veya hastalık prevalansı analizi yapılabilir. Bireysel hasta kimliği açığa çıkmadan toplum sağlığı araştırmaları yürütülür.

Sıkça Sorulan Sorular

  • check_circle Diferansiyel gizlilik anonimleştirmeden farkı nedir?: Geleneksel anonimleştirme (isim ve TC silme gibi) yan kanal saldırılarına karşı savunmasızdır ve matematiksel güvence sunmaz. Diferansiyel gizlilik, güvenceyi kanıtlanabilir bir matematiksel çerçeveyle sağlar ve yeniden tanımlama saldırılarına karşı dirençlidir.
  • check_circle DP neden makine öğreniminde önemlidir?: ML modelleri eğitim verisini 'ezberleyebilir' ve üyelik çıkarım saldırılarıyla bireysel veriler sızdırılabilir. DP-SGD bu riski azaltır: model hassas verileri öğrenir ancak herhangi bir bireyin verisini açık etmez.
  • check_circle Epsilon değeri nasıl seçilir?: Sektörde genel kabul görmüş bir ε değeri yoktur. Akademide ε ≤ 1 güçlü gizlilik olarak kabul edilirken endüstriyel uygulamalarda ε = 1-10 aralığı yaygın kullanılır. GDPR uyumlu sistem tasarımında ε seçimi düzenleyici beklentilerle uyumlu olmalıdır.
  • check_circle DP ve federe öğrenme birlikte kullanılabilir mi?: Evet. Federe öğrenme dağıtık eğitimi sağlarken DP-SGD her istemci tarafında veya gradyan toplamasında gizlilik koruması ekler. Bu kombinasyon 'gizlilik koruyucu federe öğrenme' olarak anılır.