Federated Learning (Birleştirilmiş Öğrenme)

Ham veriyi paylaşmadan, her cihazın kendi verisi üzerinde yerel model güncellemesi hesapladığı gizlilik odaklı dağıtık makine öğrenmesi tekniği.

Federated learning (federe öğrenme), makine öğrenmesi modellerinin ham verileri merkezi bir sunucuya göndermek yerine, verilerin bulunduğu cihazlar üzerinde doğrudan eğitilmesini mümkün kılan gizlilik odaklı bir dağıtık öğrenme paradigmasıdır. Google tarafından 2017'de tanıtılan bu yaklaşım, her istemci cihazın kendi yerel verisiyle bir model güncellemesi (gradient veya model ağırlığı değişikliği) hesaplamasını ve yalnızca bu güncellemeyi merkezi bir koordinatöre göndermesini esas alır. Geleneksel makine öğrenmesinde tüm eğitim verisi tek bir merkezi sunucuda toplanır; bu durum hem gizlilik hem de veri sızıntısı riskleri doğurur. Federated learning ise bu problemi yapısal olarak çözer: ham veri hiçbir zaman cihazı terk etmez. Koordinatör sunucu yalnızca anonim gradyanları veya model parametrelerini alır, bunları FedAvg (Federated Averaging) gibi bir toplama algoritmasıyla birleştirir ve güncellenmiş global modeli tüm istemcilere dağıtır. Federated learning'in iki temel çeşidi vardır: yatay federated learning (aynı özellik uzayı, farklı veri örnekleri — örneğin farklı hastanelerden gelen aynı formattaki hasta kayıtları) ve dikey federated learning (farklı özellik uzayları, aynı kullanıcılar — örneğin bir bankanın işlem geçmişi ile bir e-ticaret sitesinin satın alma geçmişinin birleştirilmesi). Bu yapı, GDPR ve HIPAA gibi veri koruma düzenlemelerine uyumu kolaylaştırır. Pratik uygulamalar arasında Google'ın Android klavye tahmini (Gboard), Apple'ın Siri ses tanıma kalitesi iyileştirmesi ve hastane ağlarında tıbbi görüntü analizi öne çıkar. İletişim verimliliği, heterojenik cihaz kapasiteleri (sistem heterojenliği) ve model zehirleme (model poisoning) saldırılarına karşı dayanıklılık, alanın aktif araştırma konularıdır. Diferansiyel gizlilik ve güvenli çok taraflı hesaplama teknikleri ile federated learning'in gizlilik garantisi daha da güçlendirilebilir. Bu kombinasyon, hassas sektörlerde (finans, sağlık, savunma) veri paylaşımı gerektirmeden yüksek kaliteli ortak modeller geliştirmeyi olanaklı kılmakta ve merkezileşme olmaksızın ölçeklenebilir yapay zeka ekosistemlerinin temelini atmaktadır.

Federated Learning Nedir?

Federated learning (federe öğrenme), ham verileri merkezi bir sunucuya toplamak yerine modelin doğrudan cihazlar üzerinde eğitildiği gizlilik koruyucu bir makine öğrenmesi paradigmasıdır. Her istemci kendi yerel verisiyle gradyan hesaplar ve yalnızca model güncellemesini koordinatöre iletir; böylece ham veri hiçbir zaman cihazı terk etmez.

Geleneksel ML vs Federated Learning

Geleneksel ML

Tüm veri merkezi sunucuda toplanır, tek bir modelde eğitilir. Yüksek gizlilik riski.

Federated Learning

Her cihaz kendi verisinde yerel model günceller; yalnızca gradyanlar merkeze iletilir.

Veri Gizliliği

Ham veri cihazdan çıkmaz; GDPR ve HIPAA uyumu yapısal olarak sağlanır.

İletişim Verimliliği

FedAvg ve sıkıştırma teknikleri gradyan iletim maliyetini düşürür.

Çalışma Prensibi

Koordinatör sunucu global modeli istemcilere dağıtır. Her istemci yerel verisiyle birkaç gradient adımı atar, güncellemeyi hesaplar ve yalnızca bu farkı sunucuya gönderir. FedAvg algoritması gelen güncellemeleri ağırlıklı ortalamaya göre birleştirir. Güncellenmiş global model yeniden dağıtılır ve döngü tekrar eder.

Gerçek Dünya Uygulamaları

Google Gboard

Klavye sözcük tamamlama modeli, milyonlarca telefonda kullanıcı verisini sunucuya göndermeden öğrenir.

Apple Siri

Ses tanıma modelinin cihaz üzerinde iyileştirilmesi; kullanıcı sesleri Apple sunucularına gönderilmez.

Tıbbi Görüntüleme

Farklı hastaneler hasta verisi paylaşmadan ortak bir radyoloji modeli eğitir.

Finans

Bankalar müşteri işlem verilerini açmadan dolandırıcılık tespit modeli birlikte geliştirir.

Federated Learning Uygulama Zorlukları ve Çözümleri

  • check_circle İstatistiksel Heterojenlik (Non-IID): Her istemcinin veri dağılımı farklı; FedProx ve Scaffold gibi algoritmalar yerel aşırı öğrenmeyi penalize ederek küresel yakınsama sağlar.
  • check_circle İletişim Maliyeti: Ağırlık güncellemelerini iletmek bant genişliği gerektirir; gradient sıkıştırma, kuantizasyon ve sparse güncellemeler iletişimi 10-100x azaltır.
  • check_circle Güvenli Toplama: Bireysel istemci güncellemelerini gizlemek için homomorfik şifreleme veya güvenli çok taraflı hesaplama (SMPC); gizlilik garantisi merkezi sunucuya karşı.
  • check_circle Zehirleme Saldırıları: Kötü niyetli istemciler bozuk güncellemeler göndererek modeli manipüle edebilir; robust aggregation (Krum, median) saldırılara karşı dayanıklılık sağlar.
  • check_circle Sistem Heterojenliği: Farklı cihaz kapasitesi ve bağlantı stabilitesi; asenkron federasyon ve kısmi katılım protokolleri straggler sorununu ele alır.

Sık Sorulan Sorular

  • check_circle Federated learning tam anlamıyla gizliliği garanti eder mi? Hayır; gradyan saldırıları yoluyla veri çıkarımı mümkündür. Diferansiyel gizlilik ek koruma sağlar.
  • check_circle FedAvg ne yapar? İstemcilerden gelen model güncellemelerinin (gradyanlar veya ağırlık farkları) ağırlıklı ortalamasını alarak küresel modeli günceller.
  • check_circle Yatay ve dikey federated learning farkı nedir? Yatay: aynı özellikler, farklı veri örnekleri. Dikey: farklı özellik uzayları, aynı kullanıcı kümesi.
  • check_circle Federated learning hangi düzenlemelerle uyumludur? GDPR (Avrupa), HIPAA (ABD sağlık) ve benzeri veri yerelleştirme yasalarıyla yapısal uyum sunar.
  • check_circle Model zehirleme saldırısı nedir? Kötü niyetli bir istemcinin sahte gradyanlar göndererek küresel modeli bozmaya çalışmasıdır; Byzantine-tolerant toplama yöntemleriyle azaltılır.