Knowledge Distillation (Bilgi Damıtma)

Büyük öğretmen modelin yumuşak olasılık çıktılarını küçük öğrenci modele aktararak performansı koruyarak boyutu küçülten model sıkıştırma tekniği.

Knowledge Distillation (Bilgi Damıtma), büyük ve güçlü bir öğretmen modelin bilgisini daha küçük ve verimli bir öğrenci modele aktarma sürecidir. Öğrenci model, doğrudan ham etiketlerden değil; öğretmenin yumuşak olasılık çıktılarından (soft labels) öğrenerek eğitim veri kümesindeki sinyallerin ötesine geçen genelleme yeteneği kazanır. Tekniğin temeli 2015 yılında Geoffrey Hinton, Oriol Vinyals ve Jeff Dean'in yayımladığı "Distilling the Knowledge in a Neural Network" başlıklı makaledir. Hinton, öğretmenin softmax çıktılarının ham etiketlere kıyasla çok daha zengin bir öğrenme sinyali taşıdığını ortaya koydu: bir görüntü sınıflandırıcısının "kedi" olasılığı %90 iken "köpek" olasılığının %7 olması, modelin sınıflar arasındaki benzerlik yapısını kodladığını gösterir ve öğrenci bu yapıyı devralır. Teknik açıdan distilasyon iki kayıp teriminin ağırlıklı toplamını minimize eder: öğrencinin öğretmen çıktılarına ne kadar yaklaştığını ölçen KL Divergence tabanlı distilasyon kaybı ve standart çapraz entropi kaybı. Sıcaklık (temperature) parametresi softmax dağılımını yumuşatarak sınıflar arası ilişkileri belirginleştirir; tipik değerler 2-5 arasındadır. Pratik uygulamalarda distilasyon, üretim ortamları için belirleyici bir teknik haline gelmiştir. DistilBERT orijinal BERT modelinin %97 performansını %40 daha küçük ve %60 daha hızlı biçimde yeniden üretir. TinyBERT hem öğretmen çıktısından hem de ara katman temsil bilgisinden öğrenir; MobileBERT ise mobil cihaz kısıtları gözetilerek tasarlanmıştır. Distilasyon çeşitleri arasında self-distillation (modelin kendisinden öğrenmesi), multi-teacher distillation (birden fazla öğretmenden bilgi sentezi) ve cross-modal distillation (görüntü modelinin bilgisinin metin modeline aktarılması) sayılabilir. LLM çağında bu teknik, 70B+ büyük modellerin bilgisini 7B veya daha küçük görev-odaklı modellere aktarmak için kritik bir role bürünmüştür. Açık ağırlıklı büyük modeller öğretmen, küçük görev-odaklı modeller öğrenci rolü üstlenir; bu yaklaşım model sıkıştırma, budama (pruning) ve kuantizasyon ile birlikte kullanılarak donanım sınırlı ortamlarda yüksek performans elde etmeye olanak tanır.

Nasıl Çalışır?

Distilasyon sürecinde öğrenci model iki farklı sinyalden öğrenir. Birincisi, doğrudan ground-truth etiketlerden hesaplanan standart çapraz entropi kaybıdır. İkincisi, öğretmenin temperature-scaled softmax çıktılarıyla öğrenci çıktıları arasındaki KL Divergence'tır. Sıcaklık parametresi yükseldikçe olasılık dağılımı düzleşir ve sınıflar arası benzerlik ilişkileri daha belirgin hale gelir. Son kayıp fonksiyonu bu iki terimin ağırlıklı toplamıdır; α hiperparametresi dengeyi kontrol eder. Eğitim tamamlandıktan sonra öğrenci model bağımsız olarak inference yapabilir — çıkarım sırasında öğretmen gerekmez.

Temel Bileşenler

Öğretmen Model (Teacher)

Yüksek kapasiteli, ağır hesaplama gerektiren büyük model. Örneğin BERT-large, GPT-4 veya ResNet-152.

Öğrenci Model (Student)

Üretim ortamı için tasarlanmış hafif model. DistilBERT, TinyBERT veya MobileNet gibi.

Soft Labels

Öğretmenin sıcaklık parametresiyle yumuşatılmış olasılık dağılımı; ham etiketlere göre daha fazla bilgi taşır.

Temperature (T)

Softmax çıktısını yumuşatan hiperparametre. T=1 standart softmax; T>1 daha düz dağılım ve daha zengin sınıflar-arası bilgi.

Kullanım Alanları

  • check_circle Mobil ve Edge Dağıtımı: Akıllı telefon ve IoT cihazlarında çalıştırılmak üzere büyük modelleri küçülterek gecikmeyi azaltır, 5-10× boyut kazanımı tipiktir.
  • check_circle Gerçek Zamanlı Çıkarım: Öneri sistemleri ve NLP pipeline'larında milisaniye düzeyinde yanıt süreleri gerektiren üretim senaryolarında kritik bir tekniktir.
  • check_circle LLM Sıkıştırma: 70B+ büyük dil modellerinin bilgisini 7B veya daha küçük görev-özel modellere aktararak maliyet-verimlilik dengesi kurulur.
  • check_circle Gizlilik Koruyucu ML: Hassas veri içeren öğretmen modeli merkezi tutarken öğrenciyi federated veya differential-privacy ortamında eğitme olanağı sunar.

Distilasyon Çeşitleri (Damıtma Türleri)

  • check_circle Response-based Distillation: En yaygın yaklaşım: öğrenci yalnızca öğretmenin son katman çıktısından (soft labels) öğrenir.
  • check_circle Feature-based Distillation: TinyBERT'te uygulanan yöntem; öğrenci öğretmenin ara katman temsilleriyle de hizalanır.
  • check_circle Relation-based Distillation: Öğrenci, öğretmenin örnekler arası ilişki yapısını (örneğin benzerlik matrisleri) öğrenir.
  • check_circle Self-distillation: Modelin kendi önceki checkpoint'larından veya büyük versiyonundan öğrenmesi; ek öğretmen gerekmez.

LLM Çağında Bilgi Damıtma

  • check_circle Siyah Kutu Distilasyonu: Öğretmenin tam softmax çıktısına erişilemeyen durumlarda öğrenci, öğretmenin ürettiği metin örneklerinden öğrenir; bu yöntem Alpaca ve Vicuna'nın temel yaklaşımıdır.
  • check_circle Sentetik Veri ile Distilasyon: Öğretmen model yüksek kaliteli eğitim örnekleri üretir; öğrenci bu sentetik veriyle fine-tune edilerek hız ve maliyet avantajı elde eder.
  • check_circle Kuantizasyon ile Birleştirme: Distilasyon + 4-bit/8-bit kuantizasyon ikilisi, boyut küçültmede kümülatif kazanım sunar ve neredeyse hiç performans kaybı olmadan çalışır.
  • check_circle Çok-Öğretmenli Distilasyon: Farklı uzmanlık alanlarına sahip birden fazla öğretmenin bilgisini tek bir öğrencide birleştirerek daha kapsamlı yetenek transferi yapılır.

Sık Sorulan Sorular

  • check_circle Knowledge Distillation ile model pruning arasındaki fark nedir?: Pruning mevcut modelin bazı ağırlıklarını sıfırlayarak küçültür; distilasyon ise sıfırdan yeni bir küçük modeli öğretmen rehberliğinde eğitir. İkisi sıklıkla birlikte kullanılır.
  • check_circle Sıcaklık (temperature) değeri nasıl seçilir?: Genellikle 2-5 arasında grid search ile belirlenir. Yüksek T sınıflar arası bilgiyi zenginleştirir; ancak çok yüksek değerler gürültüye yol açabilir.
  • check_circle Hangi durumlarda distilasyon yetersiz kalır?: Öğrenci kapasitesi görevin karmaşıklığına oranla çok küçükse öğretmen bilgisi tamamen aktarılamaz. Bu duruma 'capacity mismatch' denir ve öğrencinin mimari büyüklüğünü artırmak gerekir.
  • check_circle LLM distilasyonu geleneksel distilasyondan nasıl farklı?: LLM'lerde tam softmax çıktısına erişim her zaman mümkün değildir. Bu nedenle 'siyah kutu' distilasyon ve sentetik veri üretimi ön plana çıkar; Alpaca ve Vicuna bu yaklaşımın öncüleridir.
  • check_circle DistilBERT ile BERT arasındaki performans farkı ne kadar?: DistilBERT, BERT'in genel NLP performansının yaklaşık %97'sini korurken model boyutunu %40, çıkarım süresini ise %60 azaltır.