Knowledge Distillation (Bilgi Damıtma)

Büyük öğretmen modelin yumuşak olasılık çıktılarını küçük öğrenci modele aktararak performansı koruyarak boyutu küçülten model sıkıştırma tekniği.

Knowledge Distillation (Bilgi Damıtma), büyük ve güçlü bir öğretmen modelin bilgisini daha küçük ve verimli bir öğrenci modele aktarma sürecidir. Öğrenci model, doğrudan ham etiketlerden değil; öğretmenin yumuşak olasılık çıktılarından (soft labels) öğrenerek eğitim veri kümesindeki sinyallerin ötesine geçen genelleme yeteneği kazanır. Tekniğin temeli 2015 yılında Geoffrey Hinton, Oriol Vinyals ve Jeff Dean'in yayımladığı "Distilling the Knowledge in a Neural Network" başlıklı makaledir. Hinton, öğretmenin softmax çıktılarının ham etiketlere kıyasla çok daha zengin bir öğrenme sinyali taşıdığını ortaya koydu: bir görüntü sınıflandırıcısının "kedi" olasılığı %90 iken "köpek" olasılığının %7 olması, modelin sınıflar arasındaki benzerlik yapısını kodladığını gösterir ve öğrenci bu yapıyı devralır. Teknik açıdan distilasyon iki kayıp teriminin ağırlıklı toplamını minimize eder: öğrencinin öğretmen çıktılarına ne kadar yaklaştığını ölçen KL Divergence tabanlı distilasyon kaybı ve standart çapraz entropi kaybı. Sıcaklık (temperature) parametresi softmax dağılımını yumuşatarak sınıflar arası ilişkileri belirginleştirir; tipik değerler 2-5 arasındadır. Pratik uygulamalarda distilasyon, üretim ortamları için belirleyici bir teknik haline gelmiştir. DistilBERT orijinal BERT modelinin %97 performansını %40 daha küçük ve %60 daha hızlı biçimde yeniden üretir. TinyBERT hem öğretmen çıktısından hem de ara katman temsil bilgisinden öğrenir; MobileBERT ise mobil cihaz kısıtları gözetilerek tasarlanmıştır. Distilasyon çeşitleri arasında self-distillation (modelin kendisinden öğrenmesi), multi-teacher distillation (birden fazla öğretmenden bilgi sentezi) ve cross-modal distillation (görüntü modelinin bilgisinin metin modeline aktarılması) sayılabilir. LLM çağında bu teknik, 70B+ büyük modellerin bilgisini 7B veya daha küçük görev-odaklı modellere aktarmak için kritik bir role bürünmüştür. Açık ağırlıklı büyük modeller öğretmen, küçük görev-odaklı modeller öğrenci rolü üstlenir; bu yaklaşım model sıkıştırma, budama (pruning) ve kuantizasyon ile birlikte kullanılarak donanım sınırlı ortamlarda yüksek performans elde etmeye olanak tanır. 2024-2026 döneminde bilgi damıtma, küçük dil modeli (SLM) ekosisteminin merkezine oturdu. Microsoft'un Phi-3-mini'si (3.8 milyar parametre, 2024), GPT-3.5 düzeyinde performansı mobil cihazlara taşıyan ve distilasyon temelli bir veri akışıyla geliştirilen önemli bir açık kaynak modeldir. DeepSeek-R1'in Ocak 2025'te yayımlanan damıtma varyantları, 32 milyar parametreli öğrenci modelin matematik akıl yürütmede OpenAI o1-mini'yi geride bırakmasına zemin hazırladı. Bu süreçte bilgi damıtma, kuantizasyon ve budama teknikleriyle birleştirilerek çıkarım gecikmesi ile bellek tüketimi düşürülmekte; hafif modeller akıllı telefonlar ve gömülü sistemlerde çevrimdışı çalışabilir hale gelmektedir.

Bilgi Damıtma Nedir?

Bilgi damıtma (knowledge distillation), büyük ve hesaplama açısından pahalı bir modelin (öğretmen) kazandığı temsil bilgisini daha küçük, verimli bir modele (öğrenci) aktarmayı hedefleyen model sıkıştırma tekniğidir. 2015 yılında Hinton, Vinyals ve Dean'in 'Distilling the Knowledge in a Neural Network' makalesiyle formalize edilen bu yöntem, öğretmenin ham sınıf tahminleri yerine softmax olasılık dağılımlarını eğitim sinyali olarak kullanır. Bu yumuşak etiketler (soft labels), öğrenciye sınıflar arası benzerlik ilişkilerini de öğretir; örneğin bir 'kedi' görselinde modelin 'köpek' için de küçük ama sıfırdan yüksek bir olasılık ataması, ham etiketle kaybolacak bir bilgiyi taşır.

Nasıl Çalışır? Öğretmen-Öğrenci Çerçevesi

Eğitim sırasında öğrenci modeli iki kayıp bileşenini optimize eder. Birincisi, gerçek etiketlerle hesaplanan standart cross-entropy kaybı; ikincisi, öğretmenin yumuşatılmış softmax çıktılarıyla hesaplanan damıtma kaybı (KL diverjansı). Yumuşatma işlemi için temperature (T) parametresi kullanılır: T>1 değerleri softmax dağılımını düzleştirerek sınıflar arası ilişkiyi daha net aktarır; tipik değer 2-5 arasında seçilir. Son kayıp fonksiyonu bu iki bileşenin ağırlıklı ortalamasıdır: L = α·L_distill + (1-α)·L_CE. Öğretmen ağırlıkları eğitim boyunca sabit tutulurken yalnızca öğrenci güncellenir; bu tasarım hesaplama maliyetini önemli ölçüde düşürür. Öğrenci mimarisi öğretmenle aynı türde olmak zorunda değildir: bir transformer öğretmenden küçük bir CNN öğrenciye transfer mümkün olduğundan cross-architecture damıtma alanı giderek genişlemektedir.

Damıtma Türleri

  • check_circle Response-based (Çıktı Damıtma): En yaygın tür; öğretmenin son katman softmax çıktıları öğrenciye transfer edilir. DistilBERT ve TinyBERT bu yöntemle üretildi.
  • check_circle Feature-based (Ara Katman Damıtma): Öğretmenin gizli katman aktivasyonları öğrencinin ara katmanlarına hizalanır; hint learning olarak da bilinir. Derin özellik bilgisini daha doğrudan aktarır.
  • check_circle Relation-based (İlişki Damıtma): Örnekler arası öğretmen temsil benzerliği öğrenciye aktarılır; RKD (Relational Knowledge Distillation) bu kategorinin öncüsüdür.
  • check_circle Self-Distillation: Modelin kendi önceki checkpoint'larından ya da farklı derinlikteki katmanlarından elde ettiği çıktıları eğitim sinyali olarak kullanması; ek öğretmen modeli gerektirmez.

LLM Ekosistemindeki Önemi

Büyük dil modellerinin (LLM) yaygınlaşmasıyla bilgi damıtma kritik bir araç haline geldi. GPT-4 veya Claude gibi kapalı modellerin gizli çıktılarından faydalanarak Phi-3-mini, Mistral-7B veya DeepSeek-R1 gibi açık modeller damıtıldı. 2025 başında DeepSeek-R1'in 32B öğrenci varyantı, matematik akıl yürütmede OpenAI o1-mini'yi geride bıraktı; bu bulgu, damıtmanın kapasite aktarım sınırları konusundaki önyargıları kırdı. Damıtma, aynı zamanda edge deployment için belirleyici: mobil veya gömülü cihazlarda çalışması gereken modeller tipik olarak 5-10× boyut küçültmesi ve 2-4× hız artışı elde ederken doğruluk kaybı genellikle yüzde 3-5 ile sınırlı kalır. Ayrıca damıtma, veri gizliliği gerektiren ortamlarda öğretmenin eğitim datasına dokunmadan bilgisini öğrenciye aktarmanın etik bir yolunu sunar.

Avantajlar ve Sınırlamalar

Bilgi damıtmanın başlıca avantajları şunlardır: daha az veri ve hesaplama ile öğretmene yakın performans, düşük bellek ve gecikme gerektiren üretim ortamları için uygunluk, öğretmenin özel verisiyle eğitilmiş olmasına karşın genel geçer bir öğrenci elde edilebilmesi. Öte yandan sınırlamalar da göz ardı edilemez: öğrenci kapasitesi yetersizse bilgi transferi yetersiz kalır (capacity gap sorunu); öğretmen modelinin tamamen erişilebilir olmaması durumunda yalnızca API çıktılarıyla çalışmak gerekir (black-box distillation); ayrıca çok büyük model—çok küçük öğrenci kombinasyonlarında doğruluk düşüşü kabul edilemez seviyelere ulaşabilir. Damıtma, kuantizasyon veya pruning ile birleştirildiğinde sinerjik kazanımlar elde edilir.

Pratik Araçlar ve Uygulama

Hugging Face Transformers kütüphanesi, DistilBERT ve TinyBERT gibi önceden damıtılmış modelleri doğrudan sunmaktadır. Özel damıtma deneyleri için PyTorch'ta öğretmen modelini dondurup (model.eval(), torch.no_grad()) öğrenciye KL diverjans kaybı uygulamak yeterlidir. Intel'in Neural Compressor, NVIDIA TensorRT ve Microsoft'un DeepSpeed ZeroQuant araçları damıtmayı kuantizasyonla birleştiren üretim odaklı pipeline'lar sunar. LLM alanında Alpaca ve Vicuna, GPT-4 API çıktılarından fine-tuning yapan popüler örneklerdir; bu yaklaşım zaman zaman 'imitation learning' olarak da anılır. Açık akademik implementasyonlar için PKD (Patient Knowledge Distillation) ve CKD (Contrastive Knowledge Distillation) repoları iyi bir başlangıç noktası sunar.

Sık Sorulan Sorular

  • check_circle Bilgi damıtma ile model kuantizasyonu arasındaki fark nedir? Kuantizasyon ağırlık hassasiyetini (float32→int8) düşürerek boyutu küçültür; damıtma ise bağımsız bir küçük model eğitir. İkisi birbirini dışlamaz ve genellikle birlikte kullanılır.
  • check_circle Öğretmen modeli şart mı? Kendi modelimi damıtabilir miyim? Hayır. Self-distillation'da model kendi önceki epoch çıktılarını veya daha derin katmanlarını öğretmen olarak kullanır. Ek model gerektirmeyen bu yöntem regularizasyon etkisi de sağlar.
  • check_circle Temperature parametresini nasıl seçmeliyim? Genellikle 2-5 aralığı önerilir. Düşük T daha keskin, yüksek T daha yumuşak bir dağılım üretir. α (loss ağırlığı) ile birlikte grid search veya kısa validation loop ile ayarlanır.
  • check_circle Black-box damıtma nedir; API erişimim varsa kullanabilir miyim? Evet. Öğretmenin ağırlıklarına değil yalnızca çıktı olasılıklarına erişimle de damıtma yapılabilir. GPT-4 API çıktılarından fine-tuning (Alpaca, Vicuna) bu yaklaşımın gerçek dünya örneğidir.
  • check_circle DeepSeek-R1 damıtması neden önemli? 2025 başında DeepSeek ekibi, 32B öğrenci modelin OpenAI o1-mini'yi matematik kıyaslamalarında geçtiğini gösterdi. Bu, damıtmanın büyük akıl yürütme modellerinden küçük modellere düşünme kapasitesi aktarabildiğini kanıtladı.
  • check_circle Damıtma için ne kadar veri gerekir? Öğretmenin eğitim verisine gerek yoktur; öğrenci eğitim seti veya task-specific veri yeterlidir. Öğretmen zaten bu verilerden bilgiyi soft label olarak kodlar. Küçük veri setlerinde bile tatmin edici transfer mümkündür.