Bilgi Damıtma Nedir?
Bilgi damıtma (knowledge distillation), büyük ve hesaplama açısından pahalı bir modelin (öğretmen) kazandığı temsil bilgisini daha küçük, verimli bir modele (öğrenci) aktarmayı hedefleyen model sıkıştırma tekniğidir. 2015 yılında Hinton, Vinyals ve Dean'in 'Distilling the Knowledge in a Neural Network' makalesiyle formalize edilen bu yöntem, öğretmenin ham sınıf tahminleri yerine softmax olasılık dağılımlarını eğitim sinyali olarak kullanır. Bu yumuşak etiketler (soft labels), öğrenciye sınıflar arası benzerlik ilişkilerini de öğretir; örneğin bir 'kedi' görselinde modelin 'köpek' için de küçük ama sıfırdan yüksek bir olasılık ataması, ham etiketle kaybolacak bir bilgiyi taşır.
Nasıl Çalışır? Öğretmen-Öğrenci Çerçevesi
Eğitim sırasında öğrenci modeli iki kayıp bileşenini optimize eder. Birincisi, gerçek etiketlerle hesaplanan standart cross-entropy kaybı; ikincisi, öğretmenin yumuşatılmış softmax çıktılarıyla hesaplanan damıtma kaybı (KL diverjansı). Yumuşatma işlemi için temperature (T) parametresi kullanılır: T>1 değerleri softmax dağılımını düzleştirerek sınıflar arası ilişkiyi daha net aktarır; tipik değer 2-5 arasında seçilir. Son kayıp fonksiyonu bu iki bileşenin ağırlıklı ortalamasıdır: L = α·L_distill + (1-α)·L_CE. Öğretmen ağırlıkları eğitim boyunca sabit tutulurken yalnızca öğrenci güncellenir; bu tasarım hesaplama maliyetini önemli ölçüde düşürür. Öğrenci mimarisi öğretmenle aynı türde olmak zorunda değildir: bir transformer öğretmenden küçük bir CNN öğrenciye transfer mümkün olduğundan cross-architecture damıtma alanı giderek genişlemektedir.
Damıtma Türleri
- check_circle Response-based (Çıktı Damıtma): En yaygın tür; öğretmenin son katman softmax çıktıları öğrenciye transfer edilir. DistilBERT ve TinyBERT bu yöntemle üretildi.
- check_circle Feature-based (Ara Katman Damıtma): Öğretmenin gizli katman aktivasyonları öğrencinin ara katmanlarına hizalanır; hint learning olarak da bilinir. Derin özellik bilgisini daha doğrudan aktarır.
- check_circle Relation-based (İlişki Damıtma): Örnekler arası öğretmen temsil benzerliği öğrenciye aktarılır; RKD (Relational Knowledge Distillation) bu kategorinin öncüsüdür.
- check_circle Self-Distillation: Modelin kendi önceki checkpoint'larından ya da farklı derinlikteki katmanlarından elde ettiği çıktıları eğitim sinyali olarak kullanması; ek öğretmen modeli gerektirmez.
LLM Ekosistemindeki Önemi
Büyük dil modellerinin (LLM) yaygınlaşmasıyla bilgi damıtma kritik bir araç haline geldi. GPT-4 veya Claude gibi kapalı modellerin gizli çıktılarından faydalanarak Phi-3-mini, Mistral-7B veya DeepSeek-R1 gibi açık modeller damıtıldı. 2025 başında DeepSeek-R1'in 32B öğrenci varyantı, matematik akıl yürütmede OpenAI o1-mini'yi geride bıraktı; bu bulgu, damıtmanın kapasite aktarım sınırları konusundaki önyargıları kırdı. Damıtma, aynı zamanda edge deployment için belirleyici: mobil veya gömülü cihazlarda çalışması gereken modeller tipik olarak 5-10× boyut küçültmesi ve 2-4× hız artışı elde ederken doğruluk kaybı genellikle yüzde 3-5 ile sınırlı kalır. Ayrıca damıtma, veri gizliliği gerektiren ortamlarda öğretmenin eğitim datasına dokunmadan bilgisini öğrenciye aktarmanın etik bir yolunu sunar.
Avantajlar ve Sınırlamalar
Bilgi damıtmanın başlıca avantajları şunlardır: daha az veri ve hesaplama ile öğretmene yakın performans, düşük bellek ve gecikme gerektiren üretim ortamları için uygunluk, öğretmenin özel verisiyle eğitilmiş olmasına karşın genel geçer bir öğrenci elde edilebilmesi. Öte yandan sınırlamalar da göz ardı edilemez: öğrenci kapasitesi yetersizse bilgi transferi yetersiz kalır (capacity gap sorunu); öğretmen modelinin tamamen erişilebilir olmaması durumunda yalnızca API çıktılarıyla çalışmak gerekir (black-box distillation); ayrıca çok büyük model—çok küçük öğrenci kombinasyonlarında doğruluk düşüşü kabul edilemez seviyelere ulaşabilir. Damıtma, kuantizasyon veya pruning ile birleştirildiğinde sinerjik kazanımlar elde edilir.
Pratik Araçlar ve Uygulama
Hugging Face Transformers kütüphanesi, DistilBERT ve TinyBERT gibi önceden damıtılmış modelleri doğrudan sunmaktadır. Özel damıtma deneyleri için PyTorch'ta öğretmen modelini dondurup (model.eval(), torch.no_grad()) öğrenciye KL diverjans kaybı uygulamak yeterlidir. Intel'in Neural Compressor, NVIDIA TensorRT ve Microsoft'un DeepSpeed ZeroQuant araçları damıtmayı kuantizasyonla birleştiren üretim odaklı pipeline'lar sunar. LLM alanında Alpaca ve Vicuna, GPT-4 API çıktılarından fine-tuning yapan popüler örneklerdir; bu yaklaşım zaman zaman 'imitation learning' olarak da anılır. Açık akademik implementasyonlar için PKD (Patient Knowledge Distillation) ve CKD (Contrastive Knowledge Distillation) repoları iyi bir başlangıç noktası sunar.
Sık Sorulan Sorular
- check_circle Bilgi damıtma ile model kuantizasyonu arasındaki fark nedir? Kuantizasyon ağırlık hassasiyetini (float32→int8) düşürerek boyutu küçültür; damıtma ise bağımsız bir küçük model eğitir. İkisi birbirini dışlamaz ve genellikle birlikte kullanılır.
- check_circle Öğretmen modeli şart mı? Kendi modelimi damıtabilir miyim? Hayır. Self-distillation'da model kendi önceki epoch çıktılarını veya daha derin katmanlarını öğretmen olarak kullanır. Ek model gerektirmeyen bu yöntem regularizasyon etkisi de sağlar.
- check_circle Temperature parametresini nasıl seçmeliyim? Genellikle 2-5 aralığı önerilir. Düşük T daha keskin, yüksek T daha yumuşak bir dağılım üretir. α (loss ağırlığı) ile birlikte grid search veya kısa validation loop ile ayarlanır.
- check_circle Black-box damıtma nedir; API erişimim varsa kullanabilir miyim? Evet. Öğretmenin ağırlıklarına değil yalnızca çıktı olasılıklarına erişimle de damıtma yapılabilir. GPT-4 API çıktılarından fine-tuning (Alpaca, Vicuna) bu yaklaşımın gerçek dünya örneğidir.
- check_circle DeepSeek-R1 damıtması neden önemli? 2025 başında DeepSeek ekibi, 32B öğrenci modelin OpenAI o1-mini'yi matematik kıyaslamalarında geçtiğini gösterdi. Bu, damıtmanın büyük akıl yürütme modellerinden küçük modellere düşünme kapasitesi aktarabildiğini kanıtladı.
- check_circle Damıtma için ne kadar veri gerekir? Öğretmenin eğitim verisine gerek yoktur; öğrenci eğitim seti veya task-specific veri yeterlidir. Öğretmen zaten bu verilerden bilgiyi soft label olarak kodlar. Küçük veri setlerinde bile tatmin edici transfer mümkündür.