Nasıl Çalışır?
Distilasyon sürecinde öğrenci model iki farklı sinyalden öğrenir. Birincisi, doğrudan ground-truth etiketlerden hesaplanan standart çapraz entropi kaybıdır. İkincisi, öğretmenin temperature-scaled softmax çıktılarıyla öğrenci çıktıları arasındaki KL Divergence'tır. Sıcaklık parametresi yükseldikçe olasılık dağılımı düzleşir ve sınıflar arası benzerlik ilişkileri daha belirgin hale gelir. Son kayıp fonksiyonu bu iki terimin ağırlıklı toplamıdır; α hiperparametresi dengeyi kontrol eder. Eğitim tamamlandıktan sonra öğrenci model bağımsız olarak inference yapabilir — çıkarım sırasında öğretmen gerekmez.
Temel Bileşenler
Öğretmen Model (Teacher)
Yüksek kapasiteli, ağır hesaplama gerektiren büyük model. Örneğin BERT-large, GPT-4 veya ResNet-152.
Öğrenci Model (Student)
Üretim ortamı için tasarlanmış hafif model. DistilBERT, TinyBERT veya MobileNet gibi.
Soft Labels
Öğretmenin sıcaklık parametresiyle yumuşatılmış olasılık dağılımı; ham etiketlere göre daha fazla bilgi taşır.
Temperature (T)
Softmax çıktısını yumuşatan hiperparametre. T=1 standart softmax; T>1 daha düz dağılım ve daha zengin sınıflar-arası bilgi.
Kullanım Alanları
- check_circle Mobil ve Edge Dağıtımı: Akıllı telefon ve IoT cihazlarında çalıştırılmak üzere büyük modelleri küçülterek gecikmeyi azaltır, 5-10× boyut kazanımı tipiktir.
- check_circle Gerçek Zamanlı Çıkarım: Öneri sistemleri ve NLP pipeline'larında milisaniye düzeyinde yanıt süreleri gerektiren üretim senaryolarında kritik bir tekniktir.
- check_circle LLM Sıkıştırma: 70B+ büyük dil modellerinin bilgisini 7B veya daha küçük görev-özel modellere aktararak maliyet-verimlilik dengesi kurulur.
- check_circle Gizlilik Koruyucu ML: Hassas veri içeren öğretmen modeli merkezi tutarken öğrenciyi federated veya differential-privacy ortamında eğitme olanağı sunar.
Distilasyon Çeşitleri (Damıtma Türleri)
- check_circle Response-based Distillation: En yaygın yaklaşım: öğrenci yalnızca öğretmenin son katman çıktısından (soft labels) öğrenir.
- check_circle Feature-based Distillation: TinyBERT'te uygulanan yöntem; öğrenci öğretmenin ara katman temsilleriyle de hizalanır.
- check_circle Relation-based Distillation: Öğrenci, öğretmenin örnekler arası ilişki yapısını (örneğin benzerlik matrisleri) öğrenir.
- check_circle Self-distillation: Modelin kendi önceki checkpoint'larından veya büyük versiyonundan öğrenmesi; ek öğretmen gerekmez.
LLM Çağında Bilgi Damıtma
- check_circle Siyah Kutu Distilasyonu: Öğretmenin tam softmax çıktısına erişilemeyen durumlarda öğrenci, öğretmenin ürettiği metin örneklerinden öğrenir; bu yöntem Alpaca ve Vicuna'nın temel yaklaşımıdır.
- check_circle Sentetik Veri ile Distilasyon: Öğretmen model yüksek kaliteli eğitim örnekleri üretir; öğrenci bu sentetik veriyle fine-tune edilerek hız ve maliyet avantajı elde eder.
- check_circle Kuantizasyon ile Birleştirme: Distilasyon + 4-bit/8-bit kuantizasyon ikilisi, boyut küçültmede kümülatif kazanım sunar ve neredeyse hiç performans kaybı olmadan çalışır.
- check_circle Çok-Öğretmenli Distilasyon: Farklı uzmanlık alanlarına sahip birden fazla öğretmenin bilgisini tek bir öğrencide birleştirerek daha kapsamlı yetenek transferi yapılır.
Sık Sorulan Sorular
- check_circle Knowledge Distillation ile model pruning arasındaki fark nedir?: Pruning mevcut modelin bazı ağırlıklarını sıfırlayarak küçültür; distilasyon ise sıfırdan yeni bir küçük modeli öğretmen rehberliğinde eğitir. İkisi sıklıkla birlikte kullanılır.
- check_circle Sıcaklık (temperature) değeri nasıl seçilir?: Genellikle 2-5 arasında grid search ile belirlenir. Yüksek T sınıflar arası bilgiyi zenginleştirir; ancak çok yüksek değerler gürültüye yol açabilir.
- check_circle Hangi durumlarda distilasyon yetersiz kalır?: Öğrenci kapasitesi görevin karmaşıklığına oranla çok küçükse öğretmen bilgisi tamamen aktarılamaz. Bu duruma 'capacity mismatch' denir ve öğrencinin mimari büyüklüğünü artırmak gerekir.
- check_circle LLM distilasyonu geleneksel distilasyondan nasıl farklı?: LLM'lerde tam softmax çıktısına erişim her zaman mümkün değildir. Bu nedenle 'siyah kutu' distilasyon ve sentetik veri üretimi ön plana çıkar; Alpaca ve Vicuna bu yaklaşımın öncüleridir.
- check_circle DistilBERT ile BERT arasındaki performans farkı ne kadar?: DistilBERT, BERT'in genel NLP performansının yaklaşık %97'sini korurken model boyutunu %40, çıkarım süresini ise %60 azaltır.