Teacher Model (Öğretmen Model (Teacher Model))

Bilgi damıtmada büyük, güçlü referans model — öğrenciye sıcaklık parametresiyle yumuşatılmış olasılık dağılımları ve ara katman sinyalleri aktararak küçük modelin yetkinliğini artırır.

Öğretmen model (teacher model), bilgi damıtma (knowledge distillation) sürecinde büyük, güçlü ve pahalı sinir ağını ifade eder; bu ağın öğrendiği bilgi daha küçük bir öğrenci modele aktarılır. Geoffrey Hinton, Oriol Vinyals ve Jeff Dean'in 2015 tarihli "Distilling the Knowledge in a Neural Network" makalesi bu kavramı sistematik biçimde tanımlamış; öğretmen modelinin softmax çıktılarının sıcaklık (T) parametresiyle yumuşatılarak öğrenciye aktarılması gerektiğini ortaya koymuştur. Öğretmen modelin temel işlevi, eğitim sırasında öğrenciye rehberlik etmektir. Sert etiketler (ground truth) yerine olasılık dağılımları (yumuşak etiketler) üreterek öğrenciye daha zengin bilgi sinyalleri iletir. T = 1 iken standart softmax çıktısı elde edilir; T > 1 değerleri (tipik olarak T = 2–5) dağılımı yumuşatır ve düşük olasılıklı sınıfların bilgisini ön plana çıkarır. Bir nesne sınıflandırıcısında öğretmenin köpek için 0,85, kedi için 0,12 vermesi; öğrencinin köpek-kedi benzerliğini de öğrenmesini sağlar. Bilgi aktarımı üç farklı düzeyde gerçekleştirilebilir: yanıt tabanlı damıtma öğretmenin nihai softmax çıktılarını aktarır; özellik tabanlı damıtma (FitNets, ICLR 2015) öğretmenin ara katman aktivasyonlarını transfer eder; ilişki tabanlı damıtma ise veri örnekleri arasındaki yapısal ilişkiyi öğrenciye öğretir. Bu üç yaklaşım tek başına veya birlikte uygulanabilir; kombinasyon genellikle en yüksek öğrenci başarımını üretir. Modern LLM ekosisteminde öğretmen modeller iki farklı biçimde kullanılır: gerçek zamanlı damıtmada öğrenci eğitim sırasında öğretmenden canlı yumuşak etiket alır; veri damıtmasında ise öğretmen eğitimden önce büyük miktarda yüksek kaliteli sentetik veri üretir. DeepSeek-R1'in tam modeli, DeepSeek-R1-Distill-Llama-70B ve Qwen-7B/14B öğrencilerinin öğretmeni olmuş; bu öğrenciler matematik ve kodlama kıyaslamalarında çok büyük modellere yakın skorlar elde etmiştir. Phi-4 ve Orca serisinin başarısı da aynı veri damıtma stratejisine dayanmaktadır.

Öğretmen Model Tipleri

smart_toy Büyük LLM

GPT-4, Claude Opus, Gemini 1.5 Pro gibi frontier modeller. Sentetik veri üretimi ve çevrimdışı damıtma için kullanılır. API'ye erişim yeterlidir.

group Ensemble Öğretmen

Birden fazla modelin çıktıları ortalaması. Tek öğretmenden daha istikrarlı ve zengin yumuşak etiketler sağlar.

autorenew Kendini Damıtma

Modelin önceki versiyonundan öğrenmesi. Born-Again Networks: aynı mimariyi tekrar tekrar damıtarak performans artışı.

tune Kapı Öğretmen

Görev-spesifik öğretmenler. Karmaşık görev için büyük genel model yerine küçük ama görevde uzmanlaşmış model öğretmen olabilir.

checklist Öğretmen Seçimi Kriterleri

İyi bir öğretmen model: (1) Öğrenciden belirgin biçimde güçlü olmalı (aksi hâlde transfer edecek bilgi yoktur), (2) Öğrencinin kapasitesini aşmayan gradyan sinyalleri üretmeli (kapasiteli bir öğrenci zayıf öğretmenden çok şey öğrenemez), (3) Hedef görev ve dağılımla uyumlu olmalı. Öğretmen-öğrenci kapasite farkı çok büyükse öğrenci bazen daha küçük bir ara öğretmenden daha iyi öğrenir.

Öğretmen Modelin Rolleri ve Damıtma Stratejileri

  • check_circle Soft Label Üretici: Öğrenci modelin eğitim sinyali olarak kullandığı olasılık dağılımlarını üretir. Yanlış sınıflara verilen küçük olasılıklar değerli ilişki bilgisi taşır.
  • check_circle Ara Özellik Rehberi: Öğretmen modelinin ara katman aktivasyonları da öğrenciye transfer edilebilir. FitNets gibi yaklaşımlar daha derin bilgi aktarımı sağlar.
  • check_circle Sıcaklık Ayarı: Öğretmen çıktıları sıcaklık (T) parametresiyle yumuşatılır (T>1). Yüksek sıcaklık sınıflar arası ilişkiyi daha belirgin kılar; öğrenci bu zengin sinyali öğrenir.
  • check_circle LLM Damıtma Rehberi: GPT-4 veya Claude gibi büyük modellerin yanıtları öğrenci (küçük) modelin eğitim verisi olarak kullanılır. DeepSeek-R1, Orca ve Phi serisi bu yaklaşımı kullanmıştır.
  • check_circle Ensemble Öğretmen: Birden fazla öğretmen modelin çıktıları ortalaması öğrenciye daha sağlam eğitim sinyali sağlar.

Öğretmen Model Seçimi ve Telif Hakkı Kısıtlamaları

Öğretmen model seçimi, distilasyon kalitesini doğrudan belirler. Genel ilkeler: öğretmen ne kadar güçlüyse öğrenciye aktarılabilecek bilgi o kadar zengindir; ancak çok büyük bir öğretmen ile çok küçük bir öğrenci arasındaki 'kapasite uçurumu' öğrenmeyi zorlaştırabilir. Uygulamada öğretmen ve öğrenci mimarilerinin benzer olması aktarımı kolaylaştırır. Telif hakkı ve kullanım kısıtlamaları kritik bir husus: OpenAI kullanım şartları, ChatGPT/GPT-4 çıktılarının rakip AI modelleri eğitmek için kullanılmasını açıkça yasaklar. Meta'nın LLaMA lisansı, distile modellerin LLaMA kapasitesini aşmaması koşulunu içerir. Bu nedenle ticari projelerde öğretmen model seçerken lisans kısıtlamalarını dikkatlice incelemek zorunludur. Apache 2.0 lisanslı Mistral, Falcon ve Qwen distilasyon için lisans açısından sorunsuz seçenekler arasındadır.

quiz Sık Sorulan Sorular

  • check_circle Öğretmen modele eğitim sırasında her zaman erişim gerekli mi?: Çevrimiçi damıtmada evet; öğretmen eğitim sırasında canlı gradyan veya çıktı sağlar. Çevrimdışı damıtmada hayır; öğretmen sadece veri üretim aşamasında gereklidir.
  • check_circle Açık kaynak öğretmen modellerle damıtma yapılabilir mi?: Evet. Llama 3 70B veya Qwen2 72B gibi açık ağırlıklı modeller, daha küçük modeller için etkili öğretmenler olarak kullanılabilir.
  • check_circle Öğretmen model nedir?: Bilgi damıtma sürecinde daha küçük öğrenci modele bilgi aktarmak için referans olarak kullanılan büyük, güçlü modeldir. Öğrencinin eğitim sinyali olan soft label'ları ve ara özellik çıktılarını üretir.
  • check_circle Öğretmen modelin çıktıları öğrenciye nasıl aktarılır?: Öğretmen modelin softmax çıktıları (olasılık dağılımı) sıcaklık parametresiyle yumuşatılarak öğrencinin hedef sinyali olur. KL-ıraksama veya cross-entropy kaybıyla öğrenci bu dağılımı taklit etmeyi öğrenir.
  • check_circle GPT-4 çıktılarını öğretmen olarak kullanabilir miyim?: OpenAI kullanım şartları, GPT/ChatGPT çıktılarının rakip AI modeli eğitmek için kullanılmasını yasaklar. Ticari kullanımda Apache 2.0 lisanslı modeller (Mistral, Qwen) daha güvenli seçenektir.
  • check_circle Öğretmen-öğrenci boyutu farkı ne kadar olmalı?: Genel kural: öğretmen öğrenciden 3-10× büyük olabilir. Çok büyük kapasite farkı 'öğretmenin çok zor' olmasına neden olabilir. Orta büyüklükte öğretmen ile aşamalı distilasyon (cascaded distillation) alternatif bir yaklaşım.