Öğretmen Model Tipleri
smart_toy Büyük LLM
GPT-4, Claude Opus, Gemini 1.5 Pro gibi frontier modeller. Sentetik veri üretimi ve çevrimdışı damıtma için kullanılır. API'ye erişim yeterlidir.
group Ensemble Öğretmen
Birden fazla modelin çıktıları ortalaması. Tek öğretmenden daha istikrarlı ve zengin yumuşak etiketler sağlar.
autorenew Kendini Damıtma
Modelin önceki versiyonundan öğrenmesi. Born-Again Networks: aynı mimariyi tekrar tekrar damıtarak performans artışı.
tune Kapı Öğretmen
Görev-spesifik öğretmenler. Karmaşık görev için büyük genel model yerine küçük ama görevde uzmanlaşmış model öğretmen olabilir.
checklist Öğretmen Seçimi Kriterleri
İyi bir öğretmen model: (1) Öğrenciden belirgin biçimde güçlü olmalı (aksi hâlde transfer edecek bilgi yoktur), (2) Öğrencinin kapasitesini aşmayan gradyan sinyalleri üretmeli (kapasiteli bir öğrenci zayıf öğretmenden çok şey öğrenemez), (3) Hedef görev ve dağılımla uyumlu olmalı. Öğretmen-öğrenci kapasite farkı çok büyükse öğrenci bazen daha küçük bir ara öğretmenden daha iyi öğrenir.
Öğretmen Modelin Rolleri ve Damıtma Stratejileri
- check_circle Soft Label Üretici: Öğrenci modelin eğitim sinyali olarak kullandığı olasılık dağılımlarını üretir. Yanlış sınıflara verilen küçük olasılıklar değerli ilişki bilgisi taşır.
- check_circle Ara Özellik Rehberi: Öğretmen modelinin ara katman aktivasyonları da öğrenciye transfer edilebilir. FitNets gibi yaklaşımlar daha derin bilgi aktarımı sağlar.
- check_circle Sıcaklık Ayarı: Öğretmen çıktıları sıcaklık (T) parametresiyle yumuşatılır (T>1). Yüksek sıcaklık sınıflar arası ilişkiyi daha belirgin kılar; öğrenci bu zengin sinyali öğrenir.
- check_circle LLM Damıtma Rehberi: GPT-4 veya Claude gibi büyük modellerin yanıtları öğrenci (küçük) modelin eğitim verisi olarak kullanılır. DeepSeek-R1, Orca ve Phi serisi bu yaklaşımı kullanmıştır.
- check_circle Ensemble Öğretmen: Birden fazla öğretmen modelin çıktıları ortalaması öğrenciye daha sağlam eğitim sinyali sağlar.
Öğretmen Model Seçimi ve Telif Hakkı Kısıtlamaları
Öğretmen model seçimi, distilasyon kalitesini doğrudan belirler. Genel ilkeler: öğretmen ne kadar güçlüyse öğrenciye aktarılabilecek bilgi o kadar zengindir; ancak çok büyük bir öğretmen ile çok küçük bir öğrenci arasındaki 'kapasite uçurumu' öğrenmeyi zorlaştırabilir. Uygulamada öğretmen ve öğrenci mimarilerinin benzer olması aktarımı kolaylaştırır. Telif hakkı ve kullanım kısıtlamaları kritik bir husus: OpenAI kullanım şartları, ChatGPT/GPT-4 çıktılarının rakip AI modelleri eğitmek için kullanılmasını açıkça yasaklar. Meta'nın LLaMA lisansı, distile modellerin LLaMA kapasitesini aşmaması koşulunu içerir. Bu nedenle ticari projelerde öğretmen model seçerken lisans kısıtlamalarını dikkatlice incelemek zorunludur. Apache 2.0 lisanslı Mistral, Falcon ve Qwen distilasyon için lisans açısından sorunsuz seçenekler arasındadır.
quiz Sık Sorulan Sorular
- check_circle Öğretmen modele eğitim sırasında her zaman erişim gerekli mi?: Çevrimiçi damıtmada evet; öğretmen eğitim sırasında canlı gradyan veya çıktı sağlar. Çevrimdışı damıtmada hayır; öğretmen sadece veri üretim aşamasında gereklidir.
- check_circle Açık kaynak öğretmen modellerle damıtma yapılabilir mi?: Evet. Llama 3 70B veya Qwen2 72B gibi açık ağırlıklı modeller, daha küçük modeller için etkili öğretmenler olarak kullanılabilir.
- check_circle Öğretmen model nedir?: Bilgi damıtma sürecinde daha küçük öğrenci modele bilgi aktarmak için referans olarak kullanılan büyük, güçlü modeldir. Öğrencinin eğitim sinyali olan soft label'ları ve ara özellik çıktılarını üretir.
- check_circle Öğretmen modelin çıktıları öğrenciye nasıl aktarılır?: Öğretmen modelin softmax çıktıları (olasılık dağılımı) sıcaklık parametresiyle yumuşatılarak öğrencinin hedef sinyali olur. KL-ıraksama veya cross-entropy kaybıyla öğrenci bu dağılımı taklit etmeyi öğrenir.
- check_circle GPT-4 çıktılarını öğretmen olarak kullanabilir miyim?: OpenAI kullanım şartları, GPT/ChatGPT çıktılarının rakip AI modeli eğitmek için kullanılmasını yasaklar. Ticari kullanımda Apache 2.0 lisanslı modeller (Mistral, Qwen) daha güvenli seçenektir.
- check_circle Öğretmen-öğrenci boyutu farkı ne kadar olmalı?: Genel kural: öğretmen öğrenciden 3-10× büyük olabilir. Çok büyük kapasite farkı 'öğretmenin çok zor' olmasına neden olabilir. Orta büyüklükte öğretmen ile aşamalı distilasyon (cascaded distillation) alternatif bir yaklaşım.