Sert Etiket vs. Yumuşak Etiket
tag Sert Etiket
One-hot vektör. [1, 0, 0, ...] — yalnızca doğru sınıf 1, diğerleri 0. Bilgi yoğunluğu düşük; sınıflar arası ilişki kodlanmaz.
blur_on Yumuşak Etiket
[0.8, 0.15, 0.05, ...] — öğretmenin olasılık dağılımı. Karanlık bilgi içerir; sınıflar arası benzerlik ilişkisini kodlar.
thermostat Sıcaklık Etkisi
T=1: normal softmax. T=4: dağılım yumuşar, farklılıklar azalır. Yüksek T ile yumuşatılmış etiketler daha fazla bilgi içerir.
dark_mode Karanlık Bilgi
Yanlış sınıfların küçük ama sıfır olmayan olasılıkları. Örn. kedi-kaplan benzerliğini kodlar. Öğrencinin genellemesini artırır.
calculate Damıtmada Kayıp Fonksiyonu
Standart damıtma kaybı iki bileşenden oluşur: (1) Yumuşak etiket kaybı — öğrenci ile öğretmen dağılımları arasındaki KL Divergence veya çapraz entropi (yüksek T ile), (2) Sert etiket kaybı — gerçek etiketler üzerinden öğrenci çapraz entropisi. Toplam kayıp = α * (yumuşak kayıp) + (1-α) * (sert kayıp). α hiperparametresi iki bileşenin ağırlığını belirler; tipik değerler 0.5-0.9 arasındadır.
Yumuşak Etiketlerin Kullanım Alanları
- check_circle Bilgi Damıtma (Knowledge Distillation): Öğretmen modelin (teacher) çıkış olasılıklarını öğrenci modele (student) aktarmak için kullanılır. Öğretmenin 'belirsizliği' öğrenciye değerli bilgi taşır.
- check_circle Etiket Düzgünleştirme (Label Smoothing): Kesin etiket [1,0,0] yerine [0.9, 0.05, 0.05] gibi küçük bir ödev olasılığı dağılımı kullanma. Aşırı öğrenmeyi (overfitting) azaltır.
- check_circle İnsan Etiketleyici Anlaşmazlığı: Aynı metni farklı etiketleyiciler farklı sınıflandırabilir; anlaşmazlık oranından türetilen soft label modeli insan belirsizliğini yakalar.
- check_circle Duygu Analizi: Yorumun 'biraz olumsuz' veya 'kesinlikle olumsuz' gibi niuans taşıdığı durumlarda soft label ikili etiketlemeden daha bilgi taşır.
- check_circle LLM Distilasyonu: GPT-4 gibi büyük modelin olasılık çıktılarını kullanarak küçük modeli distile etmek; son dönemde yaygınlaşan yöntem.
Yumuşak Etiket ile Sert Etiket Arasındaki Fark
Sert etiketler (hard labels) kesin sınıf ataması yapar: [1, 0, 0] — kedi, köpek değil, kuş değil. Yumuşak etiketler ise olasılıksal bilgi içerir: [0.85, 0.10, 0.05]. Bu fark öğrenme dinamiklerini önemli ölçüde etkiler: sert etiketler modeli kesin ayrımlara zorlarken, yumuşak etiketler sınıflar arası ilişki ve benzerlik bilgisini aktarır. Hinton ve ekibinin 2015 bilgi damıtma çalışması, öğretmen modelin 'yanlış' sınıflara verdiği küçük olasılıkların öğrenci için paha biçilmez bilgi taşıdığını gösterdi. Örneğin 'araba' sınıfına %5 olasılık vermek, bu görselin araba ile belirli ortak özellikler taşıdığını ima eder. PyTorch'ta yumuşak etiket kaybı: `F.kl_div(student_log_probs, teacher_probs, reduction='batchmean')` ile KL-ıraksama kaybı hesaplanabilir. Distilasyon sıcaklığı (temperature) parametresi olasılık dağılımının keskinliğini kontrol eder; yüksek sıcaklık daha 'yumuşak' dağılım üretir.
quiz Sık Sorulan Sorular
- check_circle Yumuşak etiketler her görevde kullanılabilir mi?: Sınıflandırma görevlerinde doğrudan uygulanır. Üretici modeller için response distillation kullanılır: öğretmenin metin çıktıları öğrenciye referans olarak verilir.
- check_circle Damıtmada en iyi T (sıcaklık) değeri nedir?: Orijinal Hinton çalışması T=2-4 önerir. Görev ve model kapasitesine bağlıdır; genellikle ablasyon çalışmasıyla belirlenir.
- check_circle Yumuşak etiket (soft label) nedir?: Bir sınıflandırma modelinin kesin (0/1) yerine olasılık dağılımı biçiminde ürettiği çıktılardır. Bilgi damıtma ve etiket düzgünleştirme bu kavramı kullanır.
- check_circle Soft label neden sert etiketten daha iyi?: Sınıflar arası ilişki bilgisini kodlar ve modelin belirsizliği öğrenmesini sağlar. Bilgi damıtmada öğretmen modelin olasılık dağılımı, sadece doğru etiketten çok daha fazla bilgi taşır.
- check_circle Etiket düzgünleştirme (label smoothing) nedir?: Kesin etiketi [1, 0, 0] yerine [0.9, 0.05, 0.05] gibi küçük bir sürtünme ekleyerek kullanmak. Modeli aşırı özgüvenden korur ve genelleme kapasitesini artırır.
- check_circle Bilgi damıtmada soft label nasıl kullanılır?: Öğretmen modelin son katman olasılıkları (softmax çıktıları) öğrenci modelin hedef soft label'ı olur. KL-ıraksama veya cross-entropy kaybı ile öğrenci bu dağılımı taklit etmeyi öğrenir.