Soft Labels (Yumuşak Etiketler (Soft Labels))

Yumuşak etiketler, sınıflandırma modellerinin kesin 0/1 yerine olasılık dağılımı kullanan hedef değerleridir; bilgi damıtma ve etiket düzgünleştirme başta olmak üzere modern eğitim tekniklerinin temel yapı taşıdır.

Yumuşak etiketler (soft labels), bir sınıflandırma modelinin kesin ('kedi: 1, köpek: 0') one-hot kodlu etiketler (sert etiketler, hard labels) yerine olasılık dağılımlarını ('kedi: 0.8, köpek: 0.15, diğer: 0.05') hedef olarak kullanmasını ifade eder. Bu yaklaşım özellikle bilgi damıtma (knowledge distillation) sürecinde öğretmen modelin ürettiği tahmin dağılımlarını öğrenci modele aktarmanın yolu olarak kritik bir rol üstlenir. Sert etiketlerin aksine yumuşak etiketler 'karanlık bilgi' (dark knowledge) taşır: öğretmen model, yanlış sınıflar için de sıfır olmayan küçük olasılıklar atar. Örneğin bir 'kedi' görüntüsü için model 'kaplan: 0.03' skoru verebilir — bu, iki sınıf arasındaki görsel benzerliği kodlar. Öğrenci model bu ilişkileri öğrenince genelleme kapasitesi artar ve daha az veriyle daha iyi performans elde edebilir. Sıcaklık parametresi (temperature), yumuşak etiket üretiminde belirleyici rol oynar. T > 1 değerleri softmax dağılımını daha düz ve bilgisi zengin hale getirir; T = 1 standart softmax çıktısına karşılık gelir. Damıtma sürecinde kayıp fonksiyonu iki bileşenden oluşur: öğretmenin yumuşak etiketleriyle hesaplanan KL-ıraksama kaybı ve gerçek etiketlerle hesaplanan çapraz entropi kaybı. Geoffrey Hinton'ın 2015 tarihli öncü çalışması bu temeli atmış ve modern model sıkıştırma tekniklerinin yolunu açmıştır. Yumuşak etiketler yalnızca bilgi damıtmayla sınırlı değildir. Etiket düzgünleştirme (label smoothing), one-hot kodlamanın yerine her sınıfa küçük bir olasılık payı atayarak modeli aşırı güvenden korur; Transformer tabanlı modellerin eğitiminde yaygın biçimde kullanılır. Ayrıca birden fazla etiketleyicinin anlaşmazlık oranlarından türetilen yumuşak etiketler, insan belirsizliğini model eğitimine dahil etmek için tercih edilen bir yöntemdir. LLM distilasyonu bağlamında ise GPT-4 gibi büyük modellerin token olasılık dağılımları, küçük modellerin eğitiminde zengin ve maliyet-etkin bir denetim sinyali olarak kullanılmaktadır.

Sert Etiket vs. Yumuşak Etiket

tag Sert Etiket

One-hot vektör. [1, 0, 0, ...] — yalnızca doğru sınıf 1, diğerleri 0. Bilgi yoğunluğu düşük; sınıflar arası ilişki kodlanmaz.

blur_on Yumuşak Etiket

[0.8, 0.15, 0.05, ...] — öğretmenin olasılık dağılımı. Karanlık bilgi içerir; sınıflar arası benzerlik ilişkisini kodlar.

thermostat Sıcaklık Etkisi

T=1: normal softmax. T=4: dağılım yumuşar, farklılıklar azalır. Yüksek T ile yumuşatılmış etiketler daha fazla bilgi içerir.

dark_mode Karanlık Bilgi

Yanlış sınıfların küçük ama sıfır olmayan olasılıkları. Örn. kedi-kaplan benzerliğini kodlar. Öğrencinin genellemesini artırır.

calculate Damıtmada Kayıp Fonksiyonu

Standart damıtma kaybı iki bileşenden oluşur: (1) Yumuşak etiket kaybı — öğrenci ile öğretmen dağılımları arasındaki KL Divergence veya çapraz entropi (yüksek T ile), (2) Sert etiket kaybı — gerçek etiketler üzerinden öğrenci çapraz entropisi. Toplam kayıp = α * (yumuşak kayıp) + (1-α) * (sert kayıp). α hiperparametresi iki bileşenin ağırlığını belirler; tipik değerler 0.5-0.9 arasındadır.

Yumuşak Etiketlerin Kullanım Alanları

  • check_circle Bilgi Damıtma (Knowledge Distillation): Öğretmen modelin (teacher) çıkış olasılıklarını öğrenci modele (student) aktarmak için kullanılır. Öğretmenin 'belirsizliği' öğrenciye değerli bilgi taşır.
  • check_circle Etiket Düzgünleştirme (Label Smoothing): Kesin etiket [1,0,0] yerine [0.9, 0.05, 0.05] gibi küçük bir ödev olasılığı dağılımı kullanma. Aşırı öğrenmeyi (overfitting) azaltır.
  • check_circle İnsan Etiketleyici Anlaşmazlığı: Aynı metni farklı etiketleyiciler farklı sınıflandırabilir; anlaşmazlık oranından türetilen soft label modeli insan belirsizliğini yakalar.
  • check_circle Duygu Analizi: Yorumun 'biraz olumsuz' veya 'kesinlikle olumsuz' gibi niuans taşıdığı durumlarda soft label ikili etiketlemeden daha bilgi taşır.
  • check_circle LLM Distilasyonu: GPT-4 gibi büyük modelin olasılık çıktılarını kullanarak küçük modeli distile etmek; son dönemde yaygınlaşan yöntem.

Yumuşak Etiket ile Sert Etiket Arasındaki Fark

Sert etiketler (hard labels) kesin sınıf ataması yapar: [1, 0, 0] — kedi, köpek değil, kuş değil. Yumuşak etiketler ise olasılıksal bilgi içerir: [0.85, 0.10, 0.05]. Bu fark öğrenme dinamiklerini önemli ölçüde etkiler: sert etiketler modeli kesin ayrımlara zorlarken, yumuşak etiketler sınıflar arası ilişki ve benzerlik bilgisini aktarır. Hinton ve ekibinin 2015 bilgi damıtma çalışması, öğretmen modelin 'yanlış' sınıflara verdiği küçük olasılıkların öğrenci için paha biçilmez bilgi taşıdığını gösterdi. Örneğin 'araba' sınıfına %5 olasılık vermek, bu görselin araba ile belirli ortak özellikler taşıdığını ima eder. PyTorch'ta yumuşak etiket kaybı: `F.kl_div(student_log_probs, teacher_probs, reduction='batchmean')` ile KL-ıraksama kaybı hesaplanabilir. Distilasyon sıcaklığı (temperature) parametresi olasılık dağılımının keskinliğini kontrol eder; yüksek sıcaklık daha 'yumuşak' dağılım üretir.

quiz Sık Sorulan Sorular

  • check_circle Yumuşak etiketler her görevde kullanılabilir mi?: Sınıflandırma görevlerinde doğrudan uygulanır. Üretici modeller için response distillation kullanılır: öğretmenin metin çıktıları öğrenciye referans olarak verilir.
  • check_circle Damıtmada en iyi T (sıcaklık) değeri nedir?: Orijinal Hinton çalışması T=2-4 önerir. Görev ve model kapasitesine bağlıdır; genellikle ablasyon çalışmasıyla belirlenir.
  • check_circle Yumuşak etiket (soft label) nedir?: Bir sınıflandırma modelinin kesin (0/1) yerine olasılık dağılımı biçiminde ürettiği çıktılardır. Bilgi damıtma ve etiket düzgünleştirme bu kavramı kullanır.
  • check_circle Soft label neden sert etiketten daha iyi?: Sınıflar arası ilişki bilgisini kodlar ve modelin belirsizliği öğrenmesini sağlar. Bilgi damıtmada öğretmen modelin olasılık dağılımı, sadece doğru etiketten çok daha fazla bilgi taşır.
  • check_circle Etiket düzgünleştirme (label smoothing) nedir?: Kesin etiketi [1, 0, 0] yerine [0.9, 0.05, 0.05] gibi küçük bir sürtünme ekleyerek kullanmak. Modeli aşırı özgüvenden korur ve genelleme kapasitesini artırır.
  • check_circle Bilgi damıtmada soft label nasıl kullanılır?: Öğretmen modelin son katman olasılıkları (softmax çıktıları) öğrenci modelin hedef soft label'ı olur. KL-ıraksama veya cross-entropy kaybı ile öğrenci bu dağılımı taklit etmeyi öğrenir.