tag Distilasyon

Bu sayfada Distilasyon etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

Yumuşak etiketler (soft labels), bir sınıflandırma modelinin kesin ('kedi: 1, köpek: 0') one-hot kodlu etiketler (sert etiketler, hard labels) yerine olasılık dağılımlarını ('kedi: 0.8, köpek: 0.15, diğer: 0.05') hedef olarak kullanmasını ifade eder. Bu yaklaşım özellikle bilgi damıtma (knowledge distillation) sürecinde öğretmen modelin ürettiği tahmin dağılımlarını öğrenci modele aktarmanın yolu olarak kritik bir rol üstlenir. Sert etiketlerin aksine yumuşak etiketler 'karanlık bilgi' (dark knowledge) taşır: öğretmen model, yanlış sınıflar için de sıfır olmayan küçük olasılıklar atar. Örneğin bir 'kedi' görüntüsü için model 'kaplan: 0.03' skoru verebilir — bu, iki sınıf arasındaki görsel benzerliği kodlar. Öğrenci model bu ilişkileri öğrenince genelleme kapasitesi artar ve daha az veriyle daha iyi performans elde edebilir. Sıcaklık parametresi (temperature), yumuşak etiket üretiminde belirleyici rol oynar. T > 1 değerleri softmax dağılımını daha düz ve bilgisi zengin hale getirir; T = 1 standart softmax çıktısına karşılık gelir. Damıtma sürecinde kayıp fonksiyonu iki bileşenden oluşur: öğretmenin yumuşak etiketleriyle hesaplanan KL-ıraksama kaybı ve gerçek etiketlerle hesaplanan çapraz entropi kaybı. Geoffrey Hinton'ın 2015 tarihli öncü çalışması bu temeli atmış ve modern model sıkıştırma tekniklerinin yolunu açmıştır. Yumuşak etiketler yalnızca bilgi damıtmayla sınırlı değildir. Etiket düzgünleştirme (label smoothing), one-hot kodlamanın yerine her sınıfa küçük bir olasılık payı atayarak modeli aşırı güvenden korur; Transformer tabanlı modellerin eğitiminde yaygın biçimde kullanılır. Ayrıca birden fazla etiketleyicinin anlaşmazlık oranlarından türetilen yumuşak etiketler, insan belirsizliğini model eğitimine dahil etmek için tercih edilen bir yöntemdir. LLM distilasyonu bağlamında ise GPT-4 gibi büyük modellerin token olasılık dağılımları, küçük modellerin eğitiminde zengin ve maliyet-etkin bir denetim sinyali olarak kullanılmaktadır.

blur_on

Soft Labels (Yumuşak Etiketler (Soft Labels))

Yumuşak etiketler (soft labels), bir sınıflandırma modelinin kesin ('kedi: 1, köpek: 0') one-hot kodlu etiketler (sert etiketler, hard labels) yerine olasılık dağılımlarını ('kedi: 0.8, köpek: 0.15, diğer: 0.05') hedef olarak kullanmasını ifade eder. Bu yaklaşım özellikle bilgi damıtma (knowledge distillation) sürecinde öğretmen modelin ürettiği tahmin dağılımlarını öğrenci modele aktarmanın yolu olarak kritik bir rol üstlenir. Sert etiketlerin aksine yumuşak etiketler 'karanlık bilgi' (dark knowledge) taşır: öğretmen model, yanlış sınıflar için de sıfır olmayan küçük olasılıklar atar. Örneğin bir 'kedi' görüntüsü için model 'kaplan: 0.03' skoru verebilir — bu, iki sınıf arasındaki görsel benzerliği kodlar. Öğrenci model bu ilişkileri öğrenince genelleme kapasitesi artar ve daha az veriyle daha iyi performans elde edebilir. Sıcaklık parametresi (temperature), yumuşak etiket üretiminde belirleyici rol oynar. T > 1 değerleri softmax dağılımını daha düz ve bilgisi zengin hale getirir; T = 1 standart softmax çıktısına karşılık gelir. Damıtma sürecinde kayıp fonksiyonu iki bileşenden oluşur: öğretmenin yumuşak etiketleriyle hesaplanan KL-ıraksama kaybı ve gerçek etiketlerle hesaplanan çapraz entropi kaybı. Geoffrey Hinton'ın 2015 tarihli öncü çalışması bu temeli atmış ve modern model sıkıştırma tekniklerinin yolunu açmıştır. Yumuşak etiketler yalnızca bilgi damıtmayla sınırlı değildir. Etiket düzgünleştirme (label smoothing), one-hot kodlamanın yerine her sınıfa küçük bir olasılık payı atayarak modeli aşırı güvenden korur; Transformer tabanlı modellerin eğitiminde yaygın biçimde kullanılır. Ayrıca birden fazla etiketleyicinin anlaşmazlık oranlarından türetilen yumuşak etiketler, insan belirsizliğini model eğitimine dahil etmek için tercih edilen bir yöntemdir. LLM distilasyonu bağlamında ise GPT-4 gibi büyük modellerin token olasılık dağılımları, küçük modellerin eğitiminde zengin ve maliyet-etkin bir denetim sinyali olarak kullanılmaktadır.

arrow_forward
thermostat

Temperature Scaling (Sıcaklık Ölçekleme (Temperature Scaling))

Sıcaklık ölçekleme (temperature scaling), bir sınıflandırma modelinin softmax çıktı olasılıklarını T (sıcaklık) parametresiyle düzenleyen bir kalibrasyon ve kontrol tekniğidir. Softmax fonksiyonunun girdileri (logitler) T'ye bölünür: T > 1 dağılımı düzleştirir (daha belirsiz, daha yumuşak); 0 < T < 1 ise zirveli ve keskin dağılım üretir. T → 0 limitinde model en yüksek logitli sınıfı kesinlikle seçer (greedy); T → ∞ limitinde tüm sınıflar eşit olasılık alır. Sıcaklık ölçeklemenin iki temel kullanım alanı vardır. Birincisi model kalibrasyonu: derin sinir ağları genellikle aşırı güvenli (overconfident) tahminler üretir — gerçekte %70 doğru olan durumlarda %95 olasılık söyleyebilirler. Guo et al. (2017) bu sorunu kapsamlı biçimde belgeledi; eğitim sonrası ayrılmış bir doğrulama kümesinde T optimize edilerek modelin güveni gerçek doğrulukla hizalanır. İkincisi bilgi damıtma: öğretmen modelin yumuşak etiketleri yüksek T değerleriyle düzleştirilir; bu sayede sınıflar arası benzerlik bilgisini barındıran zengin eğitim sinyalleri öğrenci modele aktarılır. LLM metin üretiminde sıcaklık farklı bir bağlamda kullanılır: bir sonraki token seçimindeki rastgeleliği kontrol eder. Yüksek sıcaklık (T ≈ 0.8–1.0) daha yaratıcı ve çeşitli metinler; düşük sıcaklık (T ≈ 0.1–0.3) daha deterministik ve öngörülebilir çıktılar üretir. Bu ayar, API çağrılarında `temperature` parametresiyle doğrudan kontrol edilebilir. Tıbbi AI, hukuk asistanları ve finansal karar destek sistemleri gibi güven kritik uygulamalarda doğru kalibrasyon hayati önem taşır. Platt scaling ve histogram binning gibi alternatif yöntemlere kıyasla temperature scaling yalnızca tek bir parametre optimize ettiğinden aşırı uyuma (overfitting) karşı özellikle dayanıklıdır. Büyük dil modellerinde bile küçük bir doğrulama kümesiyle güvenilir biçimde uygulanabilmesi, bu tekniği endüstriyel AI sistemlerinin önemli bir kalibrasyon adımı haline getirmektedir. Geniş ölçekli üretim ortamlarında minimal hesaplama maliyetiyle uygulanabilirliğini korur.

arrow_forward