Transfer Learning (Transfer Öğrenme)

Büyük veriyle önceden eğitilmiş bir modelin bilgisini ilişkili başka bir göreve aktararak az veriyle yüksek başarı elde etme tekniği.

Transfer Öğrenme (Transfer Learning), büyük ve kapsamlı veri kümeleriyle önceden eğitilmiş bir modelin öğrendiği bilgiyi, farklı ama ilişkili başka bir göreve aktarma tekniğidir. Geleneksel makine öğrenmesinde her görev için model sıfırdan eğitilirdi; bu yöntem hem milyonlarca etiketli örnek hem de aylarca süren hesaplama gücü gerektiriyordu. Transfer öğrenmede iki temel aşama birbirini tamamlar: ön eğitim (pre-training) ve ince ayar (fine-tuning). Ön eğitim aşamasında model, geniş kapsamlı bir veri kümesiyle genel bilgi edinir. GPT modellerinin internet metinleriyle dil kalıplarını kavraması ya da ResNet'in ImageNet üzerindeki 14 milyon görüntüyle şekil ve doku özelliklerini çıkarması bu aşamaya örnektir. İnce ayar aşamasında ise bu temel model, çok daha küçük ve görev özgü bir veri kümesiyle yeniden optimize edilir; birkaç yüz örnek bile rekabetçi sonuçlar verebilir. Üç ana strateji öne çıkar. Özellik çıkarma (feature extraction) yönteminde ön eğitimli modelin ağırlıkları dondurulur, yalnızca son katman yeni göreve göre eğitilir. Tam ince ayar (full fine-tuning) tüm ağırlıkları günceller ve daha yüksek doğruluk sunar. LoRA ile PEFT ise küçük adaptör matrisleri ekleyerek hesaplama verimliliğini korur; büyük dil modellerinin ince ayarında standart bir yaklaşım haline gelmiştir. Hangi stratejinin seçileceği, mevcut etiketli veri miktarına ve hedef görevin kaynak görevle olan yakınlığına bağlıdır. Günümüzde BERT, RoBERTa ve LLaMA gibi ön eğitimli modeller, Türkçe duygu analizi, tıbbi metin sınıflandırması ve kod üretimi gibi alanlarda az veriyle yüksek başarı oranları sunmaktadır. Kaynak ve hedef görevler arasındaki büyük farklılık "negatif transfer" riskini doğurur; bu nedenle model ve alan seçimi dikkatli yapılmalıdır. Transfer öğrenme, modern yapay zekanın temel bileşenlerinden biri olarak büyük dil modellerinin geniş kitleler tarafından kullanılmasında belirleyici bir rol üstlenmektedir.

speed Neden Transfer Learning?

Eskiden her yeni yapay zeka problemi için modelin tamamen sıfırdan eğitilmesi gerekiyordu. Bu hem milyonlarca veri hem de aylar süren hesaplama demekti. Transfer öğrenimiyle, Google'ın ImageNet (14 milyon fotoğraf) üzerinde aylarca eğittiği devasa görüntü tanıma modelini ücretsiz indirir, yalnızca son birkaç katmanını kendi 500 adet kedi/köpek fotoğrafınızla eğitirsiniz. Model, çizgileri, şekilleri ve ışığı zaten bu genel modelden öğrendiği için sizin görevinizi dakikalar içinde kavrar.

NLP ve Büyük Dil Modellerinde Yeri

  • check_circle Ön Eğitim (Pre-training): GPT modellerindeki 'Pre-trained' kısmı aslında Transfer Öğrenmedir. Model önce internetin tüm metinleriyle 'dilin nasıl çalıştığını' öğrenir.
  • check_circle İnce Ayar (Fine-Tuning): Öğrenilen temel bilgi transfer edilir; ardından yalnızca tıp belgeleri veya hukuk metinleriyle kısa bir ince ayar yapılarak o alanın uzmanı haline getirilir.

Transfer Öğrenme Stratejileri

  • check_circle Özellik Çıkarma (Feature Extraction): Ön eğitimli modelin ağırlıkları dondurulur; yalnızca son katman(lar) yeni görev için eğitilir. Az veri için ideal: 100-1000 örnekle bile güçlü özellikler aktarılır. Hızlı ve düşük maliyetli; büyük GPU gerekmez.
  • check_circle Tam İnce Ayar (Full Fine-Tuning): Ön eğitimli model ağırlıklarının tamamı veya bir kısmı yeni veriyle güncellenir. Daha fazla veri ve hesaplama gerektirir; kademeli dondurma ile alt katmanlar korunabilir.
  • check_circle LoRA ve PEFT: Yalnızca küçük adaptör matrisler eğitilir — ana ağırlıklar değişmez. 7B-70B model aralığında standart ince ayar yöntemi; VRAM ve süre tasarrufu kritik.

Transfer Öğrenmenin Önemi ve Uygulama Alanları

Transfer öğrenme modern yapay zekanın temel taşıdır: herhangi bir pratik NLP projesi neredeyse her zaman ön eğitimli modelle başlar. Neden kritik: sıfırdan eğitim için trilyonlarca token ve milyonlarca dolar; transfer öğrenme ile birkaç GPU-saatinde rekabetçi model. Görüntü transfer öğrenmesi: ImageNet eğitimli ResNet/EfficientNet → tıbbi görüntü sınıflandırma, uydu fotoğrafı analizi. NLP transfer öğrenmesi: BERT/RoBERTa → Türkçe duygu analizi, haber kategorisi. Negatif transfer: kaynak ve hedef görev çok farklıysa başarım düşebilir; alan benzerliği kontrol edilmeli. Catastrophic forgetting: ince ayar sırasında ön bilgi yitirilir — EWC ve LoRA bu sorunu hafifletir.

Modern Araçlar ve Kütüphaneler

  • check_circle HuggingFace Transformers: BERT, LLaMA, Mistral gibi binlerce ön eğitimli modele tek API ile erişim; pipeline() ve Trainer sınıfıyla ince ayar kolaylaşır.
  • check_circle PEFT Kütüphanesi: HuggingFace'in LoRA, LoHa, IA3 gibi parametre verimli yöntemleri destekleyen resmi kütüphanesi; GPU belleğini 5-10× azaltır.
  • check_circle PyTorch torchvision: ResNet, EfficientNet, ViT gibi ImageNet eğitimli görüntü modellerini pretrained=True parametresiyle saniyeler içinde yükler.
  • check_circle Unsloth: LLaMA, Mistral ve Qwen gibi açık ağırlıklı modellerin QLoRA/SFT ince ayarını 2× hızlandırır; %70 VRAM tasarrufu sunar.