Self-Supervised Learning (Öz-Denetimli Öğrenme)

Modelin etiketsiz veriden kendi gözetim sinyalini ürettiği; maskeleme, contrastive öğrenme veya öngörme görevleriyle güçlü genel temsiller öğrenen makine öğrenmesi paradigması.

Öz-denetimli öğrenme (self-supervised learning, SSL), modelin etiketsiz verilerden kendi gözetim sinyalini ürettiği bir makine öğrenmesi paradigmasıdır. Veri setinin bir bölümü gizlenerek ya da bozularak yapay bir görev oluşturulur; model bu görevi çözerken verinin iç yapısını, anlamsal ilişkilerini ve temel örüntülerini öğrenir. İnsan etiketlemesine gerek duyulmadan büyük ölçekli veriyle eğitim yapılabilmesi bu yaklaşımı modern yapay zekanın temel taşlarından biri haline getirmektedir. Bu özellik özellikle etiketlemenin maliyetli olduğu tıbbi görüntüleme ve genomik gibi alanlarda kritik bir değer yaratır. Öncül görevler yönteme özgü çeşitlilik gösterir. Metin alanında kelime maskeleme ve sonraki cümle tahmini; görüntü alanında yamaların döndürülmesi, renk kanallarının gizlenmesi ve kontrast öğrenme; ses alanında zaman dilimlerinin karıştırılması veya konuşmacı tanıma görevleri öncül görevlerin başlıca örneklerindendir. Bu görevler aracılığıyla model, downstream görevlere aktarılabilecek zengin ve genelleştirilebilir temsiller öğrenir. Her görev türü modeli farklı soyutlama düzeylerine yönlendirir ve bu çeşitlilik genel amaçlı temsil kalitesini artırır. Öncül görevin seçimi doğrudan downstream performansını belirler. Contrastive öğrenme, öz-denetimli öğrenmenin görüntü alanındaki en etkili kollarından birini oluşturmaktadır. SimCLR, MoCo ve BYOL gibi çerçeveler, aynı görüntünün farklı augmentasyonlarını birbirine yakın, farklı görüntülerin temsillerini ise uzak tutacak biçimde modeli optimize eder. GPT ailesi ise bu paradigmayı dil alanında ileri taşıyarak web ölçekli ham metin üzerinden insan düzeyine yakın akıl yürütme kapasitesi geliştirdi. Öz-denetimli ön eğitim, günümüzde çoklu-modal modellerin de temelini oluşturmakta; görüntü, metin ve ses modalitelerini ortak bir temsil uzayında birleştiren sistemlerin geliştirilmesinde belirleyici rol oynamaktadır. Bu yaklaşımın biyoinformatik, robot öğrenmesi ve iklim modellemesi gibi farklı disiplinlere uyarlanması aktif araştırma konuları arasında yer almaktadır. CLIP gibi çerçeveler öz-denetimli öğrenmenin pratik gücünü açıkça ortaya koymaktadır.

Öncül Görevler Nasıl Çalışır?

Öncül görev, verinin bir bölümünü saklar ve modeli bu gizli bilgiyi tahmin etmekle görevlendirir. Metinde bir kelime maskelenir ve model bağlamdan bu kelimeyi tahmin eder. Görüntüde bir yamanın rengi veya konumu gizlenerek yeniden oluşturulması istenir. Ses verisinde zaman dilimlerinin sırası karıştırılır ve doğru sıra tahmin edilir. Bu görevler derin anlamsal temsillerin öğrenilmesini zorlar.

Contrastive Learning

SimCLR ve MoCo gibi contrastive öğrenme yöntemleri aynı görüntünün iki farklı augmentasyonunu birbirine yaklaştırır; farklı görüntüler için üretilen temsilleri ise uzaklaştırır. Bu süreçte model görüntünün anlam özünü, piksel düzeyi detaylarından bağımsız olarak öğrenir. BYOL, negatif örnekler kullanmadan benzer başarı elde ederek bu yaklaşımı daha verimli hale getirdi.

Büyük Dil Modellerinin Temeli

GPT ailesi, web üzerindeki milyarlarca kelimeyi sonraki token tahmin görevi üzerinden öğrenerek dil yapısını, gerçek dünya bilgisini ve akıl yürütme kapasitesini aynı anda kazanır. Bu ön eğitim aşaması insan etiketi gerektirmez. İnce ayar veya RLHF ile az miktarda etiketli veri kullanılarak görev spesifik performans elde edilir.

Denetimli Öğrenmeyle Karşılaştırma

Denetimli öğrenme, büyük ölçekli etiketli veri setlerine bağımlıdır; etiketleme pahalı, zaman alıcı ve bazen öznel bir süreçtir. Öz-denetimli öğrenme bu kısıtı ortadan kaldırarak modellerin internet, kitap arşivleri, tıbbi görüntü tabanları veya genomik diziler gibi ham veri kaynaklarından öğrenmesine olanak tanır. Bu yaklaşım büyük ölçekli yapay zekanın erişilebilirliğini kökten değiştirdi.

🔄 Öz Denetimli Öğrenme Ön Eğitim Görevleri

  • check_circle Maskeli dil modelleme (MLM): gizlenen token'ları bağlamdan tahmin etme (BERT tarzı)
  • check_circle Sonraki cümle tahmini: iki cümlenin aynı belgeden gelip gelmediğini sınıflandırma
  • check_circle Kontrast öğrenme (SimCLR, MoCo): aynı görüntünün augmentasyonlarını birbirine yaklaştırma
  • check_circle Rotasyon tahmini: döndürülmüş görüntünün açısını tahmin ederek spatial anlama öğretme
  • check_circle Kontur tamamlama: maskelenen bölgeyi piksel veya yama düzeyinde yeniden oluşturma (MAE)

Sık Sorulan Sorular

  • check_circle Öz-denetimli öğrenme ile gözetimsiz öğrenme aynı şey midir? Hayır; öz-denetimli öğrenme gözetimsiz öğrenmenin alt kümesidir. Gözetimsiz öğrenme kümeleme gibi yapı keşfini içerirken öz-denetimli öğrenme veriden türetilmiş öncül görevlerle açık bir öğrenme hedefi tanımlar.
  • check_circle Contrastive learning için negatif örneğe neden ihtiyaç var? Negatif örnekler olmadan model tüm girdileri aynı temsile eşleyerek çökmüş (collapsed) bir çözüm öğrenebilir. Negatif örnekler bu trivial çözümü önler; BYOL farklı bir mimariyle bunu negatifler olmadan çözdü.
  • check_circle Hangi veri miktarı self-supervised ön eğitim için yeterlidir? Ne kadar büyük olursa o kadar iyi; ancak küçük ölçekte de fayda sağlar. BERT milyonlarca cümleyle eğitildi; GPT-3 ise 500 milyar tokeni aştı. Görüntü modellerinde ImageNet ölçeği başlangıç için yeterlidir.
  • check_circle Öz-denetimli modeller ince ayarsız kullanılabilir mi? Sıfır-öğrenim ve az-öğrenim görevlerinde evet. GPT-3 ve sonrası modeller ince ayar olmadan da birçok görevi yalnızca prompt ile gerçekleştirebilir; bu yetenek ön eğitim sırasında kazanılır.