Öncül Görevler Nasıl Çalışır?
Öncül görev, verinin bir bölümünü saklar ve modeli bu gizli bilgiyi tahmin etmekle görevlendirir. Metinde bir kelime maskelenir ve model bağlamdan bu kelimeyi tahmin eder. Görüntüde bir yamanın rengi veya konumu gizlenerek yeniden oluşturulması istenir. Ses verisinde zaman dilimlerinin sırası karıştırılır ve doğru sıra tahmin edilir. Bu görevler derin anlamsal temsillerin öğrenilmesini zorlar.
Contrastive Learning
SimCLR ve MoCo gibi contrastive öğrenme yöntemleri aynı görüntünün iki farklı augmentasyonunu birbirine yaklaştırır; farklı görüntüler için üretilen temsilleri ise uzaklaştırır. Bu süreçte model görüntünün anlam özünü, piksel düzeyi detaylarından bağımsız olarak öğrenir. BYOL, negatif örnekler kullanmadan benzer başarı elde ederek bu yaklaşımı daha verimli hale getirdi.
Büyük Dil Modellerinin Temeli
GPT ailesi, web üzerindeki milyarlarca kelimeyi sonraki token tahmin görevi üzerinden öğrenerek dil yapısını, gerçek dünya bilgisini ve akıl yürütme kapasitesini aynı anda kazanır. Bu ön eğitim aşaması insan etiketi gerektirmez. İnce ayar veya RLHF ile az miktarda etiketli veri kullanılarak görev spesifik performans elde edilir.
Denetimli Öğrenmeyle Karşılaştırma
Denetimli öğrenme, büyük ölçekli etiketli veri setlerine bağımlıdır; etiketleme pahalı, zaman alıcı ve bazen öznel bir süreçtir. Öz-denetimli öğrenme bu kısıtı ortadan kaldırarak modellerin internet, kitap arşivleri, tıbbi görüntü tabanları veya genomik diziler gibi ham veri kaynaklarından öğrenmesine olanak tanır. Bu yaklaşım büyük ölçekli yapay zekanın erişilebilirliğini kökten değiştirdi.
🔄 Öz Denetimli Öğrenme Ön Eğitim Görevleri
- check_circle Maskeli dil modelleme (MLM): gizlenen token'ları bağlamdan tahmin etme (BERT tarzı)
- check_circle Sonraki cümle tahmini: iki cümlenin aynı belgeden gelip gelmediğini sınıflandırma
- check_circle Kontrast öğrenme (SimCLR, MoCo): aynı görüntünün augmentasyonlarını birbirine yaklaştırma
- check_circle Rotasyon tahmini: döndürülmüş görüntünün açısını tahmin ederek spatial anlama öğretme
- check_circle Kontur tamamlama: maskelenen bölgeyi piksel veya yama düzeyinde yeniden oluşturma (MAE)
Sık Sorulan Sorular
- check_circle Öz-denetimli öğrenme ile gözetimsiz öğrenme aynı şey midir? Hayır; öz-denetimli öğrenme gözetimsiz öğrenmenin alt kümesidir. Gözetimsiz öğrenme kümeleme gibi yapı keşfini içerirken öz-denetimli öğrenme veriden türetilmiş öncül görevlerle açık bir öğrenme hedefi tanımlar.
- check_circle Contrastive learning için negatif örneğe neden ihtiyaç var? Negatif örnekler olmadan model tüm girdileri aynı temsile eşleyerek çökmüş (collapsed) bir çözüm öğrenebilir. Negatif örnekler bu trivial çözümü önler; BYOL farklı bir mimariyle bunu negatifler olmadan çözdü.
- check_circle Hangi veri miktarı self-supervised ön eğitim için yeterlidir? Ne kadar büyük olursa o kadar iyi; ancak küçük ölçekte de fayda sağlar. BERT milyonlarca cümleyle eğitildi; GPT-3 ise 500 milyar tokeni aştı. Görüntü modellerinde ImageNet ölçeği başlangıç için yeterlidir.
- check_circle Öz-denetimli modeller ince ayarsız kullanılabilir mi? Sıfır-öğrenim ve az-öğrenim görevlerinde evet. GPT-3 ve sonrası modeller ince ayar olmadan da birçok görevi yalnızca prompt ile gerçekleştirebilir; bu yetenek ön eğitim sırasında kazanılır.