tag ön-eğitim
Pre-training (Ön Eğitim) (Ön Eğitim)
Bu sayfada ön-eğitim (Pre-training (Ön Eğitim) (Ön Eğitim)) etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.
Pre-training (Ön Eğitim), dil modelleri ve diğer derin öğrenme sistemlerinin belirli bir göreve yönlendirilmeden önce büyük ve çeşitli ham veri kümeleri üzerinde genel dil örüntülerini, bilgi yapılarını ve dünya modelini kazandığı ilk eğitim aşamasıdır. Modern yapay zekanın temel taşı olan bu süreç, foundation model paradigmasının merkezinde yer almaktadır. Pre-training'in çalışma mantığı modelin türüne göre farklılaşır. Otoregressif dil modellerinde (GPT ailesi) model, her adımda bir önceki tokenlere bakarak sonraki tokeni tahmin eder; bu görev dil modellemesi (causal language modeling) olarak adlandırılır. Maskelemeli dil modellerinde (BERT) ise giriş cümlesindeki rastgele tokenler gizlenerek model bu maskelenmiş tokenleri bağlamdan yeniden kazanmayı öğrenir. Her iki yaklaşım da öz-denetimli öğrenme prensibine dayandığından etiketsiz büyük veri kullanılabilir; metinlerin kendisi öğrenme sinyali oluşturur. Veri ölçeği açısından modern pre-training'in devasa boyutları dikkat çekicidir: GPT-3 yaklaşık 300 milyar token, LLaMA 3 ise 15 trilyon token üzerinde eğitilmiştir. Bu veri kümeleri İnternet metinleri (Common Crawl), kitaplar, akademik makaleler, kod depoları ve çok dilli içeriklerden derlenir. Eğitim bilgi işlem maliyeti de aynı ölçekte büyüktür; GPT-4 eğitiminin yüz milyon dolar civarında olduğu tahmin edilmektedir. Pre-training tamamlandıktan sonra model çeşitli yöntemlerle belirli görevlere uyarlanır. İnce ayar (fine-tuning) ile ilgili alan verisi üzerinde model özelleştirilir. RLHF (Reinforcement Learning from Human Feedback) ile insan tercihlerine hizalanır. Komut ayarı (instruction tuning) ise modelin doğal dil talimatlarını izlemesini öğretir. PEFT yöntemleri (LoRA, QLoRA) ise tüm ağırlıklar yerine küçük adaptör katmanları eğiterek bu uyarlama maliyetini büyük ölçüde düşürür. Pre-training sırasında kazanılan genel bilgi altyapısı korunarak bunun üzerine inşa edilir; bu nedenle pre-training kalitesi ve veri çeşitliliği nihai modelin performans tavanını doğrudan belirler.
Pre-training (Ön Eğitim) (Ön Eğitim)
Pre-training (Ön Eğitim), dil modelleri ve diğer derin öğrenme sistemlerinin belirli bir göreve yönlendirilmeden önce büyük ve çeşitli ham veri kümeleri üzerinde genel dil örüntülerini, bilgi yapılarını ve dünya modelini kazandığı ilk eğitim aşamasıdır. Modern yapay zekanın temel taşı olan bu süreç, foundation model paradigmasının merkezinde yer almaktadır. Pre-training'in çalışma mantığı modelin türüne göre farklılaşır. Otoregressif dil modellerinde (GPT ailesi) model, her adımda bir önceki tokenlere bakarak sonraki tokeni tahmin eder; bu görev dil modellemesi (causal language modeling) olarak adlandırılır. Maskelemeli dil modellerinde (BERT) ise giriş cümlesindeki rastgele tokenler gizlenerek model bu maskelenmiş tokenleri bağlamdan yeniden kazanmayı öğrenir. Her iki yaklaşım da öz-denetimli öğrenme prensibine dayandığından etiketsiz büyük veri kullanılabilir; metinlerin kendisi öğrenme sinyali oluşturur. Veri ölçeği açısından modern pre-training'in devasa boyutları dikkat çekicidir: GPT-3 yaklaşık 300 milyar token, LLaMA 3 ise 15 trilyon token üzerinde eğitilmiştir. Bu veri kümeleri İnternet metinleri (Common Crawl), kitaplar, akademik makaleler, kod depoları ve çok dilli içeriklerden derlenir. Eğitim bilgi işlem maliyeti de aynı ölçekte büyüktür; GPT-4 eğitiminin yüz milyon dolar civarında olduğu tahmin edilmektedir. Pre-training tamamlandıktan sonra model çeşitli yöntemlerle belirli görevlere uyarlanır. İnce ayar (fine-tuning) ile ilgili alan verisi üzerinde model özelleştirilir. RLHF (Reinforcement Learning from Human Feedback) ile insan tercihlerine hizalanır. Komut ayarı (instruction tuning) ise modelin doğal dil talimatlarını izlemesini öğretir. PEFT yöntemleri (LoRA, QLoRA) ise tüm ağırlıklar yerine küçük adaptör katmanları eğiterek bu uyarlama maliyetini büyük ölçüde düşürür. Pre-training sırasında kazanılan genel bilgi altyapısı korunarak bunun üzerine inşa edilir; bu nedenle pre-training kalitesi ve veri çeşitliliği nihai modelin performans tavanını doğrudan belirler.
Deep Belief Network (Derin İnanç Ağı)
Derin İnanç Ağı (Deep Belief Network — DBN), birden fazla Kısıtlı Boltzmann Makinesi'nin (Restricted Boltzmann Machine — RBM) hiyerarşik olarak yığıldığı olasılıksal bir derin öğrenme modelidir. Her katman, bir alt katmanın gizli birimlerini temsil ederken bir üst katmanın görünür birimleri olarak işlev görür; böylece veri içindeki soyutlama düzeyi ağın derinliğiyle birlikte artar. Ham veriden başlayarak pikseller, kenarlar, şekiller ve nesneler gibi giderek daha soyut temsiller öğrenir. Modelin tarihsel önemi, Geoffrey Hinton, Simon Osindero ve Yee-Whye Teh'in 2006 yılında Science dergisinde yayımladığı dönüm noktası niteliğindeki makaleden kaynaklanmaktadır. Bu çalışma, derin ağların eğitimindeki temel güçlük olan kaybolan gradyan (vanishing gradient) sorununa pratik bir çözüm sundu: Açgözlü katman-bazlı ön eğitim (greedy layer-wise pretraining). Bu yaklaşımda her RBM katmanı, alttaki katmanın çıktısını girdi olarak alarak bağımsız ve denetimsiz biçimde eğitilir. Ardından tüm ağ, denetimli ince ayar (supervised fine-tuning) ile geri yayılım algoritması kullanılarak optimize edilir. Bir RBM, görünür ve gizli olmak üzere iki katmanlı enerji tabanlı bir olasılıksal modeldir. Kısıtlı sıfatı, aynı katmandaki birimler arasında bağlantı bulunmadığını ifade eder; bu yapı tam Boltzmann makinelerine kıyasla eğitimi hesaplanabilir kılar. RBM eğitiminde Contrastive Divergence (CD-k) algoritması kullanılır; bu yaklaşım maksimum olabilirlik tahminin pratikte uygulanabilir bir yaklaşımıdır. Pratik kullanım açısından DBN'ler 2006-2012 yılları arasında özellikle boyut indirgeme, özellik öğrenme, öneri sistemleri ve konuşma tanıma alanlarında öne çıktı. Carnegie Mellon ve Toronto Üniversitesi'nden ekipler, MNIST rakam tanıma kıyaslamasında dönemin en yüksek doğruluk oranlarını DBN ile elde etti. Microsoft Research, DBN tabanlı konuşma tanıma sistemleriyle hata oranını dramatik biçimde düşürdü. 2012'den itibaren Evrişimli Sinir Ağları (CNN) ve Uzun-Kısa Süreli Bellek (LSTM) ağlarının ImageNet ve konuşma tanımadaki başarıları, DBN'lerin kullanımını önemli ölçüde daralttı. Bununla birlikte DBN kavramı; modern üretken modellerin, özellikle Değişken Özkodlayıcılar (VAE) ve Difüzyon Modellerinin teorik zeminini anlama açısından hâlâ eğitim ve araştırma bağlamında incelenmektedir. Geoffrey Hinton, bu çalışmadaki katkıları da dahil olmak üzere derin öğrenme alanındaki başarıları nedeniyle 2018 Turing Ödülü'nü almış; 2024 yılında ise Nobel Fizik Ödülü'ne layık görülmüştür.
Contrastive Learning (Karşıtlıklı Öğrenme)
Karşıtlıklı öğrenme, bir modelin benzer örnekleri birbirine yakın, farklı örnekleri ise birbirinden uzak temsil etmeyi öğrendiği bir öz-denetimli makine öğrenimi paradigmasıdır. Temel fikir, aynı verinin farklı görünümlerini (augmentasyonlarını) pozitif çift olarak, rastgele seçilen farklı örnekleri ise negatif çift olarak kullanmaktır. Model, pozitif çiftlerin gömme vektörlerini uzayda birbirine yaklaştırırken negatif çiftleri uzaklaştıracak şekilde eğitilir. Bu yöntem, etiketli veriye olan bağımlılığı azaltarak büyük miktarda etiketsiz veriden anlamlı özellikler öğrenmeyi mümkün kılar. Kayıp fonksiyonu olarak genellikle InfoNCE veya NT-Xent kullanılır; bu formüller pozitif çiftin benzerliğini maksimize ederken negatif çiftlerin benzerliğini minimize eder. Sıcaklık (temperature) parametresi, öğrenmenin ne kadar sert veya yumuşak olacağını kontrol eder. Büyük batch boyutu kullanmak daha fazla negatif örnek anlamına geldiğinden doğrudan performansı etkiler. Önde gelen çerçeveler farklı yöntemler kullanır. SimCLR, büyük batch boyutu ve projeksiyon başlığıyla yüksek performans elde eder. MoCo, momentum kontrast yöntemi ve hafıza kuyruğuyla daha küçük batch boyutlarında çalışır. BYOL negatif örneklere gerek duymadan online ve target ağ mimarisini kullanır; bu yaklaşım negatif çift seçimindeki önyargıdan kaynaklanan hataları ortadan kaldırır. CLIP, görüntü-metin çiftleriyle eğitilerek sıfır-atımlı sınıflandırma ve çapraz modal arama görevlerinde çığır açmıştır. Uygulama alanları son derece geniştir: tıbbi görüntü analizi, ses tanıma, moleküler biyoloji, öneri sistemleri ve grafik verileri üzerinde çalışan modeller karşıtlıklı öğrenme tekniklerinden yararlanır. Büyük dil modellerinin ve görüntü-dil modellerinin ön-eğitiminde kritik bir rol oynamaktadır. Negatif çift sayısı modelin ayırt edici özellikler öğrenme kalitesini doğrudan etkiler; daha fazla negatif örnek genellikle daha iyi temsil öğrenimiyle sonuçlanır. Karşıtlıklı öğrenme, etiketleme maliyeti yüksek alanlarda yarı-denetimli öğrenmeyle birleştirildiğinde güçlü sonuçlar üretmektedir. Bu yöntemin gücü, modelin veri içindeki yapıyı ve anlam ilişkilerini insan etiketlemesi gerektirmeden keşfedebilmesinden kaynaklanmaktadır.