tag PreTraining
Pre-training (Ön Eğitim) (Ön Eğitim)
Bu sayfada PreTraining (Pre-training (Ön Eğitim) (Ön Eğitim)) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.
Pre-training (Ön Eğitim), dil modelleri ve diğer derin öğrenme sistemlerinin belirli bir göreve yönlendirilmeden önce büyük ve çeşitli ham veri kümeleri üzerinde genel dil örüntülerini, bilgi yapılarını ve dünya modelini kazandığı ilk eğitim aşamasıdır. Modern yapay zekanın temel taşı olan bu süreç, foundation model paradigmasının merkezindedir. Pre-training'in çalışma mantığı modelin türüne göre farklılaşır. Otoregressif dil modellerinde (GPT ailesi) model, her adımda bir önceki tokenlere bakarak sonraki tokeni tahmin eder; bu görev dil modellemesi (causal language modeling) olarak adlandırılır. Maskelemeli dil modellerinde (BERT) ise giriş cümlesindeki rastgele tokenler gizlenerek model bu maskelenmiş tokenleri tahmin etmeyi öğrenir. Öz-denetimli öğrenme prensibine dayandığından etiket gerekmez; metinlerin kendisi öğrenme sinyali sağlar. Veri ölçeği açısından modern pre-training'in devasa boyutları dikkat çekicidir: GPT-3 yaklaşık 300 milyar token, LLaMA 3 ise 15 trilyon token üzerinde eğitilmiştir. Bu veri kümeleri İnternet metinleri (Common Crawl), kitaplar, akademik makaleler, kod deposu ve çok dilli içeriklerden derlenir. Eğitim bilgi işlem maliyeti de aynı ölçekte büyüktür; GPT-4 eğitiminin yüz milyon dolar civarında olduğu tahmin edilmektedir. Pre-training tamamlandıktan sonra model çeşitli yöntemlerle belirli görevlere uyarlanır. İnce ayar (fine-tuning) ile ilgili alan verisiyle model özelleştirilir. RLHF ile insan tercihlerine hizalanır. Komut ayarı (instruction tuning) ise modelin doğal dil talimatlarını izlemesini öğretir. Bu uyarlama aşamaları pre-training sırasında kazanılan genel bilgi altyapısını koruyarak üzerine inşa eder.
Masked Language Modeling (Maskeli Dil Modelleme (MLM))
Masked Language Modeling (MLM), BERT ve türevlerinin ön eğitiminde kullanılan bir öğrenme görevidir. Modele verilen cümledeki token'ların rastgele bir bölümü [MASK] sembolüyle örtülür (maskelenir) ve model, bağlamı kullanarak bu gizlenen token'ları tahmin etmeye çalışır. Orijinal BERT makalesinde (Devlin ve ark., 2018) kullanılan yöntemde girdi dizisindeki token'ların %15'i seçilir. Bu seçilen token'ların %80'i [MASK] sembolüyle değiştirilirken %10'u rastgele başka bir token ile yer değiştirir, kalan %10 ise orijinal halinde bırakılır. Bu çeşitlendirme, modelin sadece [MASK] simgesini değil gerçek token dağılımını da öğrenmesini sağlar. MLM'nin en kritik özelliği modele çift yönlü (bidirectional) bağlam kavrama yeteneği kazandırmasıdır. GPT gibi öz-regresif modeller sola bakarken, BERT MLM sayesinde hem solundaki hem sağındaki token'lardan yararlanarak tahmin üretir. Bu, özellikle cümle sınıflandırma, soru cevaplama ve adlandırılmış varlık tanıma (NER) gibi anlama görevlerinde büyük avantaj sağlar. MLM, nesil yapay zeka modelleri (GPT gibi causal LM) karşısında anlama odaklı modellerin (BERT, RoBERTa, ALBERT, DistilBERT, XLM-RoBERTa) tercih ettiği ön eğitim stratejisi olmaya devam etmektedir. BERT'in genel NLP benchmark'larında devrim niteliğindeki başarısı, büyük ölçüde MLM ön eğitimine dayanmaktaydı.
Pre-training (Ön Eğitim) (Ön Eğitim)
Pre-training (Ön Eğitim), dil modelleri ve diğer derin öğrenme sistemlerinin belirli bir göreve yönlendirilmeden önce büyük ve çeşitli ham veri kümeleri üzerinde genel dil örüntülerini, bilgi yapılarını ve dünya modelini kazandığı ilk eğitim aşamasıdır. Modern yapay zekanın temel taşı olan bu süreç, foundation model paradigmasının merkezindedir. Pre-training'in çalışma mantığı modelin türüne göre farklılaşır. Otoregressif dil modellerinde (GPT ailesi) model, her adımda bir önceki tokenlere bakarak sonraki tokeni tahmin eder; bu görev dil modellemesi (causal language modeling) olarak adlandırılır. Maskelemeli dil modellerinde (BERT) ise giriş cümlesindeki rastgele tokenler gizlenerek model bu maskelenmiş tokenleri tahmin etmeyi öğrenir. Öz-denetimli öğrenme prensibine dayandığından etiket gerekmez; metinlerin kendisi öğrenme sinyali sağlar. Veri ölçeği açısından modern pre-training'in devasa boyutları dikkat çekicidir: GPT-3 yaklaşık 300 milyar token, LLaMA 3 ise 15 trilyon token üzerinde eğitilmiştir. Bu veri kümeleri İnternet metinleri (Common Crawl), kitaplar, akademik makaleler, kod deposu ve çok dilli içeriklerden derlenir. Eğitim bilgi işlem maliyeti de aynı ölçekte büyüktür; GPT-4 eğitiminin yüz milyon dolar civarında olduğu tahmin edilmektedir. Pre-training tamamlandıktan sonra model çeşitli yöntemlerle belirli görevlere uyarlanır. İnce ayar (fine-tuning) ile ilgili alan verisiyle model özelleştirilir. RLHF ile insan tercihlerine hizalanır. Komut ayarı (instruction tuning) ise modelin doğal dil talimatlarını izlemesini öğretir. Bu uyarlama aşamaları pre-training sırasında kazanılan genel bilgi altyapısını koruyarak üzerine inşa eder.