Pre-training Neden Bu Kadar Önemli?
Pre-training, foundation model paradigmasını mümkün kılan temel bileşendir. Model bu aşamada dil yapısını, gerçek dünya olgularını, mantıksal ilişkileri ve kod örüntülerini öğrenir. Sonraki uyarlama aşamaları (fine-tuning, RLHF, instruction tuning) pre-training sırasında oluşan bu bilgi altyapısını kullanır; dolayısıyla pre-training kalitesi nihai modelin performans tavanını doğrudan belirler.
Pre-training Görevleri
- check_circle Kausal Dil Modellemesi: Sol-sağ tahmin; model her adımda önceki tüm tokenlere bakarak bir sonrakini öngörür. GPT ailesi ve LLaMA bu yöntemi kullanır.
- check_circle Maskelemeli Dil Modellemesi: Tokenların %15'i maskelenir, model bağlamdan geri kazanır. BERT ve RoBERTa bu yöntemi temel alır.
- check_circle Sonraki Cümle Tahmini: BERT'te kullanılan yardımcı görev; iki cümlenin gerçekte ardışık olup olmadığını tahmin eder.
- check_circle Öz-Denetimli Görevler: Görüntü-metin eşleştirme, ses-metin hizalama gibi çok modlu görevler de pre-training kapsamında yer alabilir.
Pre-training Sonrası Uyarlama Aşamaları
- check_circle İnce Ayar (Fine-tuning): Alan özelindeki veriyle tüm veya belirli katmanların ağırlıkları güncellenir; tıp, hukuk, finans gibi dikey alanlarda yaygındır.
- check_circle RLHF: İnsan tercih etiketlerinden ödül modeli öğrenilir; PPO ile politika iyileştirilir. ChatGPT ve Claude bu yaklaşımı kullanır.
- check_circle Instruction Tuning: Çeşitli görev talimatları ve cevap çiftleriyle model doğal dil direktiflerini izlemeyi öğrenir.
- check_circle PEFT (LoRA/QLoRA): Tüm ağırlıklar yerine küçük adaptör katmanları eğitilir; hesaplama maliyeti dramatik biçimde düşer, tüketici donanımlarında ince ayar mümkün olur.
Ölçek Yasaları ve Hesaplama Maliyeti
Pre-training maliyeti ve performansı arasındaki ilişki ölçek yasaları (scaling laws) ile modellenir. Kaplan ve ark.'nın 2020 tarihli çalışması, model boyutu, veri miktarı ve hesaplama bütçesi üçgeninde güç yasası ilişkileri tanımladı. 2022'de Hoffmann ve ark. ise Chinchilla modeliyle optimal dengeyi yeniden çerçeveledi: sabit hesaplama bütçesi için model parametrelerini ve eğitim token sayısını eşit oranda ölçeklendirmek gerekir. Bu ilke, LLaMA gibi daha küçük ama çok daha fazla veriyle eğitilen modellerin doğmasına yol açtı. Hesaplama maliyeti açısından GPT-3'ün eğitiminin ~4.6 milyon dolar, GPT-4'ün ise yüz milyon dolar mertebesinde olduğu tahmin edilmektedir; bu rakamlar pre-training'i büyük sermayeli aktörlere özgü bir alan haline getirmektedir. Açık kaynak alternatifler (LLaMA, Mistral, Falcon) bu engeli kısmen aşarak topluma erişimi genişletmiştir.
Popüler Pre-training Veri Setleri
- check_circle Common Crawl: Milyarlarca web sayfasını kapsayan ham tarama veritabanı; çoğu büyük dil modelinin temel veri kaynağıdır. C4 ve FineWeb gibi filtrelenmiş türevleri tercih edilir.
- check_circle The Pile: EleutherAI tarafından derlenen 825GB'lık çeşitli metin koleksiyonu; akademik makaleler, kod, Haber grupları, Wikipedia ve daha fazlasını içerir.
- check_circle FineWeb: HuggingFace'in 2024'te yayımladığı 15 trilyon tokenluk Common Crawl türevi; ağır veri temizleme ve kalite filtrelemesiyle dikkat çeker.
- check_circle RedPajama / StarCoder Data: LLaMA'nın açık yeniden üretimi için derlenen metin ve kod veri setleri; araştırmacılara ölçeklenebilir ve denetlenebilir alternatifler sunar.
Sıkça Sorulan Sorular
- check_circle Pre-training ve fine-tuning arasındaki fark nedir?: Pre-training büyük ham veriyle genel bilgi altyapısı kurar; fine-tuning bu altyapıyı belirli bir görev veya alana uyarlar. Pre-training haftalar-aylar sürer ve masraflıdır; fine-tuning saatler içinde tamamlanabilir.
- check_circle Herkes pre-training yapabilir mi?: Küçük modeller (1-7B) için erişilebilir GPU kümesiyle mümkündür. GPT-4 ölçeğinde ise yüzlerce H100 ve yüz milyon dolar mertebesinde bütçe gerekir; bu ölçek şimdilik büyük şirketlere özgüdür.
- check_circle Continual pre-training nedir?: Mevcut bir pre-trained modelin yeni verilerle (güncel haberler, yeni alan dokümanları) ek eğitime tabi tutulmasıdır. Felaketi unutma (catastrophic forgetting) riskini yönetmek için dikkatli veri karışım oranları gerektirir.
- check_circle Pre-training veri kalitesi neden önemlidir?: Düşük kaliteli veya önyargılı pre-training verisi modelin tüm sonraki davranışını etkiler; fine-tuning bu temel önyargıları tam olarak gideremez. Deduplikasyon, toksisite filtrelemesi ve içerik kalite puanlaması bu nedenle kritiktir.
- check_circle Açık kaynaklı pre-trained modelleri ticari amaçla kullanabilir miyim?: Lisansa göre değişir: LLaMA 3 ticari kullanıma izin verirken bazı modeller yalnızca araştırma amaçlıdır. Mistral ve Falcon modelleri Apache 2.0 lisansıyla serbestçe kullanılabilir.