psychology MLM Nasıl Çalışır?
Eğitim sırasında model bir cümle alır. Tokenizer bu cümleyi token'lara böler ve rastgele seçilen %15'lik dilim işleme alınır. Seçilen token'ların %80'i [MASK] sembolüyle değiştirilir, %10'u rastgele başka bir token ile yer değiştirir ve %10'u orijinal haliyle bırakılır. Bu çeşitlendirmenin amacı, modelin gerçek uygulama sırasında hiç görmeyeceği [MASK] sembolüne aşırı bağımlı olmasını engellemektir. Model, bu maskelerin ardındaki gerçek token'ı tahmin etmeye çalışır; çapraz entropi (cross-entropy) kaybı hesaplanır ve model buna göre güncellenir. Sadece maskelenen pozisyonlar için kayıp hesaplanması, gürültüsüz bir eğitim sinyali sağlar.
MLM vs Causal Language Modeling (CLM)
swap_horiz MLM (BERT)
Çift yönlü bağlam. Hem sol hem sağ token'lar kullanılır. Anlama görevleri (sınıflandırma, NER, QA) için idealdir. Metni otomatik üretmez.
arrow_forward Causal LM (GPT)
Tek yönlü (soldan sağa). Bir sonraki token tahmin edilir. Metin üretimi için mükemmeldir. Anlama görevleri için ek fine-tuning gerektirir.
shuffle Permutation LM (XLNet)
MLM'nin sınırlılıklarını aşmak için geliştirildi. Token'ları rastgele sıralarla tahmin eder; böylece hem çift yönlü bağlam hem de otoregresif üretim avantajı elde edilir.
select_all Span MLM (SpanBERT)
Tek token yerine ardışık token aralıkları (span) maskelenir. Cümle içi ilişkileri daha iyi öğrenir; okuma anlama ve koref çözünürlüğünde üstündür.
model_training MLM Kullanan Başlıca Modeller
- check_circle BERT: Orijinal MLM modeli. İki versiyon: BERT-Base (110M) ve BERT-Large (340M). NLP anlama görevlerinde çığır açtı.
- check_circle RoBERTa: Facebook'un BERT'i daha büyük veri ve daha uzun eğitimle optimize ettiği versiyonu. Maskeleme stratejisi dinamik hale getirildi.
- check_circle ALBERT: Google'ın ağırlıkları katmanlar arasında paylaştırarak BERT'i küçülttüğü model. MLM yanında Sentence Order Prediction (SOP) görevi de eklenmiştir.
- check_circle XLM-RoBERTa: 100+ dil için çok dilli MLM modeli. Wikipedia ve Common Crawl verisiyle eğitildi. Türkçe dahil düşük kaynaklı diller için de güçlü performans sunar.
quiz Sıkça Sorulan Sorular
- check_circle Neden sadece %15 token maskelenir?: %15 oranı, yeterli eğitim sinyali üretirken eğitimi verimli tutar. Çok düşük maskeleme öğrenmeyi yavaşlatır; çok yüksek maskeleme ise bağlamın anlamlılığını bozar ve eğitimi güçleştirir.
- check_circle MLM ile fine-tuning nasıl yapılır?: Önceden eğitilmiş BERT ağırlıkları alınır. Görev başlığı (classification head) eklenir ve hedef veriye göre tüm model veya yalnızca başlık katmanı eğitilir. Büyük veriyle ön eğitim + az veriyle fine-tuning kombinasyonu transfer öğrenmenin temelidir.
- check_circle MLM metin üretebilir mi?: Hayır, MLM yalnızca anlama ve sınıflandırma görevleri için optimize edilmiştir. Metin üretimi için GPT gibi causal language model tercih edilir. Encoder-decoder mimarili T5 ise her ikisini birden destekler.
- check_circle Türkçe için hangi MLM modeli önerilir?: BERTurk (dbmdz/bert-base-turkish-cased), savasy/bert-base-turkish-128k-uncased ve XLM-RoBERTa günümüzde Türkçe NLP görevlerinde yaygın kullanılır. Hugging Face Model Hub'da mevcut tüm Türkçe BERT modellerine ulaşılabilir.