Masked Language Modeling (Maskeli Dil Modelleme (MLM))

MLM, BERT gibi modellerin token'ların %15'ini maskeleyerek çift yönlü bağlamla tahmin etmeyi öğrendiği ön eğitim görevidir.

Masked Language Modeling (MLM), BERT ve türevlerinin ön eğitiminde kullanılan bir öğrenme görevidir. Modele verilen cümledeki token'ların rastgele bir bölümü [MASK] sembolüyle örtülür (maskelenir) ve model, bağlamı kullanarak bu gizlenen token'ları tahmin etmeye çalışır. Orijinal BERT makalesinde (Devlin ve ark., 2018) kullanılan yöntemde girdi dizisindeki token'ların %15'i seçilir. Bu seçilen token'ların %80'i [MASK] sembolüyle değiştirilirken %10'u rastgele başka bir token ile yer değiştirir, kalan %10 ise orijinal halinde bırakılır. Bu çeşitlendirme, modelin sadece [MASK] simgesini değil gerçek token dağılımını da öğrenmesini sağlar. MLM'nin en kritik özelliği modele çift yönlü (bidirectional) bağlam kavrama yeteneği kazandırmasıdır. GPT gibi öz-regresif modeller sola bakarken, BERT MLM sayesinde hem solundaki hem sağındaki token'lardan yararlanarak tahmin üretir. Bu, özellikle cümle sınıflandırma, soru cevaplama ve adlandırılmış varlık tanıma (NER) gibi anlama görevlerinde büyük avantaj sağlar. MLM, nesil yapay zeka modelleri (GPT gibi causal LM) karşısında anlama odaklı modellerin (BERT, RoBERTa, ALBERT, DistilBERT, XLM-RoBERTa) tercih ettiği ön eğitim stratejisi olmaya devam etmektedir. BERT'in genel NLP benchmark'larında devrim niteliğindeki başarısı, büyük ölçüde MLM ön eğitimine dayanmaktaydı.

psychology MLM Nasıl Çalışır?

Eğitim sırasında model bir cümle alır. Tokenizer bu cümleyi token'lara böler ve rastgele seçilen %15'lik dilim işleme alınır. Seçilen token'ların %80'i [MASK] sembolüyle değiştirilir, %10'u rastgele başka bir token ile yer değiştirir ve %10'u orijinal haliyle bırakılır. Bu çeşitlendirmenin amacı, modelin gerçek uygulama sırasında hiç görmeyeceği [MASK] sembolüne aşırı bağımlı olmasını engellemektir. Model, bu maskelerin ardındaki gerçek token'ı tahmin etmeye çalışır; çapraz entropi (cross-entropy) kaybı hesaplanır ve model buna göre güncellenir. Sadece maskelenen pozisyonlar için kayıp hesaplanması, gürültüsüz bir eğitim sinyali sağlar.

MLM vs Causal Language Modeling (CLM)

swap_horiz MLM (BERT)

Çift yönlü bağlam. Hem sol hem sağ token'lar kullanılır. Anlama görevleri (sınıflandırma, NER, QA) için idealdir. Metni otomatik üretmez.

arrow_forward Causal LM (GPT)

Tek yönlü (soldan sağa). Bir sonraki token tahmin edilir. Metin üretimi için mükemmeldir. Anlama görevleri için ek fine-tuning gerektirir.

shuffle Permutation LM (XLNet)

MLM'nin sınırlılıklarını aşmak için geliştirildi. Token'ları rastgele sıralarla tahmin eder; böylece hem çift yönlü bağlam hem de otoregresif üretim avantajı elde edilir.

select_all Span MLM (SpanBERT)

Tek token yerine ardışık token aralıkları (span) maskelenir. Cümle içi ilişkileri daha iyi öğrenir; okuma anlama ve koref çözünürlüğünde üstündür.

model_training MLM Kullanan Başlıca Modeller

  • check_circle BERT: Orijinal MLM modeli. İki versiyon: BERT-Base (110M) ve BERT-Large (340M). NLP anlama görevlerinde çığır açtı.
  • check_circle RoBERTa: Facebook'un BERT'i daha büyük veri ve daha uzun eğitimle optimize ettiği versiyonu. Maskeleme stratejisi dinamik hale getirildi.
  • check_circle ALBERT: Google'ın ağırlıkları katmanlar arasında paylaştırarak BERT'i küçülttüğü model. MLM yanında Sentence Order Prediction (SOP) görevi de eklenmiştir.
  • check_circle XLM-RoBERTa: 100+ dil için çok dilli MLM modeli. Wikipedia ve Common Crawl verisiyle eğitildi. Türkçe dahil düşük kaynaklı diller için de güçlü performans sunar.

quiz Sıkça Sorulan Sorular

  • check_circle Neden sadece %15 token maskelenir?: %15 oranı, yeterli eğitim sinyali üretirken eğitimi verimli tutar. Çok düşük maskeleme öğrenmeyi yavaşlatır; çok yüksek maskeleme ise bağlamın anlamlılığını bozar ve eğitimi güçleştirir.
  • check_circle MLM ile fine-tuning nasıl yapılır?: Önceden eğitilmiş BERT ağırlıkları alınır. Görev başlığı (classification head) eklenir ve hedef veriye göre tüm model veya yalnızca başlık katmanı eğitilir. Büyük veriyle ön eğitim + az veriyle fine-tuning kombinasyonu transfer öğrenmenin temelidir.
  • check_circle MLM metin üretebilir mi?: Hayır, MLM yalnızca anlama ve sınıflandırma görevleri için optimize edilmiştir. Metin üretimi için GPT gibi causal language model tercih edilir. Encoder-decoder mimarili T5 ise her ikisini birden destekler.
  • check_circle Türkçe için hangi MLM modeli önerilir?: BERTurk (dbmdz/bert-base-turkish-cased), savasy/bert-base-turkish-128k-uncased ve XLM-RoBERTa günümüzde Türkçe NLP görevlerinde yaygın kullanılır. Hugging Face Model Hub'da mevcut tüm Türkçe BERT modellerine ulaşılabilir.