Masked Language Modeling (Maskeli Dil Modelleme (MLM))

MLM, BERT gibi modellerin token'ların %15'ini maskeleyerek çift yönlü bağlamla tahmin etmeyi öğrendiği ön eğitim görevidir.

Masked Language Modeling (MLM), BERT ve türevlerinin ön eğitiminde kullanılan bir öz-gözetimli öğrenme görevidir. Modele verilen cümledeki token'ların rastgele bir bölümü [MASK] sembolüyle örtülür ve model, bağlamı kullanarak bu gizlenen token'ları tahmin etmeye çalışır. Orijinal BERT makalesinde (Devlin ve ark., Google, 2018) girdi dizisindeki token'ların %15'i seçilir. Bu seçilen token'ların %80'i [MASK] sembolüyle değiştirilirken %10'u rastgele başka bir token ile yer değiştirir, kalan %10 ise orijinal halinde bırakılır. Bu çeşitlendirme, modelin yalnızca [MASK] sembolüne değil gerçek token dağılımına da uyum sağlamasını hedefler; çapraz entropi (cross-entropy) kaybı yalnızca maskelenen pozisyonlar üzerinden hesaplanır. MLM'nin en kritik özelliği, modele çift yönlü (bidirectional) bağlam kavrama yeteneği kazandırmasıdır. GPT gibi öz-regresif modeller yalnızca sola bakarken, BERT hem solundaki hem sağındaki token'lardan yararlanarak tahmin üretir. Bu mimari fark, özellikle cümle sınıflandırma, soru cevaplama ve adlandırılmış varlık tanıma (NER) gibi anlama görevlerinde belirgin avantaj sağlar. Çift yönlü ön eğitim güçlü bir transfer öğrenme temeli oluşturur. BERT-Base 110 milyon, BERT-Large 340 milyon parametresiyle Wikipedia ve BookCorpus verisi üzerinde eğitilmiş; görev başlığı (task head) eklenerek GLUE ve SQuAD gibi kıyaslamalarda dönemin rekor puanlarını kırmıştır. Önceden eğitilmiş ağırlıklar, hedef görev verisine ince ayar (fine-tuning) yapılarak kolayca yeniden kullanılabilmektedir. Sonraki modeller MLM'yi daha da geliştirdi. RoBERTa, daha büyük toplu iş ve dinamik maskelemeyle eğitim verimliliğini artırdı. ALBERT, katman ağırlıklarını paylaştırarak parametre sayısını düşürdü. SpanBERT, tek token yerine token aralıklarını (span) maskeleyerek okuma anlama performansını iyileştirdi. XLM-RoBERTa ise 100'den fazla dili destekleyen çok dilli MLM modelini ortaya koydu. GPT tabanlı üretici modellerin yaygınlaşmasıyla BERT tipi MLM modelleri belirli alanlarda ön plandan çekilmiş olsa da sınıflandırma, NER ve soru cevaplama gibi yapılandırılmış görevlerde yaygın biçimde kullanılmaktadır.

psychology MLM Nasıl Çalışır?

Eğitim sırasında model bir cümle alır. Tokenizer bu cümleyi token'lara böler ve rastgele seçilen %15'lik dilim işleme alınır. Seçilen token'ların %80'i [MASK] sembolüyle değiştirilir, %10'u rastgele başka bir token ile yer değiştirir ve %10'u orijinal haliyle bırakılır. Bu çeşitlendirmenin amacı, modelin gerçek uygulama sırasında hiç görmeyeceği [MASK] sembolüne aşırı bağımlı olmasını engellemektir. Model bu maskelerin ardındaki gerçek token'ı tahmin etmeye çalışır; çapraz entropi kaybı hesaplanır ve yalnızca maskelenen pozisyonlar üzerinden geri yayılım yapılır.

MLM vs Causal Language Modeling (CLM)

swap_horiz MLM (BERT)

Çift yönlü bağlam. Hem sol hem sağ token'lar kullanılır. Anlama görevleri (sınıflandırma, NER, QA) için idealdir. Metni otomatik üretmez.

arrow_forward Causal LM (GPT)

Tek yönlü (soldan sağa). Bir sonraki token tahmin edilir. Metin üretimi için mükemmeldir. Anlama görevleri için ek fine-tuning gerektirir.

shuffle Permutation LM (XLNet)

MLM'nin sınırlılıklarını aşmak için geliştirildi. Token'ları rastgele sıralarla tahmin eder; hem çift yönlü bağlam hem de otoregresif üretim avantajı elde edilir.

select_all Span MLM (SpanBERT)

Tek token yerine ardışık token aralıkları (span) maskelenir. Cümle içi ilişkileri daha iyi öğrenir; okuma anlama ve koref çözünürlüğünde üstündür.

model_training MLM Kullanan Başlıca Modeller

  • check_circle BERT: Orijinal MLM modeli. İki versiyon: BERT-Base (110M) ve BERT-Large (340M). NLP anlama görevlerinde çığır açtı.
  • check_circle RoBERTa: Facebook'un BERT'i daha büyük veri ve daha uzun eğitimle optimize ettiği versiyonu. Maskeleme stratejisi dinamik hale getirildi.
  • check_circle ALBERT: Google'ın ağırlıkları katmanlar arasında paylaştırarak BERT'i küçülttüğü model. MLM yanında Sentence Order Prediction (SOP) görevi de eklendi.
  • check_circle XLM-RoBERTa: 100+ dil için çok dilli MLM modeli. Wikipedia ve Common Crawl verisiyle eğitildi. Türkçe dahil düşük kaynaklı diller için de güçlü performans sunar.

task_alt Downstream Görevler ve Uygulamalar

  • check_circle Metin Sınıflandırma: Duygu analizi, konu tespiti ve spam filtreleme. [CLS] token'ının temsili görev başlığına beslenerek sınıflandırılır.
  • check_circle Adlandırılmış Varlık Tanıma (NER): Her token için kişi/yer/kurum etiketi atanır. Türkçe için BERTurk ile yüksek doğruluk elde edilir.
  • check_circle Soru Cevaplama (QA): SQuAD görevinde cevabın başlangıç ve bitiş token'ı tahmin edilir. BERT 2018'de bu kıyaslamada insan performansına ulaşan ilk modeldir.
  • check_circle Anlam Benzerliği: İki cümlenin anlamsal yakınlığı ölçülür. Sentence-BERT gibi modeller çift kodlayıcı (bi-encoder) yaklaşımıyla sabit uzunluklu vektörler üretir.
  • check_circle Bilgi Erişimi (Reranking): Arama motorlarında sorgu-doküman alaka puanı hesaplamak için monoBERT/duoBERT gibi BERT tabanlı yeniden sıralama (reranker) modelleri kullanılır.

quiz Sık Sorulan Sorular

  • check_circle Neden sadece %15 token maskelenir?: %15 oranı, yeterli eğitim sinyali üretirken eğitimi verimli tutar. Çok düşük maskeleme öğrenmeyi yavaşlatır; çok yüksek maskeleme ise bağlamın anlamlılığını bozar.
  • check_circle MLM ile fine-tuning nasıl yapılır?: Önceden eğitilmiş BERT ağırlıkları alınır, görev başlığı eklenir ve hedef veriye göre tüm model veya yalnızca başlık katmanı eğitilir. Bu kombinasyon transfer öğrenmenin temelidir.
  • check_circle MLM metin üretebilir mi?: MLM yalnızca anlama ve sınıflandırma görevleri için optimize edilmiştir. Metin üretimi için GPT gibi causal language model tercih edilir. T5 ise encoder-decoder mimarisiyle her ikisini birden destekler.
  • check_circle Türkçe için hangi MLM modeli önerilir?: BERTurk (dbmdz/bert-base-turkish-cased), savasy/bert-base-turkish-128k-uncased ve XLM-RoBERTa günümüzde Türkçe NLP görevlerinde yaygın kullanılır.
  • check_circle MLM ile Causal LM birlikte kullanılabilir mi?: Encoder-decoder mimarisi (T5, BART) her ikisini birleştirir. BART encoder'ı gürültüden temizleme, decoder'ı ise causal üretimle eğitilir; bu sayede özetleme ve çeviri görevlerinde güçlü performans elde edilir.