psychology MLM Nasıl Çalışır?
Eğitim sırasında model bir cümle alır. Tokenizer bu cümleyi token'lara böler ve rastgele seçilen %15'lik dilim işleme alınır. Seçilen token'ların %80'i [MASK] sembolüyle değiştirilir, %10'u rastgele başka bir token ile yer değiştirir ve %10'u orijinal haliyle bırakılır. Bu çeşitlendirmenin amacı, modelin gerçek uygulama sırasında hiç görmeyeceği [MASK] sembolüne aşırı bağımlı olmasını engellemektir. Model bu maskelerin ardındaki gerçek token'ı tahmin etmeye çalışır; çapraz entropi kaybı hesaplanır ve yalnızca maskelenen pozisyonlar üzerinden geri yayılım yapılır.
MLM vs Causal Language Modeling (CLM)
swap_horiz MLM (BERT)
Çift yönlü bağlam. Hem sol hem sağ token'lar kullanılır. Anlama görevleri (sınıflandırma, NER, QA) için idealdir. Metni otomatik üretmez.
arrow_forward Causal LM (GPT)
Tek yönlü (soldan sağa). Bir sonraki token tahmin edilir. Metin üretimi için mükemmeldir. Anlama görevleri için ek fine-tuning gerektirir.
shuffle Permutation LM (XLNet)
MLM'nin sınırlılıklarını aşmak için geliştirildi. Token'ları rastgele sıralarla tahmin eder; hem çift yönlü bağlam hem de otoregresif üretim avantajı elde edilir.
select_all Span MLM (SpanBERT)
Tek token yerine ardışık token aralıkları (span) maskelenir. Cümle içi ilişkileri daha iyi öğrenir; okuma anlama ve koref çözünürlüğünde üstündür.
model_training MLM Kullanan Başlıca Modeller
- check_circle BERT: Orijinal MLM modeli. İki versiyon: BERT-Base (110M) ve BERT-Large (340M). NLP anlama görevlerinde çığır açtı.
- check_circle RoBERTa: Facebook'un BERT'i daha büyük veri ve daha uzun eğitimle optimize ettiği versiyonu. Maskeleme stratejisi dinamik hale getirildi.
- check_circle ALBERT: Google'ın ağırlıkları katmanlar arasında paylaştırarak BERT'i küçülttüğü model. MLM yanında Sentence Order Prediction (SOP) görevi de eklendi.
- check_circle XLM-RoBERTa: 100+ dil için çok dilli MLM modeli. Wikipedia ve Common Crawl verisiyle eğitildi. Türkçe dahil düşük kaynaklı diller için de güçlü performans sunar.
task_alt Downstream Görevler ve Uygulamalar
- check_circle Metin Sınıflandırma: Duygu analizi, konu tespiti ve spam filtreleme. [CLS] token'ının temsili görev başlığına beslenerek sınıflandırılır.
- check_circle Adlandırılmış Varlık Tanıma (NER): Her token için kişi/yer/kurum etiketi atanır. Türkçe için BERTurk ile yüksek doğruluk elde edilir.
- check_circle Soru Cevaplama (QA): SQuAD görevinde cevabın başlangıç ve bitiş token'ı tahmin edilir. BERT 2018'de bu kıyaslamada insan performansına ulaşan ilk modeldir.
- check_circle Anlam Benzerliği: İki cümlenin anlamsal yakınlığı ölçülür. Sentence-BERT gibi modeller çift kodlayıcı (bi-encoder) yaklaşımıyla sabit uzunluklu vektörler üretir.
- check_circle Bilgi Erişimi (Reranking): Arama motorlarında sorgu-doküman alaka puanı hesaplamak için monoBERT/duoBERT gibi BERT tabanlı yeniden sıralama (reranker) modelleri kullanılır.
quiz Sık Sorulan Sorular
- check_circle Neden sadece %15 token maskelenir?: %15 oranı, yeterli eğitim sinyali üretirken eğitimi verimli tutar. Çok düşük maskeleme öğrenmeyi yavaşlatır; çok yüksek maskeleme ise bağlamın anlamlılığını bozar.
- check_circle MLM ile fine-tuning nasıl yapılır?: Önceden eğitilmiş BERT ağırlıkları alınır, görev başlığı eklenir ve hedef veriye göre tüm model veya yalnızca başlık katmanı eğitilir. Bu kombinasyon transfer öğrenmenin temelidir.
- check_circle MLM metin üretebilir mi?: MLM yalnızca anlama ve sınıflandırma görevleri için optimize edilmiştir. Metin üretimi için GPT gibi causal language model tercih edilir. T5 ise encoder-decoder mimarisiyle her ikisini birden destekler.
- check_circle Türkçe için hangi MLM modeli önerilir?: BERTurk (dbmdz/bert-base-turkish-cased), savasy/bert-base-turkish-128k-uncased ve XLM-RoBERTa günümüzde Türkçe NLP görevlerinde yaygın kullanılır.
- check_circle MLM ile Causal LM birlikte kullanılabilir mi?: Encoder-decoder mimarisi (T5, BART) her ikisini birleştirir. BART encoder'ı gürültüden temizleme, decoder'ı ise causal üretimle eğitilir; bu sayede özetleme ve çeviri görevlerinde güçlü performans elde edilir.