list_altİçindekilerexpand_more
- 01BERT Nedir?
- 02BERT Öncesi NLP: Ne Eksikti?
- 03Transformer Mimarisi: BERT’in Temeli
- 04Self-Attention Mekanizması
- 05BERT’in Boyutları
- 06BERT Nasıl Eğitilir? Pre-Training
- 07Görev 1: Masked Language Model (MLM)
- 08Görev 2: Next Sentence Prediction (NSP)
- 09Tokenization: WordPiece
- 10Fine-Tuning: BERT’i Göreve Uyarlamak
- 11BERT Neden Devrim Yarattı?
- 12BERT Varyantları ve Mirasçıları
- 13BERT ile Pratik Uygulamalar
- 14Duygu Analizi (Sentiment Analysis)
- 15Adlandırılmış Varlık Tanıma (Named Entity Recognition — NER)
- 16Soru-Cevap Sistemleri (Question Answering)
- 17Anlam Benzerliği ve Semantik Arama
- 18BERT Sınırlamaları
- 19BERT’ten Sonra: Modern NLP
- 20Google BERT ve Arama
- 21Sonuç

2018’de Google araştırmacıları bir makale yayımladı: “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.” Başlık teknik görünüyor olabilir, ama içeriği NLP tarihini ikiye böldü. BERT öncesi ve BERT sonrası.
O güne kadar dil modelleri metni ya soldan sağa ya da sağdan sola işliyordu. BERT her iki yönü aynı anda değerlendirdi. Sonuç: 11 farklı NLP görevinde aynı anda yeni rekordur. Soru cevaplama, duygu analizi, metin sınıflandırma — hepsinde.
Bu rehberde BERT’in ne olduğunu, neden önemli olduğunu, nasıl çalıştığını ve bugün nerede durduğunu açıklıyoruz.
BERT Nedir?
BERT (Bidirectional Encoder Representations from Transformers), Google tarafından 2018 yılında geliştirilen Transformer tabanlı dil temsil modelidir. Adındaki her kelime bir anlam taşıyor:
- Bidirectional (Çift Yönlü): Metni hem soldan sağa hem sağdan sola aynı anda okur. “Banka” kelimesinin nehir kenarı mı yoksa finansal kurum mu olduğunu anlamak için hem önceki hem sonraki bağlamı kullanır.
- Encoder: Transformer mimarisinin yalnızca encoder (kodlayıcı) kısmını kullanır. Metin üretmez; metni anlar ve temsil eder.
- Representations from Transformers: Temsil vektörlerini Transformer dikkat mekanizmasıyla üretir.
BERT’in getirdiği temel yenilik, bağlamsal kelime temsilidir. Eski yaklaşımlar her kelimeye sabit bir vektör atarken, BERT aynı kelimenin farklı bağlamlardaki farklı anlamlarını ayrı vektörlerle temsil eder.
BERT Öncesi NLP: Ne Eksikti?
BERT’i anlamak için öncesine bakmak gerekiyor.
Word2Vec ve GloVe dönemi: 2013-2015 arası hakim olan bu yaklaşımlar kelimeleri sabit vektörlerle temsil ediyordu. “Bank” kelimesinin banka mı nehir kıyısı mı olduğunu bağlamdan bağımsız biçimde bilemiyordu. Bağlam duyarsız (context-free) temsiller.
ELMo (2018): Bağlamsal temsillere geçişin habercisi. İki yönlü LSTM kullandı. Hem soldan sağa hem sağdan sola ayrı ayrı işledi ve sonuçları birleştirdi. Ama bu birleştirme sığ bir katmanda yapılıyordu; derin çift yönlülük yoktu.
GPT-1 (2018): OpenAI’nin Transformer tabanlı modeli. Yalnızca soldan sağa (tek yönlü) işleme. Dil üretiminde güçlü ama bağlamı anlamada sınırlı.
BERT bu noktada devreye girdi: derin çift yönlü işleme, büyük ölçekli pre-training ve transfer learning kombinasyonu.
Transformer Mimarisi: BERT’in Temeli
BERT, 2017’de Google’ın yayımladığı “Attention Is All You Need” makalesiyle tanınan Transformer mimarisinin encoder kısmını kullanır.
Transformer mimarisinin iki bileşeni var:
- Encoder: Girdi metnini anlamlandırır, bağlamsal temsil üretir.
- Decoder: Temsili çözümler, metin üretir. (GPT bu kısmı kullanır.)
BERT yalnızca encoder kullanır. Bu tasarım kararı BERT’i dil anlamaya odaklanan bir model yapar; dil üretmeye değil.
Self-Attention Mekanizması
Transformer’ın kalbinde self-attention yatıyor. Her kelime, cümledeki diğer tüm kelimelerle ilişkisini hesaplar ve bu ilişkilere göre ağırlıklı bir temsil oluşturur.
“Köpek kemiği kemirdi çünkü açtı” cümlesinde “aç” kelimesinin öznesinin “köpek” olduğunu anlamak için modelin bu ikisi arasındaki ilişkiyi yakalaması gerekiyor. Self-attention bunu yapar.
Multi-head attention ise bu işlemi paralel birden fazla “dikkat kafası” ile yürütür. Her kafa farklı türde ilişkileri yakalar: biri sözdizimsel, diğeri anlamsal, bir başkası coreference ilişkilerini.
BERT’in Boyutları
İki resmi BERT varyantı var:
| Model | Katman | Hidden Size | Attention Heads | Parametre |
|---|---|---|---|---|
| BERT-Base | 12 | 768 | 12 | 110M |
| BERT-Large | 24 | 1024 | 16 | 340M |
BERT-Base çoğu pratik uygulamada yeterli. BERT-Large daha güçlü ama hesaplama maliyeti yüksek.
BERT Nasıl Eğitilir? Pre-Training
BERT’in gücü iki aşamalı eğitim sürecinden geliyor: önce büyük ölçekli denetimsiz öğrenme (pre-training), sonra göreve özgü ince ayar (fine-tuning).
Pre-training, Wikipedia ve BooksCorpus gibi büyük metin korpuslarında iki görev üzerinde yapılır.
Görev 1: Masked Language Model (MLM)
Girdi cümlesindeki kelimelerin %15’i rastgele maskelenir. Model maskelenen kelimeleri tahmin etmeye çalışır.
Örnek:
Orijinal: "Köpek bahçede koştu ve yoruldu."
Maskelenmiş: "Köpek [MASK] koştu ve [MASK]."
Model tahmin eder: "bahçede", "yoruldu"
Bu görev modeli bağlamsal anlayış geliştirmeye zorlar. Maskelenen kelimeyi tahmin etmek için hem sol hem sağ bağlamı kullanmak gerekir. Tek yönlü modeller bu şekilde eğitilemez; bu nedenle BERT’in çift yönlülüğü burada kritik.
Maskeleme stratejisi biraz nüanslı: %15’lik bu payın %80’i gerçekten [MASK] token’ıyla, %10’u rastgele başka bir kelimeyle değiştirilir, %10’u ise değiştirilmeden bırakılır. Bu çeşitlendirme modelin yalnızca [MASK] token’larına değil, tüm token’lara dikkat etmesini sağlar.
Görev 2: Next Sentence Prediction (NSP)
İki cümle çifti gösterilir. Model bu iki cümlenin gerçekten ardışık mı yoksa rastgele mi seçildiğini tahmin eder.
Örnek:
Cümle A: "Makine öğrenmesi veriden örüntü çıkarır."
Cümle B: "Bu nedenle büyük veri kritik önem taşır." → IsNext: True
Cümle A: "Makine öğrenmesi veriden örüntü çıkarır."
Cümle B: "İstanbul'un nüfusu 15 milyonu geçmiştir." → IsNext: False
NSP, BERT’i cümleler arası ilişkileri kavramaya yönlendirir. Soru-cevap ve doğal dil çıkarımı (NLI) gibi görevler için kritik.
Not: Sonraki çalışmalar NSP görevinin etkisinin abartıldığını gösterdi. RoBERTa (Facebook, 2019) NSP’yi kaldırarak daha iyi sonuçlar elde etti.
Tokenization: WordPiece
BERT, WordPiece tokenization kullanır. Kelimeleri parçalara böler:
- “playing” → [“play”, “##ing”]
- “tokenization” → [“token”, “##ization”]
- “şeffaflık” → [“şeff”, “##afl”, “##ık”]
## öneki bir alt kelimenin önceki parçaya ait olduğunu belirtir. Bu yaklaşım:
- Bilinmeyen kelimeler problemini azaltır (OOV — out of vocabulary)
- Dil morfolojisini kısmen yakalar
- Kelime dağarcığı boyutunu yönetilebilir tutar (BERT-Base ~30K token)
BERT girişine üç özel token ekler:
[CLS]: Cümlenin başına eklenir. Sınıflandırma görevlerinde bu token’ın çıktı vektörü kullanılır.[SEP]: Cümle sınırlarını işaretler.[MASK]: MLM eğitiminde maskelenen konumları belirtir.
Fine-Tuning: BERT’i Göreve Uyarlamak
Pre-training’in ardından BERT göreve özgü küçük bir veri setiyle ince ayar (fine-tuning) yapılır. Bu süreç놀랍도록 basit ve güçlü:
- Pre-trained BERT ağırlıkları başlangıç noktası olarak kullanılır.
- Görev için küçük bir çıktı katmanı (head) eklenir.
- Model göreve özgü etiketli veriyle birkaç epoch eğitilir.
Bu yaklaşım “transfer learning” paradigmasının özü. Genel dil anlayışı sıfırdan eğitmek yerine pre-training’de kazanılır; görev-spesifik bilgi ise fine-tuning ile eklenir.
Farklı görev türleri için fine-tuning:
Metin sınıflandırma (Sentiment Analysis, Topic Classification): [CLS] token’ının son katman temsili sınıflandırıcıya verilir.
Token düzeyinde sınıflandırma (NER — Named Entity Recognition): Her token’ın son katman temsili ayrı ayrı sınıflandırılır.
Soru-Cevap (Question Answering): Model, sorgunun cevabının bağlamdaki başlangıç ve bitiş pozisyonunu tahmin eder.
Doğal Dil Çıkarımı (NLI): İki cümle arasındaki mantıksal ilişkiyi sınıflandırır (entailment, contradiction, neutral).
BERT Neden Devrim Yarattı?
BERT 2018’de yayımlandığında 11 NLP görevinde aynı anda yeni rekora ulaştı. Bu çok alışılmadık bir şeydi: tek bir model, birçok farklı görevi aynı anda en iyi biçimde çözüyor.
Bunun önemi şuradan geliyor: daha önce her görev için sıfırdan veya hafif değiştirilmiş modellerle çalışmak gerekiyordu. BERT ile “büyük modeli önceden eğit, küçük veriyle göreve uyarla” paradigması ana akıma girdi.
Pratik sonuçlar:
- Google, 2019’da arama motoruna BERT entegre etti. İngilizce sorguların daha iyi anlaşılması için o zamana kadar alınan en büyük adım olarak tanımlandı.
- Hugging Face platformunda binlerce fine-tuned BERT modeli paylaşıldı.
- Tıbbi metin analizi, hukuki belge işleme, müşteri hizmeti otomasyonu gibi alanlarda üretime girdi.
BERT Varyantları ve Mirasçıları
BERT’in başarısı onlarca türev modelin yolunu açtı:
RoBERTa (Facebook, 2019): BERT’i daha uzun, daha büyük veriyle eğitti ve NSP görevini kaldırdı. Birçok kıyaslamada BERT’i geride bıraktı.
DistilBERT (Hugging Face, 2019): BERT’in bilgisini knowledge distillation ile %40 daha küçük bir modele aktardı. BERT performansının %97’si, 60% hız kazanımı.
ALBERT (Google, 2019): Parametre paylaşımı ve factorized embedding ile çok daha küçük boyutta BERT benzeri performans.
BioBERT / ClinicalBERT: Biyomedikal literatür veya klinik notlarla fine-tune edilmiş domain-specific varyantlar.
mBERT: 104 dili kapsayan çok dilli BERT. Tek modelde çapraz dil transferi mümkün kılıyor.
XLM-RoBERTa (Facebook): 100 dilde daha güçlü çok dilli model.
BERT ile Pratik Uygulamalar
BERT’in gücünü soyut kavramlardan somut kullanım örneklerine taşıyalım.
Duygu Analizi (Sentiment Analysis)
E-ticaret platformlarındaki müşteri yorumlarını “olumlu / olumsuz / nötr” olarak sınıflandırmak, marka itibar takibi yapmak veya müşteri geri bildirimlerini otomatik önceliklendirmek için BERT fine-tuned modelleri yaygın biçimde kullanılıyor.
IMDb film yorumları veya Amazon ürün değerlendirmeleri gibi kamuya açık veri setleriyle fine-tuned BERT modelleri %93-95 doğruluk oranlarına ulaşıyor.
Adlandırılmış Varlık Tanıma (Named Entity Recognition — NER)
Metinden kişi adlarını, kurum isimlerini, yer adlarını, tarih ve para birimlerini otomatik çıkarmak. Haber takibi, hukuki belge analizi, finansal rapor işleme için kritik.
“Elon Musk, Tesla’nın 2024 yılındaki 97 milyar dolarlık gelirini açıkladı.” → Kişi: Elon Musk | Şirket: Tesla | Yıl: 2024 | Para birimi: 97 milyar dolar
BERT token düzeyinde sınıflandırma yapabildiğinden NER için doğal bir araç.
Soru-Cevap Sistemleri (Question Answering)
SQuAD (Stanford Question Answering Dataset) kıyaslamasında BERT ilk yayımlandığında insan performansını geçmişti. Bir bağlam metni ve soru verildiğinde, modelin cevabın bağlamdaki hangi kesimde yer aldığını bulması beklenir.
Bu yetenek kurumsal bilgi bankalarında, müşteri hizmeti botlarında ve arama sonuçlarında “öne çıkan snippet” üretiminde kullanılıyor.
Anlam Benzerliği ve Semantik Arama
İki cümlenin semantik benzerliğini ölçmek için BERT tabanlı modeller kullanılıyor. Aynı anlama gelen ama farklı kelimelerle ifade edilen cümleler yüksek benzerlik skoru alır.
“Yarın yağmur yağacak.” ve “Hava yarın yağışlı olacak.” gibi cümleler semantik arama motorunda aynı sonuçları getirmeli. Sentence-BERT (SBERT) bu göreve özelleşmiş bir BERT türevidir.
BERT Sınırlamaları
BERT güçlü ama sınırsız değil:
Metin üretemez: Yalnızca encoder olduğundan yeni metin oluşturamaz. Chatbot veya metin üretimi için uygun değil.
Maksimum 512 token sınırı: Uzun belgeler için uygun değil. Belge düzeyinde anlayış gerektiren görevlerde sınırlama.
Hesaplama maliyeti: Fine-tuning ve özellikle BERT-Large çıkarımı kaynak yoğun. Mobil veya edge uygulamalar için DistilBERT gibi sıkıştırılmış modeller gerekiyor.
Statik bilgi: Pre-training sonrası kesim tarihi. Gerçek zamanlı güncelleme yok.
BERT’ten Sonra: Modern NLP
BERT 2018’de gördüğü ilgiyi artık doğrudan almıyor. GPT-4, Claude, Gemini gibi büyük dil modelleri çok daha fazla parametre ve yetenek sunuyor.
Ama BERT’in mirası devam ediyor:
- BERT’in transfer learning paradigması bugün tüm büyük dil modellerinin temelini oluşturuyor.
- Sınıflandırma, NER, bilgi çıkarma gibi görevler için production ortamlarında DistilBERT ve RoBERTa türevleri hâlâ aktif.
- Encoder tabanlı modeller metin gömme (embedding) ve semantik arama için GPT tipi modellere kıyasla verimli alternatifler sunuyor.
GPT tipi modeller metin üretmeye, BERT tipi modeller metni anlamaya odaklanır. Bu iki paradigma birbirini tamamlıyor. RAG sistemlerinde belgeleri vektörleştirmek için BERT türevleri, yanıt üretmek için GPT türevleri kullanılıyor.
Google BERT ve Arama
BERT’in en geniş kitleli etkisi Google arama motorunda gerçekleşti. 2019’da Google, BERT’i İngilizce sorgularda kullanmaya başladığını açıkladı. Sonraki yıllarda tüm dillere yaygınlaştı.
Etki somuttu: daha önceki arama sistemleri sorgunun anahtar kelimelerine odaklanırken BERT bağlamsal anlamayı devreye soktu. “2019 için Brezilya’dan ABD’ye seyahat” sorgusunda “Brezilya’dan” gibi edatlar anlamlı hale geldi; daha önce görmezden gelinirdi.
Bugün Google’ın MUM (Multitask Unified Model) ve Gemini tabanlı sistemleri arama sıralamada daha ön planda olsa da BERT türevi modeller altyapının çeşitli katmanlarında çalışmaya devam ediyor.
Sonuç
BERT, 2018’de NLP dünyasında gerçek bir paradigma kayması yarattı. Çift yönlü Transformer encoder, MLM ve NSP pre-training görevleri ve transfer learning yaklaşımının kombinasyonu, dil anlama görevlerinde eşi görülmemiş bir sıçramayı sağladı.
Bugün GPT-4 ve Claude gibi dev modeller BERT’ten daha çok gündemde olsa da BERT’in mirasını görmezden gelmek mümkün değil. Modern büyük dil modellerinin temel paradigması — büyük ölçekli unsupervised pre-training, ardından görev-spesifik fine-tuning — BERT’in üzerine inşa edildi.
Encoder tabanlı modeller metin anlamak, sınıflandırmak ve temsil etmek için production ortamlarında hâlâ tercih edilen araç. NLP ile çalışıyorsanız BERT’i anlamak, tüm modern dil modeli ekosistemini anlamanın temel taşı.



