İki Yönlü Okuma (Bidirectional) Neden Çığır Açtı?
Bir modeli sadece soldan sağa okutursanız sesteş kelimelerde takılır. "Banka doğru hızlıca..." cümlesinde banka bir finans kurumu mu, parktaki oturak mı belli değildir; cevap ancak devamında ("...yürüdüm ve oturdum") netleşir. BERT, self-attention mekanizmasıyla her kelime için cümlenin hem öncesine hem sonrasına aynı anda bakar. ELMo gibi önceki yaklaşımlar iki ayrı tek yönlü modeli birleştirirken, BERT tek bir derin ağda gerçek çift yönlülüğü MLM hilesiyle çözdü: kelimeyi maskele, iki taraftan tahmin ettir. 2018'de yayınlanan makale GLUE benchmark'ında o günün rekorlarını 11 görevde birden kırdı ve 130.000'den fazla akademik atıf alarak NLP tarihinin en çok atıf yapılan çalışmalarından biri oldu. Bu yaklaşım, Google aramanın bozuk ve devrik yazılmış sorguları bile bir insan gibi yorumlamasının temelini attı.
BERT Mimarisi: Sayılarla Model Aileleri
bert-base BERT-base
12 Transformer katmanı, 768 gizli boyut, 12 attention head, 110M parametre. Çoğu sınıflandırma görevi için yeterli standart boy.
bert-large BERT-large
24 katman, 1024 gizli boyut, 16 head, 340M parametre. SQuAD ve GLUE rekorlarını kıran büyük varyant.
distilbert DistilBERT
Bilgi damıtmayla %40 küçültülmüş, %60 daha hızlı; performansın yaklaşık %97'sini korur. Mobil ve düşük gecikmeli senaryoların tercihi.
berturk BERTurk (Türkçe BERT)
dbmdz/bert-base-turkish-cased; 35 GB'lık Türkçe corpus (OSCAR + Wikipedia) üzerinde eğitildi. Türkçe NER ve duygu analizinin fiili standardı.
modernbert ModernBERT
Aralık 2024'te yayınlanan modern encoder: 8192 token bağlam, FlashAttention, RoPE. Klasik BERT'in 512 token sınırını 16 kat aşar.
Ön Eğitim: MLM ve NSP Nasıl Çalışır?
BERT etiketsiz metinden iki görevle öğrenir. **MLM (Masked Language Modeling):** girdideki token'ların %15'i seçilir; bunların %80'i [MASK] ile değiştirilir, %10'u rastgele bir kelimeyle değiştirilir, %10'u olduğu gibi bırakılır. Model maskelenen kelimeyi iki yönlü bağlamdan tahmin eder — "Banka [MASK] kredisi" örneğinde sağdaki "kredisi" kelimesi de tahmine katılır. **NSP (Next Sentence Prediction):** modele iki cümle verilir; ikincinin birincinin gerçek devamı olup olmadığı sınıflandırılır. Eğitim, 3,3 milyar kelimelik BooksCorpus + Wikipedia derlemi üzerinde 16 TPU çipiyle yaklaşık 4 gün sürmüştür. Sonraki araştırmalar NSP'nin katkısını sorguladı: RoBERTa (2019) NSP'yi tamamen kaldırıp daha uzun ve daha büyük veriyle eğiterek BERT'i geçti; ALBERT ise NSP yerine cümle sırası tahmini (SOP) kullandı.
Google BERT Güncellemesi ve SEO'ya Etkisi
Google, 25 Ekim 2019'da BERT'i arama sıralamasına aldı ve bunu "son 5 yılın en büyük sıçraması" olarak tanımladı. İlk aşamada İngilizce sorguların ~%10'u etkilendi; Aralık 2019'da kapsam Türkçe dahil 70'ten fazla dile genişledi. Değişimin özü şuydu: "2019 brezilyalı abd'ye seyahat vize" gibi sorgularda "to/için" gibi işlev kelimelerinin yönü artık doğru okunuyor, sonuçlar niyetle eşleşiyordu. SEO açısından kritik gerçek: **BERT için optimizasyon yapılamaz.** Google'ın o dönemki sözcüsü Danny Sullivan'ın ifadesiyle tek tavsiye "kullanıcı için doğal yazmak"tır. Pratik karşılığı: soru kalıplı başlıklar, ilk cümlede net cevap, uzun kuyruklu sorgulara birebir karşılık gelen alt başlıklar. BERT ayrıca featured snippet seçiminde ve 2026'daki AI Overviews altyapısını besleyen pasaj anlama sistemlerinde de kullanılıyor; MUM ve Gemini tabanlı sistemler BERT'in yerini almadı, üzerine eklendi.
BERT'in Kullanım Alanları
- check_circle Arama ve pasaj sıralama: Google arama sorgu anlama ve pasaj indeksleme; Bing de 2019'dan beri benzer Transformer modelleri kullanıyor.
- check_circle Metin sınıflandırma ve duygu analizi: Binlerce müşteri e-postasının şikayet/öneri/iptal olarak otomatik ayrıştırılması; birkaç yüz etiketli örnekle fine-tune yeterli olabiliyor.
- check_circle Varlık ismi tanıma (NER): Sözleşme ve haber metinlerinden kişi, kurum, tarih, tutar çıkarma; BERTurk ile Türkçe NER'de %92+ F1 skorları raporlanıyor.
- check_circle Soru cevaplama: SQuAD tarzı görevlerde verilen paragraftan cevap aralığı bulma; BERT-large SQuAD 1.1'de insan performansını (F1 91,2) ilk geçen modellerdendi.
- check_circle Embedding ve semantik arama: Sentence-BERT (SBERT) türevleri cümleleri vektöre çevirir; RAG sistemlerindeki retriever katmanlarının önemli bir kısmı hâlâ BERT ailesindendir.
BERT mi, GPT mi, Yoksa İkisi de mi? (2026 Perspektifi)
Doğru soru "hangisi daha iyi" değil, "hangi iş için hangisi" sorusudur. GPT, Gemini veya Claude gibi güncel decoder tabanlı modeller üretim (yazma, sohbet, kod) işlerinde açık ara öndedir; ancak tek bir sınıflandırma isteği için LLM API'sine gitmek hem pahalı hem yavaştır. Fine-tune edilmiş bir DistilBERT, CPU'da bile milisaniyeler içinde ve token başı maliyet olmadan sınıflandırma yapar; milyonlarca dokümanlık bir akışta fark, aylık binlerce dolara ulaşır. Bu yüzden 2026'da yaygın mimari hibrittir: BERT türevi bir model ucuz ön filtreleme, yönlendirme ve embedding üretir; karmaşık vakalar LLM'e devredilir. ModernBERT'in (2024) ve EuroBERT gibi çok dilli yeni encoder'ların çıkışı, "encoder öldü" tezinin aksine bu katmanın aktif biçimde geliştirildiğini gösteriyor.
Sık Sorulan Sorular
- check_circle BERT nedir, ne işe yarar?: BERT, Google'ın 2018'de yayınladığı, metni iki yönlü okuyarak bağlamı anlayan encoder tabanlı Transformer dil modelidir. Metin sınıflandırma, varlık tanıma, soru cevaplama ve arama sorgusu anlama görevlerinde kullanılır.
- check_circle Google BERT algoritması SEO'yu nasıl etkiler?: BERT, sorgudaki edat ve bağlam ilişkilerini doğru okuyarak niyet eşleşmesini iyileştirir. BERT'e özel optimizasyon yapılamaz; en etkili strateji, soruya ilk cümlede net cevap veren, doğal dille yazılmış içerik üretmektir.
- check_circle BERT ile GPT arasındaki fark nedir?: BERT encoder-only ve çift yönlüdür, anlama görevleri için optimizedir; GPT decoder-only ve soldan sağadır, metin üretimi için tasarlanmıştır. Sınıflandırma ve NER'de BERT ekonomik ve hızlıdır; yazı üretme ve sohbette GPT tarzı modeller üstündür.
- check_circle BERT hâlâ kullanılıyor mu? (2026): Evet. Google aramada sıralama sistemlerinin parçası olmayı sürdürüyor; Hugging Face'te BERT türevleri en çok indirilen modeller arasında. RAG retriever'ları, moderasyon ve sınıflandırma hatlarında düşük maliyeti nedeniyle yoğun kullanımda.
- check_circle Türkçe için hangi BERT modeli önerilir?: Genel görevler için dbmdz/bert-base-turkish-cased (BERTurk), duygu analizi için savasy/bert-base-turkish-sentiment-cased, çok dilli projeler için xlm-roberta-base uygundur. Uzun belgeler gerekiyorsa ModernBERT tabanlı çok dilli encoder'lar değerlendirilebilir.
- check_circle BERT'i fine-tune etmek için ne kadar veri gerekir?: Basit sınıflandırma için birkaç yüz etiketli örnek çoğu zaman yeterlidir; 2-4 epoch eğitim tek GPU'da dakikalar sürer. Veri azsa DistilBERT, veri boysa RoBERTa veya DeBERTa daha iyi sonuç verir.