Word Embedding (Kelime Gömme)

Kelimeleri anlamsal ilişkilerini koruyan yüksek boyutlu gerçek sayı vektörlerine dönüştüren temsil öğrenme tekniği.

Kelime gömme (word embedding), kelimeleri yüksek boyutlu gerçek sayı vektörlerine dönüştüren temsil öğrenme tekniğidir. Bu yaklaşım, kelimelerin anlamsal ve sözdizimsel ilişkilerini matematiksel uzayda yansıtır: anlamca yakın sözcükler uzayda birbirine yakın konumlanırken farklı anlamlılar uzakta kalır. Klasik bag-of-words yaklaşımı kelimeleri birbirinden bağımsız bir-sıcak (one-hot) vektörlerle temsil ederdi; bu yöntem "kral" ile "hükümdar" arasındaki anlamsal bağı yakalayamıyordu. Word2Vec (2013, Google) ve GloVe (2014, Stanford) mimarileriyle birlikte dense vektör temsilleri yaygınlaştı. Word2Vec'in ünlü örneğinde "kral − erkek + kadın ≈ kraliçe" vektör aritmetiği, modelin anlam ilişkilerini öğrendiğini kanıtladı. Statik kelime gömmelerinin (Word2Vec, GloVe, FastText) temel sınırlaması bağlam körlüğüdür: "banka" kelimesi finans veya nehir kenarı anlamına geldiğinde aynı vektörü alır. Bu sorunu BERT ve GPT gibi bağlamsal dil modelleri çözdü: aynı kelime farklı cümlelerde farklı temsiller üretir. Türkçe için özelleştirilmiş gömmeler mevcuttur: BERTurk, TURK-BERT ve çeşitli FastText modelleri geniş Türkçe corpus'larla eğitilmiştir. Türkçe'nin yapışkan morfolojisi nedeniyle alt-kelime gömmeleri (subword embeddings) ve karakter tabanlı modeller özellikle önem kazanmaktadır. Modern büyük dil modellerinde kelime gömmeleri artık modele özgü ve bağlamsal olup BERT-tarzı tokenizasyon ile çalışır; bu gömmeler arama sistemleri, öneri motorları ve sınıflandırma görevlerinde temel bileşen olmayı sürdürmektedir.

Neden Vektör Temsili Gerekli?

Sinir ağları sayısal girdi bekler; metni doğrudan işleyemez. Bir-sıcak kodlama (one-hot) her kelimeyi 0-1 vektörüyle temsil eder, ancak boyut sayısı kelime dağarcığıyla orantılı olduğundan hesaplama maliyeti yüksektir ve sözcükler arası ilişkileri kodlamaz. Word embedding bu sorunu çözer: 300-1024 boyutlu dense vektörler hem hesaplama açısından verimlidir hem de anlamsal proximity'yi uzaysal yakınlıkla ifade eder.

Başlıca Kelime Gömme Mimarileri

  • check_circle Word2Vec (2013): Google'ın Mikolov ve ekibinin geliştirdiği CBOW ve Skip-gram mimarileri; 'kral − erkek + kadın ≈ kraliçe' aritmetiğiyle statik gömmeler. Hızlı eğitim, geniş ekosistem.
  • check_circle GloVe (2014): Stanford'ın global kelime-kelime eş-oluşum matrislerini faktörize ettiği yaklaşım; hem yerel bağlam hem global istatistiği dengeler. Akademik NLP'de uzun süre standart oldu.
  • check_circle FastText (2016): Meta'nın alt-kelime (subword) düzeyinde çalışan modeli; Türkçe gibi morfolojik açıdan zengin diller için üstün performans verir, kelime dağarcığı dışı sözcükleri işleyebilir.
  • check_circle BERT Gömmeleri (2018): Transformer tabanlı bağlamsal gömmeler; aynı kelime farklı cümlelerde farklı vektör alır. Çift yönlü dikkat mekanizmasıyla anlamı çok daha iyi yakalar.
  • check_circle Sentence Embeddings: SBERT, E5 ve text-embedding-3 gibi modeller tam cümle veya paragrafı tek bir vektöre sıkıştırır; semantik arama ve RAG sistemlerinin temelini oluşturur.

Statik vs Bağlamsal Gömmeler

Word2Vec ve GloVe statik gömmeler üretir: her kelime eğitim sonrası sabit bir vektöre sahiptir. Bu durum çok anlamlı sözcüklerde (polisemi) sorun yaratır — 'banka' finans veya nehir kenarı anlamına geldiğinde aynı temsili alır. BERT ve türevleri bağlamsal gömmeler üretir: transformer dikkat mekanizması her çıkarım sırasında çevre sözcükleri dikkate alarak dinamik vektörler hesaplar. Türkçe NLP'de BERTurk ve TURK-BERT bağlamsal temsil için tercih edilen modellerdir.

Türkçe'de Kelime Gömmeleri: Özel Zorluklar

Türkçe'nin yapışkan morfolojisi (agglutinative morphology) kelime gömme modellerini zorlar: 'gidebileceklerinden' gibi tek bir token onlarca anlam katmanı barındırır. Bu nedenle BPE (Byte Pair Encoding) ve SentencePiece alt-kelime tokenizasyonu Türkçe modellerinde kritik önem taşır. FastText'in subword desteği bu nedenle Türkçe için Word2Vec'e göre üstündür. BERTurk (dbmdz/bert-base-turkish), TURK-BERT ve E5-Turkish-v2 gibi modeller Hugging Face üzerinde ücretsiz erişilebilir durumdadır.

Uygulama Alanları

Semantik arama

Kullanıcı sorgusunu ve belge parçalarını vektörleştirerek cosine benzerliğiyle en alakalı sonuçları bul; RAG sistemlerinin temel bileşeni.

Öneri sistemleri

Ürün veya içerik açıklamalarını gömerek benzer öğeleri kümeleme; e-ticaret ve içerik platformlarında geniş kullanım.

Metin sınıflandırma

Duygu analizi, spam tespiti ve konu modelleme gibi görevlerde özellik vektörü olarak kullanım; ince ayar (fine-tuning) ile yüksek doğruluk.

Makine çevirisi

Kaynak ve hedef dil uzaylarını hizalayan çok dilli gömmeler (multilingual embeddings); diller arası transfer öğrenimini mümkün kılar.

Sık Sorulan Sorular

  • check_circle Word embedding nedir?: Kelimeleri anlamsal ilişkilerini koruyan yüksek boyutlu gerçek sayı vektörlerine dönüştüren temsil öğrenme tekniğidir. Benzer anlamlı kelimeler vektör uzayında birbirine yakın konumlanır.
  • check_circle Word2Vec ile BERT arasındaki temel fark nedir?: Word2Vec statik gömme üretir — her kelime eğitim sonrası tek bir vektöre sahiptir. BERT bağlamsal gömme üretir — aynı kelime farklı cümlelerde farklı vektörler alır ve çok anlamlı sözcükleri ayırt edebilir.
  • check_circle Türkçe için hangi gömme modeli kullanılır?: BERTurk (dbmdz/bert-base-turkish-cased), TURK-BERT ve FastText Türkçe modeli yaygın seçeneklerdir. Semantik arama için E5-Turkish veya multilingual-e5-large-instruct önerilir.
  • check_circle Kelime boyutu (dimension) nasıl seçilir?: Genel kullanımda 300-768 boyut iyi denge sağlar. Büyük boyut daha zengin temsil ancak daha fazla bellek ve hesaplama gerektirir. BERT-base 768, BERT-large 1024 boyut kullanır.
  • check_circle Embedding modeli fine-tune etmek gerekir mi?: Genel amaçlı görevlerde hazır modeller çoğunlukla yeterlidir. Alan-özgü metinlerde (tıp, hukuk, teknik) fine-tuning ciddi performans artışı sağlar; contrastive learning yöntemleri bu amaç için yaygınlaşmaktadır.