Neden Vektör Temsili Gerekli?
Sinir ağları sayısal girdi bekler; metni doğrudan işleyemez. Bir-sıcak kodlama (one-hot) her kelimeyi 0-1 vektörüyle temsil eder, ancak boyut sayısı kelime dağarcığıyla orantılı olduğundan hesaplama maliyeti yüksektir ve sözcükler arası ilişkileri kodlamaz. Word embedding bu sorunu çözer: 300-1024 boyutlu dense vektörler hem hesaplama açısından verimlidir hem de anlamsal proximity'yi uzaysal yakınlıkla ifade eder.
Başlıca Kelime Gömme Mimarileri
- check_circle Word2Vec (2013): Google'ın Mikolov ve ekibinin geliştirdiği CBOW ve Skip-gram mimarileri; 'kral − erkek + kadın ≈ kraliçe' aritmetiğiyle statik gömmeler. Hızlı eğitim, geniş ekosistem.
- check_circle GloVe (2014): Stanford'ın global kelime-kelime eş-oluşum matrislerini faktörize ettiği yaklaşım; hem yerel bağlam hem global istatistiği dengeler. Akademik NLP'de uzun süre standart oldu.
- check_circle FastText (2016): Meta'nın alt-kelime (subword) düzeyinde çalışan modeli; Türkçe gibi morfolojik açıdan zengin diller için üstün performans verir, kelime dağarcığı dışı sözcükleri işleyebilir.
- check_circle BERT Gömmeleri (2018): Transformer tabanlı bağlamsal gömmeler; aynı kelime farklı cümlelerde farklı vektör alır. Çift yönlü dikkat mekanizmasıyla anlamı çok daha iyi yakalar.
- check_circle Sentence Embeddings: SBERT, E5 ve text-embedding-3 gibi modeller tam cümle veya paragrafı tek bir vektöre sıkıştırır; semantik arama ve RAG sistemlerinin temelini oluşturur.
Statik vs Bağlamsal Gömmeler
Word2Vec ve GloVe statik gömmeler üretir: her kelime eğitim sonrası sabit bir vektöre sahiptir. Bu durum çok anlamlı sözcüklerde (polisemi) sorun yaratır — 'banka' finans veya nehir kenarı anlamına geldiğinde aynı temsili alır. BERT ve türevleri bağlamsal gömmeler üretir: transformer dikkat mekanizması her çıkarım sırasında çevre sözcükleri dikkate alarak dinamik vektörler hesaplar. Türkçe NLP'de BERTurk ve TURK-BERT bağlamsal temsil için tercih edilen modellerdir.
Türkçe'de Kelime Gömmeleri: Özel Zorluklar
Türkçe'nin yapışkan morfolojisi (agglutinative morphology) kelime gömme modellerini zorlar: 'gidebileceklerinden' gibi tek bir token onlarca anlam katmanı barındırır. Bu nedenle BPE (Byte Pair Encoding) ve SentencePiece alt-kelime tokenizasyonu Türkçe modellerinde kritik önem taşır. FastText'in subword desteği bu nedenle Türkçe için Word2Vec'e göre üstündür. BERTurk (dbmdz/bert-base-turkish), TURK-BERT ve E5-Turkish-v2 gibi modeller Hugging Face üzerinde ücretsiz erişilebilir durumdadır.
Uygulama Alanları
Semantik arama
Kullanıcı sorgusunu ve belge parçalarını vektörleştirerek cosine benzerliğiyle en alakalı sonuçları bul; RAG sistemlerinin temel bileşeni.
Öneri sistemleri
Ürün veya içerik açıklamalarını gömerek benzer öğeleri kümeleme; e-ticaret ve içerik platformlarında geniş kullanım.
Metin sınıflandırma
Duygu analizi, spam tespiti ve konu modelleme gibi görevlerde özellik vektörü olarak kullanım; ince ayar (fine-tuning) ile yüksek doğruluk.
Makine çevirisi
Kaynak ve hedef dil uzaylarını hizalayan çok dilli gömmeler (multilingual embeddings); diller arası transfer öğrenimini mümkün kılar.
Sık Sorulan Sorular
- check_circle Word embedding nedir?: Kelimeleri anlamsal ilişkilerini koruyan yüksek boyutlu gerçek sayı vektörlerine dönüştüren temsil öğrenme tekniğidir. Benzer anlamlı kelimeler vektör uzayında birbirine yakın konumlanır.
- check_circle Word2Vec ile BERT arasındaki temel fark nedir?: Word2Vec statik gömme üretir — her kelime eğitim sonrası tek bir vektöre sahiptir. BERT bağlamsal gömme üretir — aynı kelime farklı cümlelerde farklı vektörler alır ve çok anlamlı sözcükleri ayırt edebilir.
- check_circle Türkçe için hangi gömme modeli kullanılır?: BERTurk (dbmdz/bert-base-turkish-cased), TURK-BERT ve FastText Türkçe modeli yaygın seçeneklerdir. Semantik arama için E5-Turkish veya multilingual-e5-large-instruct önerilir.
- check_circle Kelime boyutu (dimension) nasıl seçilir?: Genel kullanımda 300-768 boyut iyi denge sağlar. Büyük boyut daha zengin temsil ancak daha fazla bellek ve hesaplama gerektirir. BERT-base 768, BERT-large 1024 boyut kullanır.
- check_circle Embedding modeli fine-tune etmek gerekir mi?: Genel amaçlı görevlerde hazır modeller çoğunlukla yeterlidir. Alan-özgü metinlerde (tıp, hukuk, teknik) fine-tuning ciddi performans artışı sağlar; contrastive learning yöntemleri bu amaç için yaygınlaşmaktadır.