tag representation-learning
Bu sayfada representation-learning etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
Kelime gömme (word embedding), kelimeleri yüksek boyutlu gerçek sayı vektörlerine dönüştüren temsil öğrenme tekniğidir. Bu yaklaşım, kelimelerin anlamsal ve sözdizimsel ilişkilerini matematiksel uzayda yansıtır: anlamca yakın sözcükler uzayda birbirine yakın konumlanırken farklı anlamlılar uzakta kalır. Tipik vektör boyutları 50 ile 4096 arasında değişir; daha yüksek boyut daha fazla anlam nüansı taşır ancak bellek ve hesaplama maliyeti de artar. Klasik bag-of-words yaklaşımı kelimeleri birbirinden bağımsız bir-sıcak (one-hot) vektörlerle temsil ederdi; bu yöntem "kral" ile "hükümdar" arasındaki anlamsal bağı yakalayamıyordu. Word2Vec (2013, Google) ve GloVe (2014, Stanford) mimarileriyle birlikte yoğun vektör temsilleri yaygınlaştı. Word2Vec'in ünlü örneğinde "kral − erkek + kadın ≈ kraliçe" vektör aritmetiği, modelin anlam ilişkilerini öğrendiğini kanıtladı. FastText (Meta, 2016) ise kelimeleri karakter n-gramı parçalarına bölerek sözlük dışı sözcükleri de vektöre çevirme becerisini getirdi. Statik kelime gömmelerinin (Word2Vec, GloVe, FastText) temel sınırlaması bağlam körlüğüdür: "banka" kelimesi finans veya nehir kenarı anlamına geldiğinde aynı vektörü alır. Bu sorunu BERT ve türevi modeller çözdü: Transformer katmanları her kelimeye bağlama özgü bir temsil üretir, böylece aynı kelime farklı cümlelerde farklı vektörler alır. Çok anlamlı kelimeler artık cümle bağlamına göre doğru şekilde kodlanabilir hale gelmiştir. Türkçe için özelleştirilmiş gömmeler mevcuttur: BERTurk, TURK-BERT ve çeşitli FastText modelleri geniş Türkçe corpus'larla eğitilmiştir. Türkçe'nin eklemeli morfolojisi nedeniyle alt-kelime gömmeleri ve karakter tabanlı modeller özellikle önem kazanmaktadır: "gidiyorum", "gidiyorsun", "gidiyoruz" gibi çekimli formlar kök anlamını paylaşacak biçimde kodlanabilir. Günümüzde kelime gömmesi kavramı cümle ve belge gömmelerine (sentence/document embeddings) evrilmiştir. OpenAI text-embedding-3, Cohere Embed ve Mistral Embed gibi modeller tüm paragrafı tek bir vektörle temsil ederek Retrieval-Augmented Generation (RAG) altyapıları, semantik arama motorları ve öneri sistemlerinin omurgasını oluşturur. Gömme kalitesi cosine benzerliği ve kNN kıyaslamaları ile ölçülür; STS (Semantic Textual Similarity) benchmark setleri alanda standart değerlendirme ölçütü olarak kullanılır.