tag WordEmbedding
Bu sayfada WordEmbedding etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
Word2Vec, Tomas Mikolov ve ekibi tarafından Google'da 2013 yılında geliştirilen ve büyük metin külliyatlarından yoğun kelime temsilleri öğrenen hafif bir sinir ağı modelidir. "Efficient Estimation of Word Representations in Vector Space" (arXiv 2013) makalesiyle tanıtılan Word2Vec, kelimeleri anlamsal ve sözdizimsel ilişkilerini yakalayan düşük boyutlu gerçek sayı vektörlerine dönüştürür. Word2Vec'in iki temel mimarisi vardır. CBOW (Continuous Bag of Words), bağlam penceresi içindeki komşu kelimelerden merkez kelimeyi tahmin eder; küçük veri kümelerinde daha hızlı eğitilir. Skip-gram ise tam tersine, merkez kelimeden bağlam kelimelerini tahmin eder ve seyrek kelimeler için daha iyi temsiller üretir. Her iki mimari de negatif örnekleme (negative sampling) veya hiyerarşik softmax ile verimli biçimde eğitilir; böylece milyarlarca kelimeli külliyatlar birkaç saat içinde işlenebilir. Word2Vec'in en çarpıcı özelliği, öğrendiği vektörlerin aritmetik işlemlere uymasıdır: "kral − erkek + kadın ≈ kraliçe" denklemi, modelin anlam ilişkilerini geometrik olarak kodladığını gösterir. Bu özellik, makine çevirisi, duygu analizi ve bilgi grafiği oluşturma gibi pek çok NLP görevinde güçlü bir temel oluşturur. Word2Vec, GloVe ve FastText gibi sonraki modellerin ilham kaynağı olmuş; BERT ve GPT gibi Transformer tabanlı gömme modellerinin yaygınlaşmasına zemin hazırlamıştır. Günümüzde Word2Vec, özellikle kaynak kısıtlı ortamlarda ve gerçek zamanlı uygulamalarda hâlâ kullanılmaktadır. Gensim kütüphanesi en popüler Python uygulamasıdır; milyonlarca kelimelik modeller birkaç yüz megabayt belleğe sığar ve CPU üzerinde saniyeler içinde çıkarım yapabilir. E-ticaret öneri sistemleri, benzer ürün keşfi ve doğal dil arama gibi üretim uygulamaları Word2Vec'i hâlâ tercih etmektedir.