tag Word2Vec

Bu sayfada Word2Vec etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

Word2Vec, 2013 yılında Google'dan Tomas Mikolov ve ekibi tarafından geliştirilen, büyük metin korpuslarından kelime vektörleri öğrenen sinir ağı tabanlı bir gömme modelidir. Temel fikir, anlamsal açıdan birbirine yakın kelimelerin yüksek boyutlu uzayda da birbirine yakın noktalara karşılık gelmesidir; bu ilke dağılımsal anlam hipotezi olarak bilinir. Model iki farklı mimariyle eğitilebilir. CBOW (Continuous Bag of Words) mimarisinde bağlam kelimeleri girdi olarak alınır ve merkez kelime tahmin edilir; bu yaklaşım hızlı eğitim ve sık kelimelerde iyi performans sunar. Skip-gram mimarisinde ise tek bir merkez kelimeden yola çıkılarak çevresindeki bağlam kelimeleri tahmin edilir; bu yöntem nadir kelimeler için daha iyi temsiller üretir. Her iki mimari de negatif örnekleme (negative sampling) veya hiyerarşik softmax teknikleriyle milyonlarca parametreyi verimli biçimde optimize eder. Word2Vec'in en çarpıcı özelliği vektör aritmetiğine olanak tanımasıdır. 'Kral − Erkek + Kadın ≈ Kraliçe' örneği, modelin yalnızca birlikte geçme istatistiklerinden cinsiyet, rütbe ve meslek gibi soyut ilişkileri kodladığını göstermektedir. Bu ilişkiler çeviri, anlam genişlemesi ve metafor tespitinde kullanılmaktadır. Word2Vec'in sınırlılıkları da belirgindir: her kelime için tek bir sabit vektör üretir; bu nedenle 'banka' gibi çok anlamlı (polysemous) kelimelerde bağlama göre anlam ayrımı yapılamaz. ELMo (2018) bu sorunu LSTM tabanlı bağlama duyarlı temsiliyle çözmeye başladı; ardından gelen BERT ve GPT gibi transformer tabanlı modeller ise dinamik gömme anlayışını endüstri standardına taşıdı. Buna karşın Word2Vec, hesaplamalı maliyetinin son derece düşük olması nedeniyle kaynak kısıtlı ortamlarda, öneri sistemlerinde ve belge sınıflandırmasında hâlâ tercih edilmektedir. GloVe (Global Vectors for Word Representation) ve FastText, Word2Vec'in temellerini genişleten önemli alternatiflerdir: GloVe küresel birlikte geçme istatistiklerini kullanırken, FastText alt kelime parçalarını (subword) modelleyerek bilinmeyen kelimeleri de temsil edebilir.

code_blocks

Word2Vec (Kelime-Vektör Gömme Modeli)

Word2Vec, 2013 yılında Google'dan Tomas Mikolov ve ekibi tarafından geliştirilen, büyük metin korpuslarından kelime vektörleri öğrenen sinir ağı tabanlı bir gömme modelidir. Temel fikir, anlamsal açıdan birbirine yakın kelimelerin yüksek boyutlu uzayda da birbirine yakın noktalara karşılık gelmesidir; bu ilke dağılımsal anlam hipotezi olarak bilinir. Model iki farklı mimariyle eğitilebilir. CBOW (Continuous Bag of Words) mimarisinde bağlam kelimeleri girdi olarak alınır ve merkez kelime tahmin edilir; bu yaklaşım hızlı eğitim ve sık kelimelerde iyi performans sunar. Skip-gram mimarisinde ise tek bir merkez kelimeden yola çıkılarak çevresindeki bağlam kelimeleri tahmin edilir; bu yöntem nadir kelimeler için daha iyi temsiller üretir. Her iki mimari de negatif örnekleme (negative sampling) veya hiyerarşik softmax teknikleriyle milyonlarca parametreyi verimli biçimde optimize eder. Word2Vec'in en çarpıcı özelliği vektör aritmetiğine olanak tanımasıdır. 'Kral − Erkek + Kadın ≈ Kraliçe' örneği, modelin yalnızca birlikte geçme istatistiklerinden cinsiyet, rütbe ve meslek gibi soyut ilişkileri kodladığını göstermektedir. Bu ilişkiler çeviri, anlam genişlemesi ve metafor tespitinde kullanılmaktadır. Word2Vec'in sınırlılıkları da belirgindir: her kelime için tek bir sabit vektör üretir; bu nedenle 'banka' gibi çok anlamlı (polysemous) kelimelerde bağlama göre anlam ayrımı yapılamaz. ELMo (2018) bu sorunu LSTM tabanlı bağlama duyarlı temsiliyle çözmeye başladı; ardından gelen BERT ve GPT gibi transformer tabanlı modeller ise dinamik gömme anlayışını endüstri standardına taşıdı. Buna karşın Word2Vec, hesaplamalı maliyetinin son derece düşük olması nedeniyle kaynak kısıtlı ortamlarda, öneri sistemlerinde ve belge sınıflandırmasında hâlâ tercih edilmektedir. GloVe (Global Vectors for Word Representation) ve FastText, Word2Vec'in temellerini genişleten önemli alternatiflerdir: GloVe küresel birlikte geçme istatistiklerini kullanırken, FastText alt kelime parçalarını (subword) modelleyerek bilinmeyen kelimeleri de temsil edebilir.

arrow_forward
code_blocks

Noise Contrastive Estimation (Gürültü Karşıtlıklı Kestirim)

Noise Contrastive Estimation (NCE), Türkçesiyle gürültü karşıtlıklı kestirim, normalizasyon sabitinin hesaplanması pratik olmayan olasılık modellerinin parametrelerini öğrenmek için geliştirilmiş istatistiksel bir kestirim ilkesidir. Michael Gutmann ve Aapo Hyvärinen tarafından 2010 yılında AISTATS konferansında önerilen yöntem, zor bir yoğunluk kestirimi problemini basit bir ikili sınıflandırma görevine çevirir: model, gerçek veri dağılımından gelen örneklerle bilinen bir gürültü dağılımından çekilen yapay örnekleri birbirinden ayırt etmeyi öğrenir. Bu ayrımı iyi yapan bir model, dolaylı olarak gerçek veri dağılımının şeklini de öğrenmiş olur. Yöntemin çözdüğü temel sorun, normalize edilmemiş modellerde ortaya çıkan bölüşüm fonksiyonu (partition function) hesabıdır. Maksimum olabilirlik kestirimi, her parametre güncellemesinde tüm olası çıktılar üzerinden toplam almayı gerektirir. Kelime dağarcığı yüz binlerce token içeren bir dil modelinde softmax katmanının her adımda tüm dağarcık üzerinden hesaplanması, eğitim süresinin büyük bölümünü tek başına tüketir. NCE bu toplamı hiç hesaplamaz; normalizasyon sabitini ya öğrenilebilir bir parametre olarak modele ekler ya da Mnih ve Teh'in 2012'de gösterdiği gibi pratikte 1'e sabitler. Her gerçek örnek için k adet gürültü örneği çekildiğinden, adım başına maliyet dağarcık boyutundan bağımsız hale gelir ve yalnızca k ile orantılı kalır. NCE'nin teorik cazibesi tutarlılığından gelir: gürültü örneği sayısı k arttıkça kestirici maksimum olabilirlik çözümüne yaklaşır. Bu özellik, yöntemi enerji tabanlı modellerin ve yoğunluk kestiriminin eğitimi için de çekici kılar. Uygulama tarafında ise NCE, 2013'te Mikolov ve ekibinin Word2Vec için tasarladığı Negative Sampling yaklaşımının doğrudan öncülüdür. Negative Sampling, NCE'deki gürültü dağılımı terimini atarak daha basit bir amaç fonksiyonu kullanır; olasılık kestirimi için tutarlı olmasa da kaliteli kelime gömmeleri üretir. 2018'de van den Oord ve arkadaşlarının Contrastive Predictive Coding çalışmasıyla tanıttığı InfoNCE kaybı, aynı ilkeyi temsil öğrenimine taşıdı. Pozitif çifti k negatif arasından seçmeye dayanan bu kayıp, SimCLR, MoCo ve CLIP gibi öz-denetimli modellerin ve modern gömme modellerinin eğitiminde standart hale geldi. Günümüz büyük dil modelleri çıkış katmanında tam softmax kullansa da NCE ailesi, geri getirim, öneri sistemleri ve çok modlu öğrenme alanlarında yaygın biçimde kullanılmaya devam ediyor.

arrow_forward