Vektör, büyüklük ve yön içeren matematiksel nesne; yapay zekada metin, görüntü ve ses gibi verileri sayısal temsile dönüştürmek ve semantik benzerliği ölçmek için temel araçtır.

Vektör, matematiksel bir nesne olarak hem büyüklük hem de yön bilgisi taşır; n boyutlu uzayda sayı dizisiyle temsil edilir. Yapay zeka ve makine öğrenimi bağlamında vektörler, metinleri, görüntüleri, sesleri veya diğer verileri sayısal temsillere dönüştürmek için kullanılır. Bir cümle ya da belge, embedding modeli tarafından yüzlerce veya binlerce boyutlu bir vektöre dönüştürüldüğünde, benzer anlamlı içerikler geometrik olarak birbirine yakın konumlanır. Makine öğreniminde vektörler iki temel biçimde karşımıza çıkar: seyrek vektörler (sparse vectors) ve yoğun vektörler (dense vectors). TF-IDF veya one-hot kodlama gibi geleneksel yöntemler çoğu boyutu sıfır olan seyrek vektörler üretir. Embedding modelleri ise anlamı sıkıştırılmış, boyut sayısı sınırlı (genellikle 128-4096 arası) yoğun vektörler üretir. Word2Vec, GloVe ve modern Sentence-BERT gibi modeller bu yoğun vektörlerin örnekleridir. Vektörler arasındaki mesafe ve benzerlik, anlamsal yakınlığı ölçmek için kullanılır. Kosinüs benzerliği (cosine similarity) yön benzerliğini ölçerek uzunluktan bağımsız karşılaştırma yapar; iki vektör aynı yöne işaret ediyorsa (kosinüs ≈ 1) semantik olarak benzer kabul edilir. Öklid mesafesi (L2) ise iki nokta arasındaki doğrudan uzaklığı ölçer; görüntü ve ses embeddinglerde yaygın kullanılır. Vektör veritabanları (Pinecone, Qdrant, Weaviate, pgvector) bu yoğun vektörleri büyük ölçekte depolayarak milisaniyede en yakın komşu araması yapar. HNSW ve IVF gibi yaklaşık en yakın komşu (ANN) algoritmaları milyarlarca vektör üzerinde hızlı arama imkânı sunar. Bu altyapı semantik arama, RAG sistemleri ve öneri motorlarının temelini oluşturur. Pratik boyutlandırma rehberi: text-embedding-3-small (1536 boyut) çoğu RAG ve semantik arama uygulaması için maliyet-performans dengesi açısından iyi bir başlangıç noktasıdır. Kuantizasyon (int8, binary) vektörleri sıkıştırarak 4-32× bellek tasarrufu elde edilebilir; buna karşılık doğrulukta küçük bir kayıp kabul edilmelidir. Türkçe metinler için multilingual-e5-large (1024 boyut) veya multilingual-MiniLM (384 boyut) çok dilli görevlerde etkili seçeneklerdir.

Vektör Tipleri

grid_off Seyrek Vektör

Çoğu eleman sıfır. TF-IDF, one-hot, BM25. Yüksek boyutlu ama anahtar kelime eşleşmesinde hızlı ve yorumlanabilir.

grid_on Yoğun Vektör

Embedding modeli çıktısı. 128-4096 boyut. Anlamı kodlar; kosinüs benzerliğiyle semantik arama mümkün.

storage Binary Vektör

Her boyut 0 veya 1. Hamming mesafesiyle hızlı karşılaştırma. Büyük ölçekli vektör indeksleme için bellek verimliliği sağlar.

table_chart Matris

Vektörlerin çok boyutlu genişlemesi. Transformer attention: Q, K, V matrisleri. Görüntüler için piksel ızgarası matris temsili.

compare_arrows Vektör Benzerlik Metrikleri

Kosinüs benzerliği: [-1, 1] aralığı, uzunluktan bağımsız, metin embeddinglerde standart. Öklid mesafesi (L2): boyutlar arası mutlak fark, görüntü ve ses embeddinglerde kullanılır. Nokta çarpımı (dot product): vektör boyunun da hesaba katıldığı benzerlik ölçüsü; OpenAI embeddinglerde tercih edilir. Manhattan mesafesi (L1): her boyut farkının mutlak değer toplamı; gürültüye daha dayanıklıdır.

AI'da Vektörlerin Kullanım Alanları

  • check_circle Kelime Gömmeleri (Word Embeddings): Word2Vec, GloVe ve FastText; her kelimeyi anlamsal özelliklerini kodlayan yoğun vektöre dönüştürür. Kral - Adam + Kadın ≈ Kraliçe örneğinin gösterdiği anlamsal aritmetik mümkün olur.
  • check_circle Cümle ve Belge Gömmeleri: Sentence-BERT, text-embedding-3 ve E5; metni tek vektörle temsil eder. Semantik arama, benzerlik ölçümü ve RAG sistemlerinin temeli.
  • check_circle Görüntü Özellikleri: CNN ve Vision Transformer'lar görüntüyü özellik vektörüne dönüştürür. Görüntü araması, benzerlik tespiti ve çok modaliteli modellerde kullanılır.
  • check_circle KV Önbelleği: Transformer'larda dikkat hesabı sırasında her token için Key ve Value vektörleri önbelleğe alınır. Uzun bağlamlı çıkarımda bellek ve hesaplama verimliliğini artırır.
  • check_circle Vektör Veritabanları: Pinecone, Weaviate, Qdrant ve pgvector; yüksek boyutlu vektörleri saklayıp yaklaşık en yakın komşu (ANN) araması yapar. Milyonlarca vektör üzerinde milisaniyede arama mümkündür.
  • check_circle Latent Space (Gizli Uzay): Modelin öğrendiği temsil uzayı; burada benzer anlamlı girişler geometrik olarak birbirine yakın konumlanır. Boyut indirgeme ve yorumlanabilirlik araştırmalarının odağı.

Vektör Temsili ve Modern AI'nın Matematiği

Modern yapay zeka, dünyayı vektörler aracılığıyla anlar. Bir metin parçasını, görüntüyü veya sesi sayısal vektöre dönüştürmek matematiksel işlem ve makine öğrenimi algoritmalarının uygulanmasını mümkün kılar. Yüksek boyutlu vektör uzayları (512, 1536, 3072 boyut) ilginç geometrik özelliklere sahiptir: kosinüs benzerliği iki vektör arasındaki açıyı ölçer; birbirine yakın açılar anlamsal yakınlığı temsil eder. HNSW (Hierarchical Navigable Small World) ve IVF (Inverted File Index) gibi yaklaşık en yakın komşu (ANN) algoritmaları, milyarlarca vektör arasında milisaniyede arama yapmayı mümkün kılar. Vektör boyutu ile anlam kapasitesi arasında denge vardır: daha yüksek boyut daha nüanslı anlam kodlama kapasitesi sunar ama depolama ve hesaplama maliyeti artar. Kuantizasyon (int8, binary) vektörleri sıkıştırarak bu maliyeti azaltır; hafif doğruluk kaybıyla 4-32× bellek tasarrufu sağlanabilir. Pratik öneri: text-embedding-3-small (1536 boyut) çoğu RAG ve semantik arama uygulaması için maliyet-performans dengesi açısından iyi bir başlangıç.

quiz Sık Sorulan Sorular

  • check_circle Yüksek boyutlu vektörde "boyut laneti" (curse of dimensionality) nedir?: Boyut sayısı arttıkça vektörler arasındaki mesafeler birbirine yaklaşır; anlamlı ayrım güçleşir. Bu nedenle pratikte 768-1536 boyutluk dengeli temsiller tercih edilir.
  • check_circle Türkçe metin için hangi embedding vektör boyutu önerilir?: Çok dilli modeller (multilingual-e5-large: 1024, multilingual-MiniLM: 384) Türkçe için iyi seçeneklerdir. Daha büyük boyut = daha zengin temsil, daha fazla bellek.
  • check_circle Vektör nedir?: Büyüklük ve yön içeren matematiksel nesne; AI'da metin, görüntü veya ses gibi verileri sayısal temsile dönüştürmek için kullanılır. Semantik anlam geometrik ilişkiyle kodlanır.
  • check_circle Gömme (embedding) ile vektör arasındaki fark nedir?: Teknik fark yoktur; gömme bir verinin (metin, görüntü) öğrenilmiş vektör temsilidir. Her gömme bir vektördür; ancak her vektör gömme değildir (örn. ham piksel vektörü öğrenilmiş gömme değildir).
  • check_circle Vektör veritabanı neden gerekli?: Geleneksel veritabanları tam eşleşme araması yapar. Vektör veritabanları kosinüs benzerliği veya L2 mesafesiyle en yakın anlamsal komşuları bulur. RAG sistemleri ve semantik arama için vazgeçilmezdir.
  • check_circle Hangi vektör veritabanını kullanmalıyım?: Küçük projeler için Chroma veya pgvector (PostgreSQL eklentisi) pratik başlangıç. Üretim ölçeğinde Pinecone (yönetilen bulut), Qdrant (açık kaynak, performanslı) veya Weaviate tercih edilebilir.