Semantic Search (Semantik Arama)

Semantik arama, kullanıcı sorgusunu anahtar kelime eşleşmesi değil anlamsal vektör benzerliğiyle işleyen bilgi erişim yöntemidir.

Semantik arama, anahtar kelime eşleşmesine değil anlam benzerliğine dayanan bir bilgi erişim yöntemidir. Geleneksel TF-IDF veya BM25 tabanlı arama sistemleri yalnızca ortak kelimeleri bulurken; semantik arama, sorgu ve belge içeriğini yoğun vektörlere (dense vectors) dönüştürerek bunlar arasındaki kavramsal yakınlığı ölçer. Bu yaklaşım kapsamında "araba nasıl tamir edilir?" sorusu, "otomobil bakım rehberi" gibi farklı kelimeler içeren belgeleri de getirebilir. Semantik aramanın temeli embedding modellerindedir. BERT, Sentence-BERT (SBERT), OpenAI text-embedding-ada-002 ya da Cohere embed gibi modeller, metin parçalarını anlamsal benzerliği kosinüs mesafesiyle ölçülebilen yüksek boyutlu vektörlere dönüştürür. Bu vektörler Pinecone, Weaviate, Qdrant veya pgvector gibi vektör veritabanlarında depolanır ve yaklaşık en yakın komşu (ANN) aramasıyla sorgulanır. ANN algoritmaları arasında HNSW (Hierarchical Navigable Small World), IVF (Inverted File Index) ve ScaNN yer alır. Bu algoritmalar milyonlarca vektör arasında milisaniye düzeyinde arama yapar; tam eşleşme aramalarının aksine küçük bir doğruluk-hız dengesi sunarlar. Vektör boyutu tipik olarak 384 ile 3072 arasında değişir; daha büyük modeller daha zengin anlam temsili sağlar ancak depolama ve hesaplama maliyeti artar. RAG (Erişim Destekli Üretim) sistemlerinde semantik arama, bilgi tabanından alaka düzeyi yüksek içerikleri getirmenin standart yöntemidir. Hibrit arama sistemleri, semantik aramanın anlam gücünü anahtar kelime aramasının hassasiyetiyle birleştirir. Günümüzde çoğu üretim RAG sistemi, hibrit RRF (Reciprocal Rank Fusion) yöntemiyle saf semantik ve saf anahtar kelime aramasının güçlerini bir arada kullanır. İki aşamalı boru hattı mimarisi (bi-encoder + cross-encoder) de yaygındır: önce bi-encoder hızla aday kümeyi daraltır, ardından cross-encoder her aday ile sorguyu birlikte değerlendirerek daha hassas sıralama yapar. Bu mimari e-ticaret ürün araması, hukuki belge tarama ve kurumsal bilgi yönetimi alanlarında endüstri standardı hâline gelmiştir. Türkçe için multilingual-e5-large, paraphrase-multilingual-MiniLM-L12-v2 ve LABSE modelleri, ince ayara gerek kalmadan yüksek başarım gösterir. Başarım ölçümünde Recall@K, MRR ve NDCG metrikleri kullanılır; üretim sistemleri bu metrikleri A/B testi ve tık oranı verileriyle karşılaştırarak hibrit arama ağırlıklarını optimize eder.

Semantik Arama Bileşenleri

transform Embedding Modeli

Metni yoğun vektöre dönüştürür. SBERT, E5, BGE ve OpenAI ada-002 yaygın seçimlerdir. Çok dilli modeller farklı dilleri ortak vektör uzayında kodlar.

storage Vektör Veritabanı

Vektörleri depolar ve ANN araması yapar. Pinecone, Weaviate, Qdrant bulut seçenekleri; pgvector PostgreSQL eklentisi olarak sunar.

hub ANN Araması

HNSW ve IVF-Flat gibi algoritmalar milyonlarca vektörde milisaniyeler içinde yaklaşık arama yapar. Tam aramadan 100x+ hızlıdır.

sort Yeniden Sıralama

İlk getiri sonuçlarını cross-encoder modeliyle daha hassas biçimde yeniden sıralar. Precision artışı sağlar, ancak ek gecikme ekler.

merge Hibrit Arama: En İyi Yaklaşım

Saf semantik arama, nadir terimler ve tam eşleşme gerektiren durumlarda (ürün kodu, isim) başarısız olabilir. Saf anahtar kelime araması anlam boşluklarını kapatamaz. Hibrit arama, BM25 skor ve vektör benzerlik skorunu RRF (Reciprocal Rank Fusion) veya doğrusal interpolasyonla birleştirir. Elasticsearch, OpenSearch ve Weaviate hibrit arama desteği sunar. Üretim RAG sistemlerinin büyük çoğunluğu bu kombinasyonu tercih eder.

Semantik Arama Bileşenleri ve Teknikleri

  • check_circle Yoğun Gömme Araması (Dense Retrieval): Sorgu ve belgeler gömme modeli ile vektöre dönüştürülür; en yüksek kosinüs benzerliğine sahip belgeler getirilir. BM25'in yetersiz kaldığı parafraz ve anlam değişikliklerini yakalar.
  • check_circle BM25 (Anahtar Kelime Araması): Klasik TF-IDF tabanlı arama algoritması; tam anahtar kelime eşleşmesinde güçlü. Semantik aramaya göre belirli teknik terimler için daha güvenilir sonuç verebilir.
  • check_circle Hibrit Arama: BM25 ve yoğun vektör aramasını birleştirerek her iki yaklaşımın avantajını kullanır. Sonuçlar RRF (Reciprocal Rank Fusion) veya ağırlıklı birleştirmeyle sentezlenir.
  • check_circle Çapraz Kodlayıcı Yeniden Sıralama (Cross-Encoder Reranking): İlk aşamada getirilen belgeler daha pahalı çapraz kodlayıcı modelle yeniden puanlanır. Çift kodlayıcı hızı ile çapraz kodlayıcı doğruluğunu birleştirir.
  • check_circle Çok Dilli Semantik Arama: LABSE, mE5 ve multilingual-e5-large gibi çok dilli gömme modelleri farklı dillerdeki sorgu ve belgeleri ortak vektör uzayında temsil eder.
  • check_circle ColBERT ve Geç Etkileşim: Her token için ayrı vektör üretir; sorgulama zamanında token düzeyinde etkileşim hesaplanır. Tek vektör gömmeye göre daha nüanslı eşleşme; depolama maliyeti daha yüksek.

Semantik Aramanın RAG Sistemlerindeki Rolü ve Ölçüm Kriterleri

Semantik arama, RAG (Retrieval-Augmented Generation) sistemlerinin kalp atışıdır. Bir LLM'nin kaliteli yanıt üretmesi için doğru belgelerin getirilmesi birincil koşuldur; semantik arama bu geri çağırma kalitesini doğrudan belirler. Değerlendirme metrikleri: Recall@K — doğru belgenin ilk K sonuç içinde bulunma oranı; MRR (Mean Reciprocal Rank) — doğru sonucun ortalama sıra tersinin ortalaması; NDCG — sıralamayı da dikkate alan bilgi erişim metriği. Türkçe semantik arama zorlukları: Türkçe soneki bakımından zengin yapısı (morfologik karmaşıklık) gömme modellerini zorlar. multilingual-e5-base ve sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 Türkçe için makul kalite sunar; ancak Türkçe özelleşmiş modeller Hugging Face'de araştırılmalıdır. Üretim önerileri: önce BM25 baseline kurun, ardından hibrit arama ekleyin, son adımda reranking uygulayın. Her adımın etki büyüklüğünü kendi veri setinizde ölçün; genel benchmark sonuçları kullanım senaryonuzu yansıtmayabilir.

Türkçe Ekosistem ve Pratik Kullanım Senaryoları

  • check_circle Türkçe için Önerilen Embedding Modelleri: multilingual-e5-large, paraphrase-multilingual-MiniLM-L12-v2 ve LABSE ince ayar gerekmeden yüksek Türkçe başarımı sunar; BGE-M3 ise çok dilli hibrit arama için güçlü alternatiftir.
  • check_circle E-Ticaret Ürün Araması: Kullanıcı 'hafif spor ayakkabı' aradığında 'running shoe' veya 'koşu sneaker' gibi varyantları da bulur. Anlam tabanlı öneri, dönüşüm oranlarını geleneksel anahtar kelime aramasına kıyasla belirgin biçimde artırır.
  • check_circle Kurumsal Bilgi Yönetimi: Dahili belgeler, politikalar ve SSS'ler vektör veritabanında indekslenerek çalışanların doğal dil sorgularıyla anında içerik bulması mümkün olur; klasik intranet araçlarının kaçırdığı anlam sorguları bu şekilde çözülür.
  • check_circle Hukuki ve Akademik Belge Tarama: Binlerce sayfalık içtihat, sözleşme veya makale arasından konuya uygun bölümleri anlamsal olarak bulan sistemler; klasik arama araçlarının atladığı eşanlamlı kavramları yakalayarak araştırma süresini kısaltır.
  • check_circle Başarım Ölçümü: Recall@K (doğru belgenin ilk K sonuç içinde yer alma oranı), MRR (Mean Reciprocal Rank) ve NDCG (Normalized Discounted Cumulative Gain) temel değerlendirme metrikleridir. Üretim sistemleri bu metrikleri A/B testi ve tık oranı verileriyle karşılaştırarak hibrit arama ağırlıklarını optimize eder.

quiz Sık Sorulan Sorular

  • check_circle Semantik arama için hangi embedding modeli seçilmeli?: Türkçe için çok dilli modeller (paraphrase-multilingual-MiniLM, multilingual-e5-large) önerilir. İngilizce için BAAI/bge-large-en-v1.5 veya OpenAI text-embedding-3-large güçlü seçimlerdir.
  • check_circle Semantik arama için kaç belge vektörü depolanabilir?: Pinecone, Qdrant ve Weaviate milyarlarca vektörü ölçeklenebilir biçimde yönetir. Yerel çözümler için pgvector, birkaç milyon vektöre kadar iyi performans sunar.
  • check_circle Semantik arama nedir?: Kullanıcı sorgusunun anlamını kavrayarak, anahtar kelime eşleşmesi yerine bağlamsal benzerliğe göre sonuç döndüren arama yöntemidir. Gömme modelleri ve vektör veritabanlarına dayanır.
  • check_circle Semantik arama ile anahtar kelime araması arasındaki fark nedir?: Anahtar kelime araması (BM25) tam kelime eşleşmesi arar; eşanlamlı veya parafraz ifadeler kaçırılır. Semantik arama anlamsal benzerliği yakalar; 'araba' sorgusu 'otomobil' içeren belgeleri de getirir.
  • check_circle Semantik arama RAG'da nasıl kullanılır?: Kullanıcı sorusu gömme modeli ile vektöre dönüştürülür; vektör veritabanında en benzer belge parçaları aranır ve LLM prompt'una bağlam olarak eklenir. Geri çağırma kalitesi son yanıtın doğruluğunu belirler.
  • check_circle Türkçe semantik arama için hangi modeller kullanılır?: multilingual-e5-large, paraphrase-multilingual-MiniLM-L12-v2 ve LABSE Türkçe dahil çok dilli dil desteği sunar. Hugging Face'de 'turkish embedding' aramasıyla Türkçeye özgü modeller de bulunabilir.