Semantik Arama Bileşenleri
transform Embedding Modeli
Metni yoğun vektöre dönüştürür. SBERT, E5, BGE ve OpenAI ada-002 yaygın seçimlerdir. Çok dilli modeller farklı dilleri ortak vektör uzayında kodlar.
storage Vektör Veritabanı
Vektörleri depolar ve ANN araması yapar. Pinecone, Weaviate, Qdrant bulut seçenekleri; pgvector PostgreSQL eklentisi olarak sunar.
hub ANN Araması
HNSW ve IVF-Flat gibi algoritmalar milyonlarca vektörde milisaniyeler içinde yaklaşık arama yapar. Tam aramadan 100x+ hızlıdır.
sort Yeniden Sıralama
İlk getiri sonuçlarını cross-encoder modeliyle daha hassas biçimde yeniden sıralar. Precision artışı sağlar, ancak ek gecikme ekler.
merge Hibrit Arama: En İyi Yaklaşım
Saf semantik arama, nadir terimler ve tam eşleşme gerektiren durumlarda (ürün kodu, isim) başarısız olabilir. Saf anahtar kelime araması anlam boşluklarını kapatamaz. Hibrit arama, BM25 skor ve vektör benzerlik skorunu RRF (Reciprocal Rank Fusion) veya doğrusal interpolasyonla birleştirir. Elasticsearch, OpenSearch ve Weaviate hibrit arama desteği sunar. Üretim RAG sistemlerinin büyük çoğunluğu bu kombinasyonu tercih eder.
Semantik Arama Bileşenleri ve Teknikleri
- check_circle Yoğun Gömme Araması (Dense Retrieval): Sorgu ve belgeler gömme modeli ile vektöre dönüştürülür; en yüksek kosinüs benzerliğine sahip belgeler getirilir. BM25'in yetersiz kaldığı parafraz ve anlam değişikliklerini yakalar.
- check_circle BM25 (Anahtar Kelime Araması): Klasik TF-IDF tabanlı arama algoritması; tam anahtar kelime eşleşmesinde güçlü. Semantik aramaya göre belirli teknik terimler için daha güvenilir sonuç verebilir.
- check_circle Hibrit Arama: BM25 ve yoğun vektör aramasını birleştirerek her iki yaklaşımın avantajını kullanır. Sonuçlar RRF (Reciprocal Rank Fusion) veya ağırlıklı birleştirmeyle sentezlenir.
- check_circle Çapraz Kodlayıcı Yeniden Sıralama (Cross-Encoder Reranking): İlk aşamada getirilen belgeler daha pahalı çapraz kodlayıcı modelle yeniden puanlanır. Çift kodlayıcı hızı ile çapraz kodlayıcı doğruluğunu birleştirir.
- check_circle Çok Dilli Semantik Arama: LABSE, mE5 ve multilingual-e5-large gibi çok dilli gömme modelleri farklı dillerdeki sorgu ve belgeleri ortak vektör uzayında temsil eder.
- check_circle ColBERT ve Geç Etkileşim: Her token için ayrı vektör üretir; sorgulama zamanında token düzeyinde etkileşim hesaplanır. Tek vektör gömmeye göre daha nüanslı eşleşme; depolama maliyeti daha yüksek.
Semantik Aramanın RAG Sistemlerindeki Rolü ve Ölçüm Kriterleri
Semantik arama, RAG (Retrieval-Augmented Generation) sistemlerinin kalp atışıdır. Bir LLM'nin kaliteli yanıt üretmesi için doğru belgelerin getirilmesi birincil koşuldur; semantik arama bu geri çağırma kalitesini doğrudan belirler. Değerlendirme metrikleri: Recall@K — doğru belgenin ilk K sonuç içinde bulunma oranı; MRR (Mean Reciprocal Rank) — doğru sonucun ortalama sıra tersinin ortalaması; NDCG — sıralamayı da dikkate alan bilgi erişim metriği. Türkçe semantik arama zorlukları: Türkçe soneki bakımından zengin yapısı (morfologik karmaşıklık) gömme modellerini zorlar. multilingual-e5-base ve sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 Türkçe için makul kalite sunar; ancak Türkçe özelleşmiş modeller Hugging Face'de araştırılmalıdır. Üretim önerileri: önce BM25 baseline kurun, ardından hibrit arama ekleyin, son adımda reranking uygulayın. Her adımın etki büyüklüğünü kendi veri setinizde ölçün; genel benchmark sonuçları kullanım senaryonuzu yansıtmayabilir.
Türkçe Ekosistem ve Pratik Kullanım Senaryoları
- check_circle Türkçe için Önerilen Embedding Modelleri: multilingual-e5-large, paraphrase-multilingual-MiniLM-L12-v2 ve LABSE ince ayar gerekmeden yüksek Türkçe başarımı sunar; BGE-M3 ise çok dilli hibrit arama için güçlü alternatiftir.
- check_circle E-Ticaret Ürün Araması: Kullanıcı 'hafif spor ayakkabı' aradığında 'running shoe' veya 'koşu sneaker' gibi varyantları da bulur. Anlam tabanlı öneri, dönüşüm oranlarını geleneksel anahtar kelime aramasına kıyasla belirgin biçimde artırır.
- check_circle Kurumsal Bilgi Yönetimi: Dahili belgeler, politikalar ve SSS'ler vektör veritabanında indekslenerek çalışanların doğal dil sorgularıyla anında içerik bulması mümkün olur; klasik intranet araçlarının kaçırdığı anlam sorguları bu şekilde çözülür.
- check_circle Hukuki ve Akademik Belge Tarama: Binlerce sayfalık içtihat, sözleşme veya makale arasından konuya uygun bölümleri anlamsal olarak bulan sistemler; klasik arama araçlarının atladığı eşanlamlı kavramları yakalayarak araştırma süresini kısaltır.
- check_circle Başarım Ölçümü: Recall@K (doğru belgenin ilk K sonuç içinde yer alma oranı), MRR (Mean Reciprocal Rank) ve NDCG (Normalized Discounted Cumulative Gain) temel değerlendirme metrikleridir. Üretim sistemleri bu metrikleri A/B testi ve tık oranı verileriyle karşılaştırarak hibrit arama ağırlıklarını optimize eder.
quiz Sık Sorulan Sorular
- check_circle Semantik arama için hangi embedding modeli seçilmeli?: Türkçe için çok dilli modeller (paraphrase-multilingual-MiniLM, multilingual-e5-large) önerilir. İngilizce için BAAI/bge-large-en-v1.5 veya OpenAI text-embedding-3-large güçlü seçimlerdir.
- check_circle Semantik arama için kaç belge vektörü depolanabilir?: Pinecone, Qdrant ve Weaviate milyarlarca vektörü ölçeklenebilir biçimde yönetir. Yerel çözümler için pgvector, birkaç milyon vektöre kadar iyi performans sunar.
- check_circle Semantik arama nedir?: Kullanıcı sorgusunun anlamını kavrayarak, anahtar kelime eşleşmesi yerine bağlamsal benzerliğe göre sonuç döndüren arama yöntemidir. Gömme modelleri ve vektör veritabanlarına dayanır.
- check_circle Semantik arama ile anahtar kelime araması arasındaki fark nedir?: Anahtar kelime araması (BM25) tam kelime eşleşmesi arar; eşanlamlı veya parafraz ifadeler kaçırılır. Semantik arama anlamsal benzerliği yakalar; 'araba' sorgusu 'otomobil' içeren belgeleri de getirir.
- check_circle Semantik arama RAG'da nasıl kullanılır?: Kullanıcı sorusu gömme modeli ile vektöre dönüştürülür; vektör veritabanında en benzer belge parçaları aranır ve LLM prompt'una bağlam olarak eklenir. Geri çağırma kalitesi son yanıtın doğruluğunu belirler.
- check_circle Türkçe semantik arama için hangi modeller kullanılır?: multilingual-e5-large, paraphrase-multilingual-MiniLM-L12-v2 ve LABSE Türkçe dahil çok dilli dil desteği sunar. Hugging Face'de 'turkish embedding' aramasıyla Türkçeye özgü modeller de bulunabilir.