Information Retrieval (IR) (Bilgi Erişimi)

Büyük veri koleksiyonlarından kullanıcı sorgusuna en alakalı içerikleri bulup sıralayan bilgisayar bilimi dalıdır.

Bilgi Erişimi (Information Retrieval, IR), büyük belge koleksiyonları veya veri kümeleri içinden kullanıcının bilgi ihtiyacına en uygun içerikleri bulup sıralayan bir bilgisayar bilimi dalıdır. Google, Bing ve Yandex gibi web arama motorları ile akademik veri tabanları, bu disiplinin en yaygın uygulamalarıdır. Geleneksel IR sistemleri, metinlerin kelime frekanslarına dayanan TF-IDF (Term Frequency-Inverse Document Frequency) ve BM25 gibi istatistiksel modeller üzerine kuruluydu. Bu yaklaşımlarda belgeler ve sorgular "çanta modeli" (bag-of-words) ile temsil edilir; kelimelerin sırasına değil yalnızca varlığına bakılır. Bu yöntemler hızlı ve yorumlanabilir olsa da anlam bağlamını (semantiği) kavrayamaz; "otomobil" sorgusu "araba" kelimesini içeren belgeleri bulamaz. Derin öğrenme ve büyük dil modellerinin yaygınlaşmasıyla birlikte nöral bilgi erişimi yeni bir çığır açtı. Gömülü vektörler (embedding) sayesinde sorgular ve belgeler yüksek boyutlu anlam uzayına taşınır; benzer anlamlı içerikler bu uzayda birbirine yakın konumlanır. Böylece "COVID-19 belirtileri" sorgusu, "koronavirüs semptomları" başlıklı belgeyle kavramsal benzerlik üzerinden eşleşebilir. Çift kodlayıcı (bi-encoder) mimarilerde sorgu ve belge ayrı ayrı gömülerek kosinüs benzerliği hesaplanırken, çapraz kodlayıcı (cross-encoder) mimariler ikisini birlikte değerlendirerek daha hassas sıralama sağlar. Vektör veritabanları bu anlam tabanlı eşleşmeyi verimli ölçekte mümkün kılar; HNSW ve IVF gibi ANN (Approximate Nearest Neighbor) algoritmaları sayesinde milyarlarca vektör içinde milisaniyeler içinde arama yapılır. Retrieval-Augmented Generation (RAG) mimarisinde ise IR, büyük dil modellerinin güncel ve doğru yanıtlar üretmesi için bilgi alma katmanı görevi görür. IR başarısını ölçmek için Precision, Recall, F1 ve NDCG (Normalized Discounted Cumulative Gain) metrikleri kullanılır. 1992'den beri NIST tarafından düzenlenen TREC (Text Retrieval Conference) koleksiyonları altın standart olarak kabul edilir. Modern IR sistemleri çok dilli arama, görüntü ve ses tabanlı sorgulama ile kişiselleştirme gibi multimodal ve bağlam duyarlı yetenekleri de kapsamaktadır.

hub Modern Yapay Zeka ile Kesişimi

Geleneksel IR sistemleri (BM25 veya TF-IDF gibi) kelime eşleşmelerine odaklanırken, modern IR sistemleri yapay zeka ve Vektör Veritabanları kullanarak kelimelerin anlamsal (semantik) eşleşmesini sağlar. Günümüzde Büyük Dil Modellerinin (LLM) doğruluğunu artırmak için kullanılan RAG (Retrieval-Augmented Generation) mimarisinin en kritik yapı taşıdır.

account_tree Bilgi Erişimi Aşamakları

  • check_circle İndeksleme (Indexing): Tüm belgelerin okunarak hızlı aranabilir bir yapıya (ters indeks veya vektör) dönüştürülmesi.
  • check_circle Sorgu İşleme (Query Processing): Kullanıcının girdiği cümlenin temizlenmesi, eşanlamlılarının bulunması ve matematiksel vektöre çevrilmesi.
  • check_circle Sıralama (Ranking): Bulunan sonuçların alaka düzeyine göre puanlanıp en iyiden en kötüye doğru sıralanması.

Bilgi Erişimi Yöntemleri

  • check_circle Terim Tabanlı Erişim (Sparse): TF-IDF: terim frekansı ve ters belge frekansı — kelimenin önemini ölçer. BM25: TF-IDF'in modern versiyonu; belge uzunluğu normalizasyonu ekler. Boolean model: AND/OR/NOT operatörleri ile kesin eşleşme. Avantaj: hızlı, yorumlanabilir, altyapısı basit. Dezavantaj: sözcüksel uyuşma zorunlu — 'araba' 'otomobil'i bulmaz.
  • check_circle Anlamsal Erişim (Dense): Embedding tabanlı: sorgu ve belgeler yoğun vektörlere dönüştürülür. Kosinüs benzerliği ile en yakın vektörler bulunur. FAISS / Annoy / HNSW: ANN algoritmaları ile milyarlarca vektörde hızlı arama. Avantaj: anlamsal anlayış — eşanlamlılar, parafraz bulunur.
  • check_circle Hibrit Erişim ve Yeniden Sıralama: BM25 + embedding birlikte: birinin atladığını diğeri yakalar. Reciprocal Rank Fusion: iki sıralamayı birleştirme yöntemi. Reranker: çapraz dikkat modeli (CE) ile ilk N belge yeniden sıralanır. Cohere Rerank, BGE Reranker, cross-encoder/ms-marco en yaygın reranker'lar.

Bilgi Erişiminin RAG ve LLM Ekosistemine Etkisi

RAG (Retrieval Augmented Generation) modern IR'ın en önemli uygulaması: kullanıcı sorusuna göre ilgili belgeler getirilir, LLM bu belgelerle yanıtlar. Değerlendirme metrikleri: MRR (Mean Reciprocal Rank), NDCG (Normalized Discounted Cumulative Gain), Recall@K (ilk K sonuç içinde doğru belge oranı). BEIR benchmark: 18 IR veri seti üzerinde model karşılaştırması. Koleksiyon türleri: belgeler, pasajlar, tablolar, kod, multimodal. Sorgu türleri: olgusal soru, navigasyonel, araştırma sorusu. Sparse ve dense IR birleşimi (hibrit) çoğu gerçek dünya uygulamasında tek başına her ikisinden de üstün.

quiz Sıkça Sorulan Sorular (FAQ)

  • check_circle RAG ile IR arasındaki ilişki nedir?: RAG (Retrieval-Augmented Generation), büyük dil modellerinin (ChatGPT vb.) bilmediği konuları internetten veya kurum içi belgelerden Information Retrieval sistemi ile çekip, bu bilgiyi kullanarak cevap vermesini sağlayan bir mimaridir.
  • check_circle Semantik Arama nedir?: Kelimelerin birebir eşleşmesine bakmak yerine, sorgunun niyetini ve anlamına bakarak sonuç getiren gelişmiş bir Information Retrieval yöntemidir.
  • check_circle Bilgi erişimi nedir?: Büyük belge koleksiyonlarından kullanıcı sorgusuna en ilgili belgeleri hızlı ve doğru bulan sistem ve algoritmaların bütünüdür. Web arama motorları, kurumsal arama ve RAG sistemleri bu alanın uygulamalarıdır.
  • check_circle BM25 ile embedding arasında hangisi seçilmeli?: BM25: hızlı, basit, anahtar kelime eşleşmesi güçlü — ürün adı, kod, sayı araması. Embedding: anlam odaklı, soru-cevap ve parafraz yakalama. En iyi: hibrit — BM25 + embedding + reranker üçlüsü.
  • check_circle RAG'da retrieval kalitesini nasıl artırılır?: Chunk stratejisi: 512 token chunk örtüşmeli; sorgu tarzına uygun boyut seç. Embedding modeli: görev uyumlu — asimetrik (soru↔pasaj) vs simetrik (pasaj↔pasaj). Reranker ekle: ilk 50'den en iyi 5'i seç — hassasiyet artar. Query expansion: sorguyu yeniden ifade et ve birden fazla varyantla ara.
  • check_circle IR değerlendirme metrikleri nelerdir?: Precision@K: ilk K sonucun kaçı ilgili? Recall@K: ilgili belgelerin kaçı ilk K'da? NDCG@K: sıralama pozisyonuna göre ağırlıklı puan — sıralama kalitesi. MRR: doğru sonucun ortalama sıralama konumu — anlık soru-cevap için.