tag bilgi-erişimi

Information Retrieval (IR) (Bilgi Erişimi)

Bu sayfada bilgi-erişimi (Information Retrieval (IR) (Bilgi Erişimi)) etiketi ile işaretlenmiş 4 yapay zeka kavramını bulabilirsiniz.

Bilgi Erişimi (Information Retrieval, IR), büyük belge koleksiyonları veya veri kümeleri içinden kullanıcının bilgi ihtiyacına en uygun içerikleri bulup sıralayan bir bilgisayar bilimi dalıdır. Google, Bing ve Yandex gibi web arama motorları ile akademik veri tabanları, bu disiplinin en yaygın uygulamalarıdır. Geleneksel IR sistemleri, metinlerin kelime frekanslarına dayanan TF-IDF (Term Frequency-Inverse Document Frequency) ve BM25 gibi istatistiksel modeller üzerine kuruluydu. Bu yaklaşımlarda belgeler ve sorgular "çanta modeli" (bag-of-words) ile temsil edilir; kelimelerin sırasına değil yalnızca varlığına bakılır. Bu yöntemler hızlı ve yorumlanabilir olsa da anlam bağlamını (semantiği) kavrayamaz; "otomobil" sorgusu "araba" kelimesini içeren belgeleri bulamaz. Derin öğrenme ve büyük dil modellerinin yaygınlaşmasıyla birlikte nöral bilgi erişimi yeni bir çığır açtı. Gömülü vektörler (embedding) sayesinde sorgular ve belgeler yüksek boyutlu anlam uzayına taşınır; benzer anlamlı içerikler bu uzayda birbirine yakın konumlanır. Böylece "COVID-19 belirtileri" sorgusu, "koronavirüs semptomları" başlıklı belgeyle kavramsal benzerlik üzerinden eşleşebilir. Çift kodlayıcı (bi-encoder) mimarilerde sorgu ve belge ayrı ayrı gömülerek kosinüs benzerliği hesaplanırken, çapraz kodlayıcı (cross-encoder) mimariler ikisini birlikte değerlendirerek daha hassas sıralama sağlar. Vektör veritabanları bu anlam tabanlı eşleşmeyi verimli ölçekte mümkün kılar; HNSW ve IVF gibi ANN (Approximate Nearest Neighbor) algoritmaları sayesinde milyarlarca vektör içinde milisaniyeler içinde arama yapılır. Retrieval-Augmented Generation (RAG) mimarisinde ise IR, büyük dil modellerinin güncel ve doğru yanıtlar üretmesi için bilgi alma katmanı görevi görür. IR başarısını ölçmek için Precision, Recall, F1 ve NDCG (Normalized Discounted Cumulative Gain) metrikleri kullanılır. 1992'den beri NIST tarafından düzenlenen TREC (Text Retrieval Conference) koleksiyonları altın standart olarak kabul edilir. Modern IR sistemleri çok dilli arama, görüntü ve ses tabanlı sorgulama ile kişiselleştirme gibi multimodal ve bağlam duyarlı yetenekleri de kapsamaktadır.

manage_search

Information Retrieval (IR) (Bilgi Erişimi)

Bilgi Erişimi (Information Retrieval, IR), büyük belge koleksiyonları veya veri kümeleri içinden kullanıcının bilgi ihtiyacına en uygun içerikleri bulup sıralayan bir bilgisayar bilimi dalıdır. Google, Bing ve Yandex gibi web arama motorları ile akademik veri tabanları, bu disiplinin en yaygın uygulamalarıdır. Geleneksel IR sistemleri, metinlerin kelime frekanslarına dayanan TF-IDF (Term Frequency-Inverse Document Frequency) ve BM25 gibi istatistiksel modeller üzerine kuruluydu. Bu yaklaşımlarda belgeler ve sorgular "çanta modeli" (bag-of-words) ile temsil edilir; kelimelerin sırasına değil yalnızca varlığına bakılır. Bu yöntemler hızlı ve yorumlanabilir olsa da anlam bağlamını (semantiği) kavrayamaz; "otomobil" sorgusu "araba" kelimesini içeren belgeleri bulamaz. Derin öğrenme ve büyük dil modellerinin yaygınlaşmasıyla birlikte nöral bilgi erişimi yeni bir çığır açtı. Gömülü vektörler (embedding) sayesinde sorgular ve belgeler yüksek boyutlu anlam uzayına taşınır; benzer anlamlı içerikler bu uzayda birbirine yakın konumlanır. Böylece "COVID-19 belirtileri" sorgusu, "koronavirüs semptomları" başlıklı belgeyle kavramsal benzerlik üzerinden eşleşebilir. Çift kodlayıcı (bi-encoder) mimarilerde sorgu ve belge ayrı ayrı gömülerek kosinüs benzerliği hesaplanırken, çapraz kodlayıcı (cross-encoder) mimariler ikisini birlikte değerlendirerek daha hassas sıralama sağlar. Vektör veritabanları bu anlam tabanlı eşleşmeyi verimli ölçekte mümkün kılar; HNSW ve IVF gibi ANN (Approximate Nearest Neighbor) algoritmaları sayesinde milyarlarca vektör içinde milisaniyeler içinde arama yapılır. Retrieval-Augmented Generation (RAG) mimarisinde ise IR, büyük dil modellerinin güncel ve doğru yanıtlar üretmesi için bilgi alma katmanı görevi görür. IR başarısını ölçmek için Precision, Recall, F1 ve NDCG (Normalized Discounted Cumulative Gain) metrikleri kullanılır. 1992'den beri NIST tarafından düzenlenen TREC (Text Retrieval Conference) koleksiyonları altın standart olarak kabul edilir. Modern IR sistemleri çok dilli arama, görüntü ve ses tabanlı sorgulama ile kişiselleştirme gibi multimodal ve bağlam duyarlı yetenekleri de kapsamaktadır.

arrow_forward
travel_explore

Search Engine (Arama Motoru)

Arama Motoru, internet üzerindeki milyarlarca web sayfasını otomatik olarak tarayan, indeksleyen ve kullanıcıların metin sorguları karşısında en alakalı sonuçları sıralayarak sunan yazılım sistemidir. Google, Bing ve Yandex bu alandaki başlıca örneklerdir. Teknik açıdan arama motorları üç temel bileşenden oluşur. Web tarayıcı (crawler/spider), bilinen URL'lerden başlayarak hiperlink grafiğini gezerek yeni sayfaları keşfeder ve içeriklerini indirir. İndeksleme (indexing) aşamasında indirilen içerik ayrıştırılır, tokenize edilir ve tersine çevrilmiş indeks (inverted index) veri yapısına eklenir; bu yapı her kelime için hangi sayfalarda geçtiğini hızla bulmayı sağlar. Sıralama (ranking) aşamasında ise aday sayfalar arasında en alaka düzeyi yüksek olanlar öne çıkarılır. PageRank algoritması (Brin & Page, 1998), sıralamanın temelini uzun yıllar oluşturdu: gelen bağlantı sayısı ve kalitesini oy verme mekanizması olarak değerlendirerek sayfanın otoritesini ölçtü. Günümüzde modern sıralama sistemleri yüzlerce sinyal kullanır: kullanıcı tıklama davranışları, sayfa yükleme hızı, mobil uyumluluk, içerik tazeliği ve derin öğrenme tabanlı alaka modelleri bunlar arasındadır. 2019'dan itibaren Google, BERT ve ardından MUM gibi transformatör tabanlı modelleri arama sıralamasına entegre etti. Bu modeller sorgu amacını anlama, belirsiz sorgu kelimelerini bağlam içinde yorumlama ve çok dilli içerik eşleştirme konularında klasik anahtar kelime tabanlı yaklaşımların çok ötesine geçti. Türkiye'de Google, arama motoru pazarında yaklaşık %90 pay ile baskın konumdadır; Yandex ise özellikle Rusça içerik arayanlar arasında kullanılmaktadır. Yapay zeka destekli yanıt motorlarının (AI Overviews, Perplexity) yaygınlaşmasıyla geleneksel "on mavi bağlantı" modeli değişim baskısıyla karşılaşmaktadır. Retrieval-Augmented Generation (RAG) mimarileri, dil modellerini arama indeksiyle birleştirerek doğrudan cevap üretebilmekte; bu gelişme SEO stratejilerini de kökten dönüştürmektedir. Uzun kuyruk anahtar kelimelere yönelik içerik optimizasyonunun önemi artarken soru-cevap biçimindeki içeriklere olan talep yükselmektedir.

arrow_forward
code_blocks

TF-IDF (TF-IDF (Terim Frekansı-Ters Belge Frekansı))

TF-IDF (Term Frequency-Inverse Document Frequency — Terim Frekansı-Ters Belge Frekansı), metin madenciliği ve bilgi erişiminde bir kelimenin bir belge koleksiyonuna göre o belgede ne kadar önemli olduğunu sayısal olarak temsil eden temel bir yöntemdir. İki bileşenin çarpımından oluşur. TF (Terim Frekansı), hedef kelimenin incelenen belgede kaç kez geçtiğini gösterir. Genellikle toplam kelime sayısına bölünerek normalleştirilir; böylece uzun belgeler haksız avantaj elde etmez. IDF (Ters Belge Frekansı), kelimenin belge koleksiyonunda ne kadar nadir olduğunu ölçer. Koleksiyondaki toplam belge sayısının kelimenin geçtiği belge sayısına oranının logaritması alınarak hesaplanır. Bu sayede "ve", "ile", "bu" gibi anlam taşımayan yaygın kelimeler çok düşük ağırlık alırken belgeye özgü teknik terimler ön plana çıkar. 1972'de Karen Spärck Jones tarafından geliştirilen bu yöntem, onlarca yıldır arama motorlarında belge sıralama, metin sınıflandırma, anahtar kelime çıkarma, belge özeti ve benzerlik hesaplama gibi görevlerde kullanılmaktadır. Elasticsearch ve Apache Solr, arama skorlamasında TF-IDF türevli BM25 algoritmasına dayanır. Python ekosisteminde scikit-learn'ün TfidfVectorizer sınıfı, ham metin koleksiyonunu seyrek TF-IDF matrisine dönüştürür; bu matris makine öğrenmesi modellerine doğrudan girdi olarak verilir. Modern büyük dil modelleri (LLM) ve semantik gömme (embedding) yöntemlerinin yaygınlaşmasıyla birlikte TF-IDF'nin önemi sorgulanmış olsa da, yorumlanabilirlik, düşük bellek ayak izi ve hesaplama verimliliği bu yöntemi uygulamada hâlâ geçerli kılmaktadır. Özellikle BM25 ile hibrit arama sistemleri ve RAG (Retrieval-Augmented Generation) ardışık düzenlerinde TF-IDF temelli geri çağırma katmanı yaygın biçimde kullanılmaktadır. Türkçe doğal dil işleme çalışmalarında TF-IDF, haber sınıflandırma, ürün yorumu analizi ve arama ön işleme katmanlarında kullanılmaktadır. Türkçe'nin zengin çekimli yapısı nedeniyle zemberek veya snowball stemmer ile ön işleme yapılması önerilir. Büyük dil modelleri embedding katmanında TF-IDF'yi geçmiş olsa da, hızlı prototipleme ve küçük veri kümelerinde hâlâ tercih edilmektedir.

arrow_forward
code_blocks

Agentic RAG (Ajanlı Erişim Artırımlı Üretim)

Agentic RAG (Ajanlı Erişim Artırımlı Üretim), klasik Retrieval-Augmented Generation (RAG) mimarisini ajan tabanlı planlama ve akıl yürütmeyle birleştiren ileri düzey bir yapay zeka yaklaşımıdır. Geleneksel RAG'da bilgi erişimi tek adımda gerçekleşir: kullanıcı sorusu vektör veritabanında aranır, bulunan belgeler dil modeline bağlam olarak aktarılır ve model tek seferde yanıt üretir. Agentic RAG bu doğrusal akışı dinamik bir döngüye dönüştürür. Ajan önce soruyu analiz eder, hangi bilgiye ihtiyaç duyduğuna karar verir, birden fazla kaynakta arama yapar, gelen sonuçları değerlendirir ve yeterli bulmazsa sorguyu yeniden formüle ederek aramayı tekrarlar. Ajanın temel yetenekleri dört başlıkta toplanır: sorgu ayrıştırma (karmaşık soruyu alt sorulara bölme), çok atlamalı erişim (bir aramanın sonucunu bir sonraki aramanın girdisi yapma), öz eleştiri (toplanan bağlamı ve taslak yanıtı kendi kendine denetleme) ve yinelemeli iyileştirme (yanıtı adım adım güçlendirme). Bu yetenekler bir araya geldiğinde sistem, tek adımlı RAG'ın yetersiz kaldığı karmaşık, çok kaynaklı ve zincirleme akıl yürütme gerektiren sorularda belirgin biçimde daha doğru yanıtlar üretir. Mimari açıdan bir Agentic RAG sistemi genellikle bir orkestrasyon katmanı (LangGraph, AutoGen, CrewAI gibi), birden fazla erişim aracı (vektör veritabanı, web araması, SQL sorgusu, harici API), bir değerlendirici modül ve bellek bileşeni içerir. LlamaIndex ve LangChain bu mimariyi kuran hazır bileşenler sunar. 2023 sonunda yayımlanan Self-RAG ve FLARE makaleleri, modelin ne zaman arama yapacağına kendisinin karar vermesi fikrini akademik olarak temellendirdi; 2024'ten itibaren ise bu yaklaşım sektörde "agentic RAG" adıyla yaygınlaştı. Pratik kullanım alanları arasında kurumsal bilgi tabanı sorgulama, hukuki araştırma asistanları, tıbbi literatür analizi ve finansal rapor sentezi öne çıkar. Bu alanlarda uzun zincirli akıl yürütme gerektiren görevlerde geleneksel RAG'a kıyasla ölçülebilir bir doğruluk artışı gözlenir. Bedeli ise daha yüksek gecikme ve token maliyetidir; bu yüzden basit olgusal sorular için tek adımlı RAG hâlâ daha uygun bir tercihtir.

arrow_forward