tag BERT

Cross-Encoder (Çapraz Kodlayıcı)

Bu sayfada BERT (Cross-Encoder (Çapraz Kodlayıcı)) etiketi ile işaretlenmiş 6 yapay zeka kavramını bulabilirsiniz.

Cross-Encoder (Çapraz Kodlayıcı), bir sorgu ile bir belgeyi tek bir girdi dizisi olarak birleştirip aynı Transformer geçişinde işleyen ve ikili arasındaki alaka düzeyine doğrudan bir puan atayan yeniden sıralama (reranking) modelidir. Bi-encoder mimarisinde sorgu ve belge ayrı ayrı vektöre dönüştürülüp benzerlikleri kosinüs mesafesiyle ölçülürken, cross-encoder iki metni [SEP] tokenıyla birleştirir ve BERT ya da RoBERTa tabanlı bir kodlayıcıdan tek seferde geçirir. Bu düzenek, dikkat mekanizmasının sorgudaki her tokenı belgedeki her tokenla karşılaştırmasına izin verir; alaka puanı genellikle [CLS] tokenının temsili üzerine oturtulan küçük bir sınıflandırma katmanından elde edilir. Tarihsel olarak bu yaklaşım, 2019'da Nogueira ve Cho'nun MS MARCO pasaj sıralama görevinde BERT'i doğrudan sorgu-pasaj çiftleri üzerinde ince ayarlamasıyla yaygınlaştı. Sonradan "monoBERT" olarak anılan bu model, BM25'e göre MRR@10 metriğinde çarpıcı bir sıçrama gösterdi ve iki aşamalı arama mimarisinin standart parçası hâline geldi. Ardından Sentence-Transformers kütüphanesi CrossEncoder sınıfını ekleyerek bu modelleri birkaç satır Python koduyla kullanılabilir kıldı. Modern bilgi erişimi ve RAG (Retrieval-Augmented Generation) sistemlerinde cross-encoder, "retrieve-then-rerank" olarak adlandırılan iki aşamalı düzenin ikinci katmanında çalışır. Birinci aşamada BM25 ya da bir bi-encoder, milyonlarca belge arasından milisaniyeler içinde 50 ile 200 arasında aday getirir; ikinci aşamada cross-encoder bu küçük kümeyi sorguyla birlikte yeniden değerlendirip nihai sıralamayı belirler. Büyük dil modeline yalnızca en alakalı birkaç parçanın iletilmesi, halüsinasyon oranını düşürür ve bağlam penceresini verimli kullandırır. Temel avantajı, sorgu ile belge arasındaki ince bağlamsal etkileşimi tam dikkat matrisiyle yakalayabilmesidir. "Python nedir?" sorusu için "Python programlama dili" ile "piton yılanı" belgelerini ayırt etmek, iki metindeki ipuçlarını birlikte okumayı gerektirir; bağımsız vektörlerle çalışan bi-encoder bu ayrımı çoğu zaman kaçırır. Bedeli ise hesaplama maliyetidir: belgeler önceden indekslenemez, her sorgu-belge çifti için ayrı bir ileri geçiş gerekir ve 512 token sınırı uzun belgelerin parçalanmasını zorunlu kılar. Bu nedenle cross-encoder tüm katalog üzerinde değil, yalnızca daraltılmış aday kümesi üzerinde kullanılır. ms-marco-MiniLM-L-6-v2, BGE-Reranker-v2-m3 ve Cohere Rerank API günümüzde en yaygın tercih edilen uygulamalardır.

code_blocks

Cross-Encoder (Çapraz Kodlayıcı)

Cross-Encoder (Çapraz Kodlayıcı), bir sorgu ile bir belgeyi tek bir girdi dizisi olarak birleştirip aynı Transformer geçişinde işleyen ve ikili arasındaki alaka düzeyine doğrudan bir puan atayan yeniden sıralama (reranking) modelidir. Bi-encoder mimarisinde sorgu ve belge ayrı ayrı vektöre dönüştürülüp benzerlikleri kosinüs mesafesiyle ölçülürken, cross-encoder iki metni [SEP] tokenıyla birleştirir ve BERT ya da RoBERTa tabanlı bir kodlayıcıdan tek seferde geçirir. Bu düzenek, dikkat mekanizmasının sorgudaki her tokenı belgedeki her tokenla karşılaştırmasına izin verir; alaka puanı genellikle [CLS] tokenının temsili üzerine oturtulan küçük bir sınıflandırma katmanından elde edilir. Tarihsel olarak bu yaklaşım, 2019'da Nogueira ve Cho'nun MS MARCO pasaj sıralama görevinde BERT'i doğrudan sorgu-pasaj çiftleri üzerinde ince ayarlamasıyla yaygınlaştı. Sonradan "monoBERT" olarak anılan bu model, BM25'e göre MRR@10 metriğinde çarpıcı bir sıçrama gösterdi ve iki aşamalı arama mimarisinin standart parçası hâline geldi. Ardından Sentence-Transformers kütüphanesi CrossEncoder sınıfını ekleyerek bu modelleri birkaç satır Python koduyla kullanılabilir kıldı. Modern bilgi erişimi ve RAG (Retrieval-Augmented Generation) sistemlerinde cross-encoder, "retrieve-then-rerank" olarak adlandırılan iki aşamalı düzenin ikinci katmanında çalışır. Birinci aşamada BM25 ya da bir bi-encoder, milyonlarca belge arasından milisaniyeler içinde 50 ile 200 arasında aday getirir; ikinci aşamada cross-encoder bu küçük kümeyi sorguyla birlikte yeniden değerlendirip nihai sıralamayı belirler. Büyük dil modeline yalnızca en alakalı birkaç parçanın iletilmesi, halüsinasyon oranını düşürür ve bağlam penceresini verimli kullandırır. Temel avantajı, sorgu ile belge arasındaki ince bağlamsal etkileşimi tam dikkat matrisiyle yakalayabilmesidir. "Python nedir?" sorusu için "Python programlama dili" ile "piton yılanı" belgelerini ayırt etmek, iki metindeki ipuçlarını birlikte okumayı gerektirir; bağımsız vektörlerle çalışan bi-encoder bu ayrımı çoğu zaman kaçırır. Bedeli ise hesaplama maliyetidir: belgeler önceden indekslenemez, her sorgu-belge çifti için ayrı bir ileri geçiş gerekir ve 512 token sınırı uzun belgelerin parçalanmasını zorunlu kılar. Bu nedenle cross-encoder tüm katalog üzerinde değil, yalnızca daraltılmış aday kümesi üzerinde kullanılır. ms-marco-MiniLM-L-6-v2, BGE-Reranker-v2-m3 ve Cohere Rerank API günümüzde en yaygın tercih edilen uygulamalardır.

arrow_forward
masks

Masked Language Modeling (Maskeli Dil Modelleme (MLM))

Masked Language Modeling (MLM), BERT ve türevlerinin ön eğitiminde kullanılan bir öz-gözetimli öğrenme görevidir. Modele verilen cümledeki token'ların rastgele bir bölümü [MASK] sembolüyle örtülür ve model, bağlamı kullanarak bu gizlenen token'ları tahmin etmeye çalışır. Orijinal BERT makalesinde (Devlin ve ark., Google, 2018) girdi dizisindeki token'ların %15'i seçilir. Bu seçilen token'ların %80'i [MASK] sembolüyle değiştirilirken %10'u rastgele başka bir token ile yer değiştirir, kalan %10 ise orijinal halinde bırakılır. Bu çeşitlendirme, modelin yalnızca [MASK] sembolüne değil gerçek token dağılımına da uyum sağlamasını hedefler; çapraz entropi (cross-entropy) kaybı yalnızca maskelenen pozisyonlar üzerinden hesaplanır. MLM'nin en kritik özelliği, modele çift yönlü (bidirectional) bağlam kavrama yeteneği kazandırmasıdır. GPT gibi öz-regresif modeller yalnızca sola bakarken, BERT hem solundaki hem sağındaki token'lardan yararlanarak tahmin üretir. Bu mimari fark, özellikle cümle sınıflandırma, soru cevaplama ve adlandırılmış varlık tanıma (NER) gibi anlama görevlerinde belirgin avantaj sağlar. Çift yönlü ön eğitim güçlü bir transfer öğrenme temeli oluşturur. BERT-Base 110 milyon, BERT-Large 340 milyon parametresiyle Wikipedia ve BookCorpus verisi üzerinde eğitilmiş; görev başlığı (task head) eklenerek GLUE ve SQuAD gibi kıyaslamalarda dönemin rekor puanlarını kırmıştır. Önceden eğitilmiş ağırlıklar, hedef görev verisine ince ayar (fine-tuning) yapılarak kolayca yeniden kullanılabilmektedir. Sonraki modeller MLM'yi daha da geliştirdi. RoBERTa, daha büyük toplu iş ve dinamik maskelemeyle eğitim verimliliğini artırdı. ALBERT, katman ağırlıklarını paylaştırarak parametre sayısını düşürdü. SpanBERT, tek token yerine token aralıklarını (span) maskeleyerek okuma anlama performansını iyileştirdi. XLM-RoBERTa ise 100'den fazla dili destekleyen çok dilli MLM modelini ortaya koydu. GPT tabanlı üretici modellerin yaygınlaşmasıyla BERT tipi MLM modelleri belirli alanlarda ön plandan çekilmiş olsa da sınıflandırma, NER ve soru cevaplama gibi yapılandırılmış görevlerde yaygın biçimde kullanılmaktadır.

arrow_forward
sentiment_satisfied

Sentiment Analysis (Duygu Analizi (Sentiment Analysis))

Duygu analizi (Sentiment Analysis), metin verilerindeki öznel ifadelerden duygusal eğilimi — pozitif, negatif veya nötr — otomatik olarak çıkaran doğal dil işleme (NLP) görevidir. Müşteri yorumları, sosyal medya paylaşımları, anket yanıtları ve haber metinleri gibi yapılandırılmamış metinleri anlamlandırmak için yaygın biçimde kullanılır. Yöntemler üç ana kategoride incelenir: **Kural tabanlı yaklaşımlar**, önceden tanımlanmış kelime listeleri (VADER, SentiWordNet) ve sözdizimi kuralları kullanır; hızlı ve açıklanabilir ancak bağlam ve ironi konusunda sınırlıdır. **Makine öğrenimi tabanlı yaklaşımlar**, Naive Bayes, SVM ve lojistik regresyon gibi algoritmalarla etiketli veriden öğrenir; kural tabanlıdan daha esnek ama veri bağımlıdır. **Derin öğrenme ve LLM tabanlı yaklaşımlar**, BERT, RoBERTa ve GPT ailesi modeller nüanslı duygu ifadelerini, ironik söylemleri ve alan spesifik jargonu çok daha iyi kavrar. Görev tanımları bakımından temel duygu sınıflandırması (pozitif/negatif/nötr) en basit biçimdir. **Kapsam tabanlı (aspect-based) duygu analizi**, bir ürün yorumundaki farklı özelliklere (kamera, pil, ekran) ayrı duygu puanları atar — "kamerası harika ama pili berbat" gibi ifadeler bu yöntemle doğru işlenir. **Duygu yoğunluğu** analizi, yalnızca yön değil kuvvet de belirler. **Çok dilli duygu analizi**, özellikle Türkçe gibi morfolojik açıdan zengin diller için ek zorluklar barındırır. Uygulama alanları şunlardır: marka itibar yönetimi (sosyal medya izleme), ürün geliştirme (müşteri geri bildirimi önceliklendirme), finans sektöründe haber ve tweet duygusuyla fiyat hareketi tahmini, siyasi kampanya analizi ve çağrı merkezi kayıt analizi. Türkiye'de e-ticaret yorumları ve sosyal medya analitiği en yaygın kullanım alanlarıdır. Başlıca zorluklar: ironi ve alaycılık tespiti, alan değişimi (domain shift) — bir modelin film yorumları üzerindeki başarısı tıp metinlerinde düşebilir —, çok dilli bağlam, gizli duygu ifadeleri ve etiketleyiciler arası anlaşmazlık. Türkçe için TRSentiNet ve Turkish Sentiment Analysis veri setleri geliştirilmiş olmakla birlikte İngilizce kaynaklarla kıyaslandığında hâlâ sınırlı kalmaktadır.

arrow_forward
hub

Transformer (Dönüştürücü Mimarisi)

Transformer, 2017'de Google araştırmacılarının 'Attention Is All You Need' makalesiyle tanıttığı ve bugünkü yapay zeka modellerinin büyük bölümünün temelini oluşturan derin öğrenme mimarisidir. Veriyi kelime kelime, sıralı biçimde işleyen RNN ve LSTM modellerinin aksine Transformer, Self-Attention (öz-dikkat) mekanizmasıyla bir dizideki tüm öğeleri aynı anda işler: her kelime, cümledeki diğer tüm kelimelerle ilişkisini eşzamanlı hesaplar. Bu paralel çalışma biçimi iki büyük sorunu birden çözer. Birincisi, GPU'ların matris çarpımındaki gücünden tam olarak yararlanıldığı için eğitim çok daha hızlıdır; devasa veri setleriyle milyarlarca parametreli model eğitmek ancak bu mimariyle pratik hale gelmiştir. İkincisi, uzak kelimeler arasındaki bağlamsal ilişkiler kaybolmaz; model uzun bir metnin başındaki bilgiyi sonunda da hatırlar. Her token için Query, Key ve Value vektörleri hesaplanır; bu üç vektörün matematiksel etkileşimi, cümledeki her kelimenin hangi diğer kelimelere ne ölçüde 'dikkat edeceğini' belirler. Transformer'ın önemi dil işlemeyle sınırlı kalmadı. ChatGPT, Claude, Gemini ve Llama gibi büyük dil modellerinin (LLM) tamamı bu mimari üzerine kuruludur. Görüntü tarafında Vision Transformer (ViT) sınıflandırma ve nesne tanımada CNN'lere güçlü bir alternatif oldu; Whisper konuşma tanımada, AlphaFold 2 ise protein yapısı tahmininde aynı temeli kullanır. Mimarinin kritik bir özelliği öngörülebilir ölçeklenmesidir: parametre, veri ve hesaplama arttıkça performans da düzenli biçimde artar. Bu ölçekleme yasaları son yılların yapay zeka araştırma gündemini belirlemiş; GPT-2'den itibaren her nesil modelde gözlemlenen tutarlı performans artışı, araştırmacıları modelleri büyütmeye yöneltmiştir. Standart dikkat mekanizmasının karesel hesaplama maliyeti nedeniyle FlashAttention ve kayan pencere dikkati gibi verimlilik teknikleri aktif bir araştırma alanı olmayı sürdürmektedir. Çok modlu Transformer'lar metin, görüntü, ses ve video gibi farklı veri türlerini tek bir model içinde işleyerek yapay zekanın uygulama sınırlarını daha da genişletmektedir.

arrow_forward
shield

Hate Speech Detection (Nefret Söylemi Tespiti)

Nefret söylemi tespiti (Hate Speech Detection), doğal dil işleme ve makine öğrenmesi yöntemlerini kullanarak metin, yorum, gönderi veya konuşma içeriklerindeki nefret ifadelerini, ırkçılığı, cinsiyetçiliği, etnik ayrımcılığı ve şiddete teşvik eden dili otomatik olarak sınıflandırmayı amaçlayan yapay zeka alanıdır. Sosyal medya platformları, haber siteleri ve çevrimiçi topluluklar için içerik moderasyonunun bel kemiğini oluşturur. Temel teknik yaklaşım metin sınıflandırmasıdır. Önceki nesil sistemler TF-IDF ağırlıklı özellikler ve destek vektör makineleri (SVM) veya lojistik regresyon kullanırken, günümüz sistemleri BERT, RoBERTa ve özelleştirilmiş dil modelleri üzerine kuruludur. Fine-tuning yapılmış transformer modelleri, bağlamdan bağımsız anahtar kelime listelerine kıyasla belirgin biçimde üstün performans sergilemektedir: "kesmek" fiili mutfak bağlamında masum iken siyasi söylemde tehdit içerebilir. Teknik zorluğun büyük kısmı veri etiketleme sorunlarından kaynaklanmaktadır. İnsan etiketçiler arasında uyum oranı genellikle %60–70 civarında kalmakta; ironi, argo, mizah ve kültürel bağlam doğru etiketlemeyi güçleştirmektedir. Sınıf dengesizliği de kritik bir sorundur: üretilen içeriklerin çok küçük fraksiyonu gerçek nefret söylemi içerdiğinden, naif modeller sınıfı tamamen yok sayarak yüksek doğruluk iddiasında bulunabilir. Türkçe bağlamında nefret söylemi tespiti ek zorluklar barındırır. Türkçe'nin sondan eklemeli yapısı, argo ve kod-karıştırma (Türkçe-İngilizce karma kullanım) modelleme sürecini karmaşıklaştırır. BERTurk, ConvBERTurk ve çok-dilli modeller bu görev için ince ayar yapılmaktadır. Türkiye'de BTK ve sosyal medya platformlarının içerik moderasyon politikaları nedeniyle Türkçe veri setlerinin geliştirilmesi araştırma gündeminde önemli bir yer tutmaktadır. Etik boyutlar tartışmayı sürekli canlı tutar. Aşırı engelleme (over-blocking), azınlık topluluklarının meşru ifade özgürlüğünü bastırma riskini taşır; az engelleme (under-blocking) ise zararlı içeriklerin yayılmasına zemin hazırlar. Otomatik sistemler insan denetimini tamamlamalı, onun yerini almamalıdır. AB Dijital Hizmetler Yasası (DSA) ve Türkiye'deki sosyal medya düzenlemeleri, bu sistemlerin şeffaflık ve hesap verebilirlik gerekliliklerini yasal zemine taşımaktadır. 2026 itibarıyla çok-modlu nefret söylemi tespiti araştırma gündeminin ön sıralarına yerleşmiştir.

arrow_forward
chat

Natural Language Processing (Doğal Dil İşleme)

Doğal Dil İşleme (NLP — Natural Language Processing), bilgisayarların insan dilini anlama, yorumlama, üretme ve anlamlı biçimde yanıt verme yeteneğini geliştiren yapay zeka dalıdır. Dilbilim, bilgisayar bilimi ve makine öğreniminin kesişim noktasında yer alan NLP, günümüzde ChatGPT gibi sohbet robotlarından Google Arama'ya, otomatik çeviriden sesli asistanlara kadar geniş bir kullanım alanına ulaşmıştır. NLP'nin temel işlem hattı birkaç katmandan oluşur: tokenizasyon (metni sözcük veya alt-sözcük parçalarına ayırma), morfolojik analiz (kelime köklerini ve eklerini çözümleme), sözdizimi çözümlemesi (cümle yapısını ağaçla modelleme) ve anlambilimsel analiz (bağlamı ve niyeti kavrama). Modern derin öğrenme yaklaşımları bu aşamaları büyük ölçüde bütünleşik sinir ağlarıyla uçtan uca öğrenir; BERT ve GPT serisi bu dönüşümün simgesi haline gelmiştir. Türkçe, sondan eklemeli (agglutinative) morfolojisi nedeniyle NLP için özellikle zorlu bir dildir. "Gidebileceklerinden" gibi tek bir sözcük onlarca anlam katmanı barındırabilir. BERTurk, Turkish GPT ve Zemberek gibi projeler Türkçe özelinde çözümler geliştirirken, Byte Pair Encoding (BPE) ve SentencePiece alt-sözcük tokenizasyonu dil modellerinin Türkçeyi verimli işlemesini mümkün kılmaktadır. 2017'de yayımlanan Transformer mimarisi NLP'yi köklü biçimde dönüştürdü: öz-dikkat mekanizması ile modeller uzun menzilli bağımlılıkları yakalayabildi. BERT (2018), GPT-3 (2020) ve ChatGPT (2022) bu dönüşümün kilometre taşlarıdır. Günümüzde büyük dil modelleri (LLM) NLP görevlerinin büyük çoğunluğunda insan düzeyine yaklaşmış ya da aşmıştır. NLP; metin sınıflandırma, adlandırılmış varlık tanıma, makine çevirisi, duygu analizi, soru-cevap sistemleri ve özetleme başta olmak üzere onlarca kritik uygulamaya güç vermektedir. Endüstride NLP bileşenleri yaygın biçimde kullanılmaktadır: müşteri hizmetlerinde chatbot ve otomasyon, hukuk teknolojisinde belge tarama, sağlık alanında klinik not çözümleme ve ilaç literatürü analizi. Retrieval-Augmented Generation (RAG) mimarisinde NLP katmanları, kullanıcı sorgusunu vektör uzayında temsil edip ilgili belgeleri alır; böylece LLM'in güncel ve doğru yanıtlar üretmesi desteklenir. Türkiye'de e-devlet platformları, fintech uygulamaları ve yerli yapay zeka girişimleri Türkçe NLP altyapısına giderek artan yatırım yapmaktadır.

arrow_forward