tag dil-modeli
Pre-training (Ön Eğitim) (Ön Eğitim)
Bu sayfada dil-modeli (Pre-training (Ön Eğitim) (Ön Eğitim)) etiketi ile işaretlenmiş 10 yapay zeka kavramını bulabilirsiniz.
Pre-training (Ön Eğitim), dil modelleri ve diğer derin öğrenme sistemlerinin belirli bir göreve yönlendirilmeden önce büyük ve çeşitli ham veri kümeleri üzerinde genel dil örüntülerini, bilgi yapılarını ve dünya modelini kazandığı ilk eğitim aşamasıdır. Modern yapay zekanın temel taşı olan bu süreç, foundation model paradigmasının merkezinde yer almaktadır. Pre-training'in çalışma mantığı modelin türüne göre farklılaşır. Otoregressif dil modellerinde (GPT ailesi) model, her adımda bir önceki tokenlere bakarak sonraki tokeni tahmin eder; bu görev dil modellemesi (causal language modeling) olarak adlandırılır. Maskelemeli dil modellerinde (BERT) ise giriş cümlesindeki rastgele tokenler gizlenerek model bu maskelenmiş tokenleri bağlamdan yeniden kazanmayı öğrenir. Her iki yaklaşım da öz-denetimli öğrenme prensibine dayandığından etiketsiz büyük veri kullanılabilir; metinlerin kendisi öğrenme sinyali oluşturur. Veri ölçeği açısından modern pre-training'in devasa boyutları dikkat çekicidir: GPT-3 yaklaşık 300 milyar token, LLaMA 3 ise 15 trilyon token üzerinde eğitilmiştir. Bu veri kümeleri İnternet metinleri (Common Crawl), kitaplar, akademik makaleler, kod depoları ve çok dilli içeriklerden derlenir. Eğitim bilgi işlem maliyeti de aynı ölçekte büyüktür; GPT-4 eğitiminin yüz milyon dolar civarında olduğu tahmin edilmektedir. Pre-training tamamlandıktan sonra model çeşitli yöntemlerle belirli görevlere uyarlanır. İnce ayar (fine-tuning) ile ilgili alan verisi üzerinde model özelleştirilir. RLHF (Reinforcement Learning from Human Feedback) ile insan tercihlerine hizalanır. Komut ayarı (instruction tuning) ise modelin doğal dil talimatlarını izlemesini öğretir. PEFT yöntemleri (LoRA, QLoRA) ise tüm ağırlıklar yerine küçük adaptör katmanları eğiterek bu uyarlama maliyetini büyük ölçüde düşürür. Pre-training sırasında kazanılan genel bilgi altyapısı korunarak bunun üzerine inşa edilir; bu nedenle pre-training kalitesi ve veri çeşitliliği nihai modelin performans tavanını doğrudan belirler.
Pre-training (Ön Eğitim) (Ön Eğitim)
Pre-training (Ön Eğitim), dil modelleri ve diğer derin öğrenme sistemlerinin belirli bir göreve yönlendirilmeden önce büyük ve çeşitli ham veri kümeleri üzerinde genel dil örüntülerini, bilgi yapılarını ve dünya modelini kazandığı ilk eğitim aşamasıdır. Modern yapay zekanın temel taşı olan bu süreç, foundation model paradigmasının merkezinde yer almaktadır. Pre-training'in çalışma mantığı modelin türüne göre farklılaşır. Otoregressif dil modellerinde (GPT ailesi) model, her adımda bir önceki tokenlere bakarak sonraki tokeni tahmin eder; bu görev dil modellemesi (causal language modeling) olarak adlandırılır. Maskelemeli dil modellerinde (BERT) ise giriş cümlesindeki rastgele tokenler gizlenerek model bu maskelenmiş tokenleri bağlamdan yeniden kazanmayı öğrenir. Her iki yaklaşım da öz-denetimli öğrenme prensibine dayandığından etiketsiz büyük veri kullanılabilir; metinlerin kendisi öğrenme sinyali oluşturur. Veri ölçeği açısından modern pre-training'in devasa boyutları dikkat çekicidir: GPT-3 yaklaşık 300 milyar token, LLaMA 3 ise 15 trilyon token üzerinde eğitilmiştir. Bu veri kümeleri İnternet metinleri (Common Crawl), kitaplar, akademik makaleler, kod depoları ve çok dilli içeriklerden derlenir. Eğitim bilgi işlem maliyeti de aynı ölçekte büyüktür; GPT-4 eğitiminin yüz milyon dolar civarında olduğu tahmin edilmektedir. Pre-training tamamlandıktan sonra model çeşitli yöntemlerle belirli görevlere uyarlanır. İnce ayar (fine-tuning) ile ilgili alan verisi üzerinde model özelleştirilir. RLHF (Reinforcement Learning from Human Feedback) ile insan tercihlerine hizalanır. Komut ayarı (instruction tuning) ise modelin doğal dil talimatlarını izlemesini öğretir. PEFT yöntemleri (LoRA, QLoRA) ise tüm ağırlıklar yerine küçük adaptör katmanları eğiterek bu uyarlama maliyetini büyük ölçüde düşürür. Pre-training sırasında kazanılan genel bilgi altyapısı korunarak bunun üzerine inşa edilir; bu nedenle pre-training kalitesi ve veri çeşitliliği nihai modelin performans tavanını doğrudan belirler.
RoPE (Dönel Konum Kodlama)
RoPE (Rotary Position Embedding — Dönel Konum Kodlama), transformer tabanlı dil modellerinde token konumlarını temsil etmek için 2021 yılında Jianlin Su ve ekibi tarafından önerilen özgün bir konum kodlama yöntemidir. Geleneksel mutlak konum gömme yaklaşımlarının (sinüs/kosinüs PE veya öğrenilmiş vektörler) yetersiz kaldığı bağlam uzunluğu genellenebilirliği sorununu zarif biçimde çözer. Temel fikir, her tokenın sorgu (query) ve anahtar (key) vektörlerini, o tokenın sekans içindeki konumuna bağlı bir açıyla karmaşık sayı uzayında döndürmektir. Böylece iki token arasındaki dikkat puanı (dot product), yalnızca konumlar arasındaki farka (m−n) bağlı hale gelir; modelin öğrenmesi gereken göreli konum bilgisi, dikkat hesaplamasına doğal olarak yerleşmiş olur. Matematiksel olarak d-boyutlu vektör, d/2 adet iki boyutlu alt uzaya ayrılır. Her alt uzay için farklı bir taban frekans θ_i = 10000^(−2i/d) kullanılır. Yüksek frekanslı boyutlar yakın komşuluk ilişkilerini, düşük frekanslı boyutlar uzun menzilli yapısal bağları kodlar. Bu çok ölçekli yapı, hem kısa sözcüksel hem de uzun sözdizimsel örüntüleri bir arada temsil eder ve dikkat mekanizmasına yönelik uzaklık yatırılabilirliği (distance invariance) özelliği kazandırır. RoPE'un pratik avantajları önemlidir: ekstra parametre gerektirmez; göreli konum farkındalığı sinüs PE'ye göre çok daha güçlüdür; bağlam uzunluğu genişletmesi (YaRN, NTK scaling, LongRoPE gibi yöntemler) ile eğitim penceresinin 4 ila 128 katına çıkılabilir. Flash Attention gibi bellek verimli kernel'larla tam uyumludur ve hesaplama maliyeti ihmal edilebilir düzeyde kalır. Meta'nın LLaMA serisi (1, 2, 3), Mistral, Gemma (Google DeepMind), Qwen (Alibaba), DeepSeek ve Falcon gibi modern açık kaynaklı dil modelleri RoPE'u standart konum kodlaması olarak benimsemiştir. Bu yaygın kullanımın arkasında RoPE'un matematiksel sağlamlığı, uygulanmasının kolaylığı ve bağlam uzatmada gösterdiği üstün esneklik yatar. Günümüzde RoPE, açık kaynak LLM ekosisteminin fiili standardı konumundadır.
Autoregressive Model (Otoregresif Model)
Otoregresif model (Autoregressive Model), bir dizideki her yeni öğeyi, o ana kadar üretilen öğelere koşullu olasılık dağılımlarına dayalı biçimde tahmin eden üretken bir model mimarisidir. "Auto" (öz) ve "regresif" (geçmiş değerlere dayalı tahmin) sözcüklerinin birleşiminden oluşur; model, kendi önceki çıktılarını girdi olarak kullanarak bir sonraki adımı belirler. GPT ve Claude gibi büyük dil modellerinin (LLM) temel üretim mekanizması otoregresiftir: model her defasında tek bir token üretir ve bu tokeni bağlamına ekleyerek sonraki tokeni tahmin eder. Bu işlem, bir durma koşulu ("<eos>" tokeni veya maksimum uzunluk) karşılanana kadar tekrarlanır. Matematiksel olarak, bir x dizisi için otoregresif model P(x) = ∏ P(xₜ | x₁, x₂, …, x_{t-1}) biçiminde çarpanlarına ayrışır; yani dizinin tam olasılığı, her bir öğenin tüm öncekiler verildiğindeki koşullu olasılıklarının çarpımıdır. Otoregresif modellerin eğitimi, "öğretmen zorlaması" (teacher forcing) tekniğiyle gerçekleştirilir: eğitim sırasında modelin kendi tahminleri yerine gerçek token dizisi koşul olarak verilir; bu sayede eğitim kararlı ve hızlı olur. Çıkarım (inference) sırasında ise model kendi ürettiklerini kullanmak zorundadır — bu iki aşama arasındaki fark, özellikle uzun dizilerde "açık döngü" hatasına yol açabilir. Mimari açıdan bakıldığında, Transformer'ın decoder-only versiyonları (GPT ailesi) en yaygın otoregresif LLM yapısıdır; encoder-decoder modeller (T5, BART) ise yalnızca dekoder kısmında otoregresif üretim yapar. Ses alanında WaveNet ve AudioLM, görüntü alanında ise PixelCNN ve iGPT otoregresif modellere örnek verilebilir. Ana sınırlama, her token'ın sırayla üretilmesi nedeniyle paralelleştirmenin mümkün olmamasıdır; bu durum uzun dizilerde çıkarım maliyetini artırır. Spekülatif kod çözme (speculative decoding), tahmin adımlarını paralele alarak bu sorunu kısmen çözer. Diffüzyon modelleri ve akış eşleştirme (flow matching) yöntemleri otoregresif olmayan alternatifler sunar; ancak metin üretiminde otoregresif yaklaşım 2026 itibarıyla hâlâ hâkim paradigma olmaya devam etmektedir.
Knowledge Editing (Bilgi Düzenleme)
Bilgi Düzenleme (Knowledge Editing), büyük dil modellerinin ağırlıklarında depolanan belirli olgusal bilgi parçalarını, modeli baştan eğitmeden ya da tam ince ayar yapmadan hedefli biçimde güncelleme, ekleme veya silme tekniklerinin genel adıdır. Literatürde model düzenleme (model editing) adıyla da anılır. Amaç, modelin örneğin 'Eyfel Kulesi Roma'dadır' gibi yanlış ya da güncelliğini yitirmiş bir ilişki üretmesi durumunda yalnızca bu ilişkiden sorumlu parametrelere müdahale ederek doğru yanıtı öğretmek ve modelin geri kalan davranışını olabildiğince korumaktır. Alan, 2022 yılında Meng ve arkadaşlarının ROME (Rank-One Model Editing) çalışmasıyla geniş ilgi gördü. ROME, nedensel izleme (causal tracing) adı verilen bir analizle olgusal ilişkilerin GPT tarzı modellerde ağırlıklı olarak orta katmanlardaki MLP bloklarında saklandığını gösterdi ve tek bir katmanın ağırlık matrisine rank-1 güncelleme uygulayarak bilgiyi değiştirdi. Aynı ekibin MEMIT (Mass-Editing Memory in a Transformer) yöntemi bu fikri birden fazla katmana yayarak binlerce olgunun tek seferde düzenlenmesine olanak verdi. Bunların yanında MEND gibi hiper-ağ tabanlı yaklaşımlar, SERAC ve GRACE gibi harici bellek kullanan yöntemler ve bağlam içi düzenleme (in-context editing) gibi ağırlıklara hiç dokunmayan seçenekler de geliştirildi. Bilgi düzenleme, iki yaygın alternatifle karşılaştırılarak daha iyi anlaşılır. RAG bilgiyi harici bir kaynaktan çağırır ve modeli değiştirmez; tam ince ayar ise tüm parametreleri günceller, pahalıdır ve yıkıcı unutma (catastrophic forgetting) riski taşır. Bilgi düzenleme bu ikisinin arasında yer alır: değişiklik kalıcıdır ancak müdahale küçük ve yereldir. Yöntemler genellikle üç ölçütle değerlendirilir: güvenilirlik (düzenlenen olgu doğru üretiliyor mu), genelleme (aynı olgunun farklı ifadeleri de doğru yanıtlanıyor mu) ve yerellik (ilgisiz sorulardaki davranış bozulmuyor mu). CounterFact, ZsRE ve çok adımlı çıkarımı ölçen MQuAKE bu amaçla kullanılan başlıca kıyaslama kümeleridir. Pratik kullanım alanları arasında güncelliğini yitirmiş bilgilerin yenilenmesi, yanlış bilgilerin düzeltilmesi ve KVKK ya da GDPR kapsamındaki silme taleplerine yanıt verilmesi sayılır. Alan hâlâ olgunlaşmaktadır; çok sayıda ardışık düzenleme, çok adımlı çıkarım ve bir düzenlemenin dolaylı sonuçlarının (ripple effects) modele tutarlı biçimde yansıtılması açık araştırma sorunları olmaya devam etmektedir.
Noise Contrastive Estimation (Gürültü Karşıtlıklı Kestirim)
Noise Contrastive Estimation (NCE), Türkçesiyle gürültü karşıtlıklı kestirim, normalizasyon sabitinin hesaplanması pratik olmayan olasılık modellerinin parametrelerini öğrenmek için geliştirilmiş istatistiksel bir kestirim ilkesidir. Michael Gutmann ve Aapo Hyvärinen tarafından 2010 yılında AISTATS konferansında önerilen yöntem, zor bir yoğunluk kestirimi problemini basit bir ikili sınıflandırma görevine çevirir: model, gerçek veri dağılımından gelen örneklerle bilinen bir gürültü dağılımından çekilen yapay örnekleri birbirinden ayırt etmeyi öğrenir. Bu ayrımı iyi yapan bir model, dolaylı olarak gerçek veri dağılımının şeklini de öğrenmiş olur. Yöntemin çözdüğü temel sorun, normalize edilmemiş modellerde ortaya çıkan bölüşüm fonksiyonu (partition function) hesabıdır. Maksimum olabilirlik kestirimi, her parametre güncellemesinde tüm olası çıktılar üzerinden toplam almayı gerektirir. Kelime dağarcığı yüz binlerce token içeren bir dil modelinde softmax katmanının her adımda tüm dağarcık üzerinden hesaplanması, eğitim süresinin büyük bölümünü tek başına tüketir. NCE bu toplamı hiç hesaplamaz; normalizasyon sabitini ya öğrenilebilir bir parametre olarak modele ekler ya da Mnih ve Teh'in 2012'de gösterdiği gibi pratikte 1'e sabitler. Her gerçek örnek için k adet gürültü örneği çekildiğinden, adım başına maliyet dağarcık boyutundan bağımsız hale gelir ve yalnızca k ile orantılı kalır. NCE'nin teorik cazibesi tutarlılığından gelir: gürültü örneği sayısı k arttıkça kestirici maksimum olabilirlik çözümüne yaklaşır. Bu özellik, yöntemi enerji tabanlı modellerin ve yoğunluk kestiriminin eğitimi için de çekici kılar. Uygulama tarafında ise NCE, 2013'te Mikolov ve ekibinin Word2Vec için tasarladığı Negative Sampling yaklaşımının doğrudan öncülüdür. Negative Sampling, NCE'deki gürültü dağılımı terimini atarak daha basit bir amaç fonksiyonu kullanır; olasılık kestirimi için tutarlı olmasa da kaliteli kelime gömmeleri üretir. 2018'de van den Oord ve arkadaşlarının Contrastive Predictive Coding çalışmasıyla tanıttığı InfoNCE kaybı, aynı ilkeyi temsil öğrenimine taşıdı. Pozitif çifti k negatif arasından seçmeye dayanan bu kayıp, SimCLR, MoCo ve CLIP gibi öz-denetimli modellerin ve modern gömme modellerinin eğitiminde standart hale geldi. Günümüz büyük dil modelleri çıkış katmanında tam softmax kullansa da NCE ailesi, geri getirim, öneri sistemleri ve çok modlu öğrenme alanlarında yaygın biçimde kullanılmaya devam ediyor.
Prompt (Prompt)
Prompt, bir yapay zeka dil modeline verilen yazılı talimat, soru veya girdi metninin genel adıdır. Türkçede "promt" şeklinde de yazılan bu terim, kullanıcının bir YZ sisteminden belirli bir yanıt veya çıktı alabilmek için sisteme ilettiği her türlü mesajı kapsar. Bir prompt; soru, komut, bağlam bilgisi, örnekler ve kısıtlamalar gibi unsurlar içerebilir. Yapay zeka sistemleri, girdinin kalitesine ve açıklığına göre farklı kalitede yanıtlar üretir. Bu nedenle etkili bir prompt yazmak, istenilen sonuca ulaşmak için kritik bir beceri hâline gelmiştir. Buna "prompt mühendisliği" (prompt engineering) denir. Promptlar üç temel kategoriye ayrılır: (1) Sıfır atışlı promptlar (zero-shot): Herhangi bir örnek verilmeden doğrudan soru ya da talimat içerir. (2) Az atışlı promptlar (few-shot): Modele istenen çıktı biçimini göstermek için birkaç örnek sunar. (3) Sistem promptları (system prompt): Modelin genel davranışını, tonunu ve kısıtlamalarını belirleyen arka plan talimatlarıdır. ChatGPT, Claude, Gemini gibi büyük dil modellerinde kullanıcının yazdığı her mesaj bir prompttur. Modelin sisteme gönderilen gizli talimatlar bütünü ise "sistem promptu" olarak adlandırılır. Prompt uzunluğu ve içeriği, modelin bağlam penceresini (context window) doğrudan etkiler. Prompt tasarımı; sadelik, netlik ve bağlam sağlama ilkelerine dayanır. "Bana bir makale yaz" yerine "Yapay zeka etiği üzerine, B2 düzeyinde ve 500 kelimelik bir tanıtım makalesi yaz" gibi spesifik bir prompt çok daha iyi sonuçlar üretir. Türkiye'de artan YZ kullanımıyla birlikte "prompt ne demek" ve "promt nedir" aramaları da hızla artmıştır. Etkili bir prompt genellikle şu bileşenleri içerir: görev tanımı (ne yapılacağı), bağlam (arka plan bilgisi), biçim kısıtlaması (uzunluk, dil, ton) ve varsa örnekler. Özellikle karmaşık görevlerde "chain-of-thought prompting" tekniğiyle modelden adım adım düşünmesi istenerek daha tutarlı ve doğru yanıtlar elde edilebilir. 2025 ve sonrasında yapay zeka ajanları ve çok adımlı akış mimarilerinde prompt tasarımı daha da kritik bir hâl almaktadır. ReAct, Chain-of-Thought ve Tree-of-Thoughts gibi gelişmiş teknikler, tek bir promptun ötesinde modeli adım adım düşünmeye ve araçlarla etkileşime girmeye yönlendirir.
Question Answering (Soru Cevaplama)
Question Answering (Soru Cevaplama ya da kısaca QA), doğal dil işlemenin (NLP) temel görevlerinden biridir; doğal dil ile yöneltilen sorulara metin pasajlarından, belge koleksiyonlarından veya yapılandırılmış bilgi tabanlarından otomatik yanıt üretmeyi amaçlar. QA sistemleri işleyiş biçimine göre beş ana kategoride incelenir. Extractive QA (Çıkarımsal Soru Cevaplama), verilen bir metin pasajından sorunun yanıtını birebir çıkarır; cevap daima kaynak metindeki bir sözcük dizisidir. SQuAD (Stanford Question Answering Dataset), bu yaklaşım için standart kıyaslama veri setidir. BERT ve RoBERTa gibi önceden eğitilmiş transformer modelleri, extractive QA görevlerinde neredeyse insan düzeyine ulaşmıştır. Abstractive QA (Soyutlayıcı Soru Cevaplama) ise cevabı metinden doğrudan almak yerine yeni cümlelerle yeniden ifade eder; GPT-4 ve Claude gibi büyük dil modelleri (LLM) bu yaklaşımı kullanır. Open-domain QA, belirli bir belgeyle sınırlı kalmaksızın Wikipedia gibi geniş bilgi tabanlarında arama yaparak yanıt üretir; RAG (Retrieval-Augmented Generation) bu kategorinin güncel mimarisidir. Closed-domain QA, tıp veya hukuk gibi belirli bir alana ait sorulara odaklanır. Knowledge-based QA ise Wikidata gibi yapılandırılmış bilgi grafiklerini (knowledge graph) sorgulayarak yanıt verir. Mimari açıdan çoğu modern QA sistemi iki bileşenden oluşur: belgelerden ilgili pasajları seçen Retriever (Erişici) ve bu pasajları işleyerek yanıt üreten Reader (Okuyucu). Retriever bileşeni BM25 gibi anahtar kelime eşleşmesi ya da dense vector search (yoğun vektör araması) yöntemlerini kullanır; Reader ise fine-tuned transformer modelleri üzerine kuruludur. Bu iki bileşeni uçtan uca birleştiren RAG mimarisi, hem bilgiye erişimi hem de dil üretimini tek bir çerçevede sunar ve 2020 sonrasında açık-domain QA'nin fiili standardı haline gelmiştir. QA sistemlerinin başarısı genellikle EM (Exact Match) ve F1 skoru ile ölçülür. Gerçek hayatta bu teknoloji; sesli asistanlarda (Alexa, Siri), müşteri destek chatbotlarında, arama motorlarının öne çıkan snippet özelliğinde ve kurumsal bilgi yönetim platformlarında yaygın biçimde kullanılmaktadır.
Self-Attention (Öz-Dikkat)
Öz-dikkat (self-attention), bir dizideki her tokenin aynı dizinin diğer tüm tokenleriyle ilişkisini hesaplayarak her konuma bağlam bilgisi kazandıran dikkat mekanizmasının özel bir biçimidir. Klasik dikkat mekanizmasında kaynak ve hedef diziler farklıydı; örneğin makine çevirisinde giriş cümlesi ile çıkış cümlesi ayrı dizilerdi. Öz-dikkatte ise sorgu (Q), anahtar (K) ve değer (V) vektörlerinin üçü de aynı girişten türetilir. 2017 yılında "Attention Is All You Need" makalesiyle tanıtılan transformer mimarisinin temel yapı taşı olan öz-dikkat, RNN ya da CNN katmanlarına gerek kalmadan uzun mesafeli bağımlılıkları paralel hesaplamayla öğrenir. Hesaplama üç adımda ilerler. Önce giriş gömmeleri üç ayrı projeksiyon matrisiyle Q, K ve V uzaylarına dönüştürülür. Ardından her konumun sorgu vektörü tüm anahtar vektörleriyle nokta çarpımına girer, sonuç sqrt(d_k) ile ölçeklenir ve softmax uygulanarak dikkat ağırlıkları elde edilir. Son olarak bu ağırlıklar değer vektörleri üzerinde ağırlıklı toplam alınarak her token için yeni bir bağlamsal temsil üretir. "Banka kıyısında oturdu" cümlesindeki "banka" tokeni, "kıyı" tokenine yüksek ağırlık vererek finans kurumu değil nehir kenarı anlamını kodlar. Matematiksel olarak n uzunluğundaki bir dizi için öz-dikkat O(n^2 · d) hesaplama ve bellek maliyeti gerektirir; bu nedenle çok uzun dizilerde düşük ranklı yaklaşımlar (Linformer), yerel pencere dikkati (Longformer, Sliding Window Attention) ve FlashAttention gibi IO-farkında verimlilik teknikleri geliştirilmiştir. Maskeli öz-dikkat (masked self-attention), GPT ve Llama gibi otoregresif dil modellerinde kullanılır: her konum yalnızca önceki konumlara bakabilir, gelecekteki tokenlere erişim üst üçgen maskeyle kapatılır. BERT gibi çift yönlü kodlayıcılarda ise tam öz-dikkat uygulanır; her token hem öncesindeki hem sonrasındaki tokenleri görür ve sınıflandırma görevleri için güçlü bir bağlam temsili oluşur. Uygulamada öz-dikkat tek başına değil, çok başlı dikkat (multi-head attention) biçiminde birden fazla paralel başla çalıştırılır; her baş sözdizimi, eş gönderim ya da konum yakınlığı gibi farklı ilişki türlerini yakalar. Vision Transformer görüntü yamalarını, AlphaFold2 ise protein kalıntılarını token olarak işleyerek aynı mekanizmayı dil dışına taşımıştır.
Top-P (Nucleus Sampling) (Top-P Örneklemesi)
Top-P, ya da çekirdek örneklemesi (nucleus sampling), büyük dil modellerinin bir sonraki tokenı seçerken kullandığı olasılık temelli filtreleme yöntemidir. Standart örneklemede model, sözlükteki her tokena bir olasılık atar ve bu dağılımdan rastgele çeker; bu durum düşük olasılıklı tokenların da zaman zaman seçilmesine yol açabilir. Top-P bu sorunu gidermek için en olası tokenları büyükten küçüğe sıralar, olasılıkları soldan toplamaya başlar ve toplam P eşiğini aştığı anda listeyi keser. Kalan her token o adımda tamamen elenir ve seçim yalnızca bu çekirdek (nucleus) kümesinden yapılır. Yöntemin en önemli özelliği dinamizmidir. Sabit sayıda aday kullanan Top-K'nın aksine, Top-P'nin aday sayısı her adımda değişir: model bir sonraki tokendan eminden olduğunda (tek bir tokena 0,95 olasılık verdiğinde) liste neredeyse tek elemana iner; model kararsız kaldığında olasılıklar yayılır ve çekirdek onlarca adayı içerebilir. Aday havuzunun genişliği doğrudan modelin kendi güvenini yansıtır. Yöntem, Holtzman ve arkadaşlarının 2019 tarihli 'The Curious Case of Neural Text Degeneration' çalışmasıyla yaygınlaştı. Araştırmacılar, standart örneklemenin uzun metinlerde tekrarlı ve anlamsız diziler ürettiğini gösterdi; çekirdek örneklemesi bu kalıpları belirgin şekilde azalttı. O günden bu yana OpenAI, Anthropic, Cohere ve yerel çalıştırma araçlarının tamamı (Ollama, vLLM, Hugging Face) parametreyi destekler hale geldi. Pratik ayar rehberi: top_p=0,1–0,3 araç çağırma, sınıflandırma ve yapılandırılmış çıktı üretimi gibi kesin cevap gerektiren işler için uygundur; çekirdek daraltılarak hata olasılığı düşürülür. top_p=0,9–1,0 yaratıcı yazı, reklam metni ve beyin fırtınasında kelime çeşitliliğini artırır. Kod üretimi için 0,5–0,8 dengeli bir başlangıç noktasıdır. Temperature ile aynı anda değiştirmek iki boyutu birden etkiler ve davranışı öngörülemez hale getirir; genel öneri yalnızca birini ayarlayıp diğerini varsayılan değerde bırakmaktır. top_p=0 yazmak çoğu kütüphanede tek en olası tokenu seçer ama bu davranış her ortamda garanti edilmez; deterministik çıktı için temperature=0 tercih edilmeli, gerekirse seed de sabitlenmelidir.
Transformer-XL (Transformer-XL (Uzun Bağlamlı Dönüştürücü Mimarisi))
Transformer-XL, Zihang Dai ve ekibinin 2019 yılında Google Brain ile Carnegie Mellon Üniversitesi iş birliğiyle geliştirdiği, uzun bağlamı modelleme sorununu çözmek amacıyla önerilen bir dil modeli mimarisidir. Standart Transformer modelleri metin işlerken sabit uzunluktaki bölütleri birbirinden bağımsız olarak ele alır; bu durum cümle sınırlarını aşan bağlam bağımlılıklarının yakalanamamasına ve bölüt kenarlarında anlam kırılmasına yol açar. Transformer-XL bu sorunu iki temel yenilikle aşar: bölüt özyinelemesi ve göreli konum kodlaması. Bölüt özyinelemesi mekanizmasında her katmanın gizli durum tensörleri önbelleğe alınır ve bir sonraki bölüt işlenirken dikkat mekanizmasına ek bağlam olarak sunulur; bu yapı modelin erişebildiği bağlam uzunluğunu teorik olarak sonsuz kılabilir ve uzun mesafeli bağımlılıkların yakalanmasını mümkün kılar. Göreli konum kodlaması ise mutlak konum gömülerinin farklı bölüt uzunluklarında anlam kaybına yol açma sorununu giderir; dikkat mekanizması token çiftleri arasındaki göreli mesafeyi doğrudan hesapladığından model farklı bölüt konfigürasyonlarına kolayca genellenebilir hâle gelir. WikiText-103 ve enwiki8 standart kıyaslamalarında Transformer-XL yayımlandığı dönemde yeni başarım kayıtları kırmıştır. Eğitim aşamasında bölüt özyinelemesi devre dışı bırakılabilir; çıkarım aşamasında ise önbellekte tutulan gizli durumlar çok daha uzun metinlerin verimli biçimde işlenmesini kolaylaştırır. Hesaplama maliyeti açısından değerlendirildiğinde özyineleme uzunluğunun artmasıyla bellek kullanımı doğrusal olarak artar; bu denge üretim sistemleri için dikkate alınması gereken önemli bir tasarım kararıdır. Transformer-XL mimarisinin kalıcı etkisi ardından gelen büyük dil modellerine kattığı kavramsal zemindir. XLNet, permütasyon tabanlı dil modellemesiyle Transformer-XL üzerine inşa edilmiş ve BERT tarzı çift yönlü eğitimi oto-regresif modellemeyle birleştirmiştir. T5, GPT serisi ve günümüzün uzun bağlam modellerindeki pek çok tasarım kararı bu mimarinin deneyimlerinden beslenmiştir. Transformer-XL aynı zamanda artımlı çıkarım araştırmalarını da yönlendirmiş; literatürde iki binden fazla atıf alarak modern NLP tarihine geçmiştir.