Generative Pre-trained Transformer (Üretken Ön-eğitimli Dönüştürücü)

OpenAI'ın decoder-only Transformer tabanlı büyük dil modeli serisi; RLHF ile hizalanmış ChatGPT'nin temeli.

GPT (Generative Pre-trained Transformer), OpenAI tarafından geliştirilen ve Transformer mimarisinin yalnızca decoder (kod çözücü) bloğunu kullanan büyük dil modeli ailesidir. Adındaki üç sözcük mimariyi tam olarak tanımlar: "Generative" (üretici), modelin yeni metin ürettiğini; "Pre-trained" (önceden eğitilmiş), devasa bir metin korpusu üzerinde denetimsiz öğrenimle hazırlandığını; "Transformer", kullanılan sinir ağı mimarisini ifade eder. GPT modelleri, bir sonraki kelimeyi tahmin etme (next-token prediction) görevi üzerinden eğitilir. Model, milyarlarca metin örneğini gördükten sonra dil bilgisi, mantık yürütme, kod yazma ve yaratıcı üretim gibi yetenekleri örtük biçimde edinir; bu sürece "emergent capability" (beliren yetenek) denir. GPT serisi 2018'de GPT-1 ile başlamıştır: 117 milyon parametreli bu model, dil modellemesinde büyük bir sıçrama olmakla birlikte dönemin BERT modeliyle kıyaslandığında sınırlı kaldı. 2019'da yayımlanan GPT-2 (1,5 milyar parametre), o kadar güçlü bir metin üretimi sergiledi ki OpenAI modeli başlangıçta tam sürümüyle kamuya açmaktan kaçındı. GPT-3 (2020, 175 milyar parametre) az örnekli öğrenme (few-shot learning) alanında çığır açtı: Model, yalnızca birkaç örnek gördükten sonra görev genellemesi yapabiliyor, ince ayar (fine-tuning) gerekmiyordu. GPT-3.5 ve ardından 2023'te duyurulan GPT-4, çok modlu (multimodal) girişi ve güçlendirilmiş mantık yeteneklerini bünyesine kattı. GPT-4o ise metin, ses ve görüntüyü tek bir modelde birleştirerek gerçek zamanlı çok modlu diyaloğu mümkün kıldı. GPT modellerinin eğitimi iki ana aşamadan oluşur. İlk aşamada denetimsiz ön eğitim (unsupervised pre-training) ile model internet metinleri, kitaplar ve kod içeren geniş bir veri kümesi üzerinde eğitilir. İkinci aşamada ise RLHF (Reinforcement Learning from Human Feedback — İnsan Geri Bildiriminden Pekiştirmeli Öğrenme) kullanılarak model insan tercihlerine hizalanır; bu süreç güvenli, yararlı ve dürüst yanıtlar üretmeyi hedefler. GPT'nin temel gücü, bağlamsal dil anlama ve üretmedeki esnekliğidir. Farklı sektörlerde müşteri hizmetleri, kod tamamlama, tıbbi yazışma özeti, hukuki belge analizi ve eğitim içeriği üretimi gibi kullanım alanları mevcuttur. ChatGPT, GPT modellerinin bir chat arayüzüyle sunulan versiyonudur ve GPT'nin kendisi ile aynı şey değildir; ChatGPT bir ürün, GPT ise altta yatan model ailesidir.

GPT Mimarisi: Decoder-Only Transformer

GPT, Transformer'ın yalnızca decoder bloğunu kullanır. Encoder-decoder mimarisinden (örn. T5) farklı olarak GPT, giriş dizisini soldan sağa işler ve her adımda yalnızca önceki tokenlara dikkat eder (causal masking / nedensel maskeleme). Bu tasarım otoregresif metin üretimine uygundur: Model, ürettiği her yeni tokeni bir sonraki adımın girdisi olarak kullanır. Modelin kalbi, çok başlı öz dikkat (multi-head self-attention) mekanizmasıdır; bu mekanizma uzun bağlamlardaki ilişkileri yakalar. GPT-4 gibi yeni nesil modellerde bağlam penceresi 128.000 tokena kadar çıkmaktadır.

GPT Serisinin Evrimi

  • check_circle GPT-1 (2018): 117M parametre; denetimsiz ön eğitim + ince ayar paradigmasını yerleştirdi.
  • check_circle GPT-2 (2019): 1,5B parametre; sıfır örnekli (zero-shot) metin üretimini gündeme taşıdı.
  • check_circle GPT-3 (2020): 175B parametre; az örnekli öğrenme ile ince ayarsız görev genellemesi.
  • check_circle GPT-3.5 / ChatGPT (2022): RLHF ile hizalanmış, milyonlarca kullanıcıya ulaşan ilk tüketici ürünü.
  • check_circle GPT-4 / GPT-4o (2023-2024): Çok modlu girdi, gelişmiş akıl yürütme ve 128K token bağlam desteği.

RLHF ile İnsan Hizalaması

Ham dil modellerini güvenli ve yararlı asistanlara dönüştürmek için RLHF kullanılır. Süreç üç adımdan oluşur: (1) Denetimli ince ayar — insan yazarların yazdığı örnek yanıtlarla model güncellenir. (2) Ödül modeli eğitimi — insan değerlendirici tercihleri kullanılarak bir ödül modeli öğretilir. (3) PPO optimizasyonu — dil modeli ödül modelinden gelen sinyalle politika gradyanı yöntemiyle optimize edilir. Bu hizalama süreci modelin zararlı, yanıltıcı veya anlamsız içerik üretme eğilimini önemli ölçüde azaltır.

GPT Sürümleri Zaman Çizelgesi

GPT-1 (2018)

117M parametre; Wikipedia + BookCorpus; dil modeli öncesi ince ayar yaklaşımı; proof of concept

GPT-2 (2019)

1.5B parametre; WebText; sıfır-atış performansı şaşırttı; güvenlik nedeniyle aşamalı yayın

GPT-3 (2020)

175B parametre; few-shot ICL; in-context learning kavramını tanımladı; 45TB web verisi

GPT-4 / 4o (2023-24)

Multimodal; RLHF+RLAIF; güvenlik odaklı; gerçek zamanlı ses ve görsel; API ve ChatGPT Plus

GPT'nin Yapay Zeka Dünyasına Etkileri

  • check_circle ChatGPT Etkisi: Aralık 2022'de ChatGPT, 5 günde 1 milyon kullanıcıya ulaşarak internet tarihinin en hızlı büyüyen tüketici uygulaması oldu
  • check_circle Kod Asistanları: GitHub Copilot, GPT tabanlı ilk büyük kod tamamlama ürünü; yazılım geliştirme iş akışını dönüştürdü
  • check_circle API Ekosistemi: OpenAI API, GPT modellerini binlerce uygulamaya entegre etti; prompt engineering bir meslek haline geldi
  • check_circle Yarış Tetikleyicisi: Google Bard/Gemini, Anthropic Claude, Meta Llama serilerini başlatan rekabet GPT-3/4'ün başarısıyla hızlandı
  • check_circle Regülasyon Baskısı: EU AI Act, ABD yürütme kararnamesi ve küresel AI güvenliği tartışmaları GPT-4 sonrası yoğunlaştı

Sık Sorulan Sorular

  • check_circle GPT ile ChatGPT arasındaki fark nedir? GPT, OpenAI'nin üretici dil modeli ailesidir. ChatGPT ise bu modelin RLHF ile hizalanmış ve sohbet arayüzüne sahip tüketici ürünüdür.
  • check_circle GPT kaç parametreye sahiptir? GPT-1: 117M, GPT-2: 1,5B, GPT-3: 175B; GPT-4 için OpenAI resmi bir parametre sayısı açıklamamıştır.
  • check_circle GPT hangi programlama dillerinde kod üretebilir? Python, JavaScript, TypeScript, Go, Rust, C++, SQL dahil onlarca dilde kod üretebilir; doğruluk düzeyi dil ve görev karmaşıklığına göre değişir.
  • check_circle GPT'yi kendi verilerimle özelleştirebilir miyim? Evet. Fine-tuning API'si ile kendi veri kümenizde modeli ince ayarlayabilir ya da RAG mimarisiyle kendi belgelerinizi modele bağlayabilirsiniz.