GPT Mimarisi: Decoder-Only Transformer
GPT, Transformer'ın yalnızca decoder bloğunu kullanır. Encoder-decoder mimarisinden (örn. T5) farklı olarak GPT, giriş dizisini soldan sağa işler ve her adımda yalnızca önceki tokenlara dikkat eder (causal masking / nedensel maskeleme). Bu tasarım otoregresif metin üretimine uygundur: Model, ürettiği her yeni tokeni bir sonraki adımın girdisi olarak kullanır. Modelin kalbi, çok başlı öz dikkat (multi-head self-attention) mekanizmasıdır; bu mekanizma uzun bağlamlardaki ilişkileri yakalar. GPT-4 gibi yeni nesil modellerde bağlam penceresi 128.000 tokena kadar çıkmaktadır.
GPT Serisinin Evrimi
- check_circle GPT-1 (2018): 117M parametre; denetimsiz ön eğitim + ince ayar paradigmasını yerleştirdi.
- check_circle GPT-2 (2019): 1,5B parametre; sıfır örnekli (zero-shot) metin üretimini gündeme taşıdı.
- check_circle GPT-3 (2020): 175B parametre; az örnekli öğrenme ile ince ayarsız görev genellemesi.
- check_circle GPT-3.5 / ChatGPT (2022): RLHF ile hizalanmış, milyonlarca kullanıcıya ulaşan ilk tüketici ürünü.
- check_circle GPT-4 / GPT-4o (2023-2024): Çok modlu girdi, gelişmiş akıl yürütme ve 128K token bağlam desteği.
RLHF ile İnsan Hizalaması
Ham dil modellerini güvenli ve yararlı asistanlara dönüştürmek için RLHF kullanılır. Süreç üç adımdan oluşur: (1) Denetimli ince ayar — insan yazarların yazdığı örnek yanıtlarla model güncellenir. (2) Ödül modeli eğitimi — insan değerlendirici tercihleri kullanılarak bir ödül modeli öğretilir. (3) PPO optimizasyonu — dil modeli ödül modelinden gelen sinyalle politika gradyanı yöntemiyle optimize edilir. Bu hizalama süreci modelin zararlı, yanıltıcı veya anlamsız içerik üretme eğilimini önemli ölçüde azaltır.
GPT Sürümleri Zaman Çizelgesi
GPT-1 (2018)
117M parametre; Wikipedia + BookCorpus; dil modeli öncesi ince ayar yaklaşımı; proof of concept
GPT-2 (2019)
1.5B parametre; WebText; sıfır-atış performansı şaşırttı; güvenlik nedeniyle aşamalı yayın
GPT-3 (2020)
175B parametre; few-shot ICL; in-context learning kavramını tanımladı; 45TB web verisi
GPT-4 / 4o (2023-24)
Multimodal; RLHF+RLAIF; güvenlik odaklı; gerçek zamanlı ses ve görsel; API ve ChatGPT Plus
GPT'nin Yapay Zeka Dünyasına Etkileri
- check_circle ChatGPT Etkisi: Aralık 2022'de ChatGPT, 5 günde 1 milyon kullanıcıya ulaşarak internet tarihinin en hızlı büyüyen tüketici uygulaması oldu
- check_circle Kod Asistanları: GitHub Copilot, GPT tabanlı ilk büyük kod tamamlama ürünü; yazılım geliştirme iş akışını dönüştürdü
- check_circle API Ekosistemi: OpenAI API, GPT modellerini binlerce uygulamaya entegre etti; prompt engineering bir meslek haline geldi
- check_circle Yarış Tetikleyicisi: Google Bard/Gemini, Anthropic Claude, Meta Llama serilerini başlatan rekabet GPT-3/4'ün başarısıyla hızlandı
- check_circle Regülasyon Baskısı: EU AI Act, ABD yürütme kararnamesi ve küresel AI güvenliği tartışmaları GPT-4 sonrası yoğunlaştı
Sık Sorulan Sorular
- check_circle GPT ile ChatGPT arasındaki fark nedir? GPT, OpenAI'nin üretici dil modeli ailesidir. ChatGPT ise bu modelin RLHF ile hizalanmış ve sohbet arayüzüne sahip tüketici ürünüdür.
- check_circle GPT kaç parametreye sahiptir? GPT-1: 117M, GPT-2: 1,5B, GPT-3: 175B; GPT-4 için OpenAI resmi bir parametre sayısı açıklamamıştır.
- check_circle GPT hangi programlama dillerinde kod üretebilir? Python, JavaScript, TypeScript, Go, Rust, C++, SQL dahil onlarca dilde kod üretebilir; doğruluk düzeyi dil ve görev karmaşıklığına göre değişir.
- check_circle GPT'yi kendi verilerimle özelleştirebilir miyim? Evet. Fine-tuning API'si ile kendi veri kümenizde modeli ince ayarlayabilir ya da RAG mimarisiyle kendi belgelerinizi modele bağlayabilirsiniz.