Foundation Model (Temel Model)

Foundation model, dev veri kümeleriyle öz denetimli eğitilen ve binlerce farklı göreve uyarlanabilen genel amaçlı yapay zeka modelidir.

Foundation model (temel model), trilyonlarca token metin, görüntü, ses ve kod verisi üzerinde öz denetimli öğrenme (self-supervised learning) ile önceden eğitilen ve prompt mühendisliği, ince ayar (fine-tuning) veya RAG ile çok sayıda farklı göreve uyarlanabilen büyük ölçekli yapay zeka modelidir. Terimi 2021'de Stanford HAI (Institute for Human-Centered AI) ortaya attı; bugün GPT-5, Claude Opus 4.5, Gemini 3, Llama 4 ve DeepSeek-R1 gibi modeller bu kategorinin güncel örnekleridir. Foundation model yaklaşımından önce her görev için ayrı model eğitilirdi: çeviri için ayrı, duygu analizi için ayrı, görüntü sınıflandırma için ayrı. Temel model bu parçalı yapıyı tersine çevirdi. Tek bir model, devasa ve çeşitli veriyle bir kez eğitilir; ardından tıp, hukuk, yazılım geliştirme veya müşteri hizmetleri gibi alanlara birkaç örnekle (few-shot) ya da küçük bir ek eğitimle uyarlanır. "Bir kez eğit, binlerce göreve uyarla" ilkesi, modern üretken yapay zekanın ekonomik temelini oluşturur. Ölçek bu tanımın merkezindedir. Güncel sınır modelleri yüz milyarlarca ile trilyonlarca parametre taşır; eğitim maliyeti tek model için 100 milyon doları aşabilir (Epoch AI, Gemini Ultra eğitimini ~190M USD hesaplama maliyetiyle tahmin eder). Ölçek büyüdükçe çok adımlı akıl yürütme, kod üretimi ve az örnekle öğrenme gibi "emergent" yetenekler gözlenir — kimi araştırmacılar bunun ölçüm metriğine bağlı bir görünüm olduğunu savunsa da pratik etkisi tartışmasızdır. Kavram LLM ile eş anlamlı değildir: her büyük dil modeli bir foundation model'dir, ancak CLIP (görüntü-metin), Whisper (ses), AlphaFold 3 (protein yapısı) ve SAM 2 (görüntü segmentasyonu) gibi dil dışı temel modeller de vardır. 2026 itibarıyla sınır, metin-görüntü-ses-videoyu tek modelde işleyen natively multimodal mimarilere kaydı; Gemini 3 ve GPT-5 bu sınıfın örnekleridir. Düzenleyici çerçeve de bu kavram üzerine kuruludur: AB Yapay Zeka Yasası, foundation model'leri "genel amaçlı yapay zeka modeli" (GPAI) olarak tanımlar ve Ağustos 2025'ten itibaren eğitim verisi özeti, telif uyumu ve 10^25 FLOP üzeri modeller için sistemik risk yükümlülükleri getirir. Kurumsal tarafta seçim genellikle kapalı API (GPT-5, Claude, Gemini) ile kendi sunucunda çalıştırılabilen açık ağırlıklı model (Llama 4, Qwen3, Mistral, DeepSeek) arasında maliyet, gizlilik ve KVKK/GDPR uyumu ekseninde yapılır.

Foundation Model Neden Paradigma Değiştirdi?

2020 öncesi yapay zeka "dar model" çağıydı: her görev için ayrı veri seti toplanır, ayrı model eğitilir, ayrı ekip bakım yapardı. Foundation model bu maliyeti tek seferlik dev bir ön eğitime taşıdı. GPT-3'ün 2020'de few-shot öğrenmeyi göstermesi, ardından 2022'de ChatGPT'nin instruction tuning + RLHF ile kullanılabilir hale gelmesi dönüm noktalarıydı. Bugün bir şirket sıfırdan model eğitmek yerine hazır bir temel modeli API üzerinden çağırıyor ya da açık ağırlıklı bir modeli kendi verisiyle uyarlıyor. Ekonomik sonuç çarpıcı: sıfırdan sınır model eğitimi 100M+ USD gerektirirken, LoRA ile 8B parametrelik bir modeli özel göreve uyarlamak bulutta 20-200 USD bandında tamamlanabiliyor. Bu asimetri, yapay zeka ekosistemini az sayıda model üreticisi ile milyonlarca uygulama geliştiricisinden oluşan iki katmanlı bir yapıya dönüştürdü.

Uyarlama Yöntemleri: Modeli Göreve Bağlamak

edit-note Prompt Engineering

Model ağırlıklarına dokunmadan, girdi metnini tasarlayarak görev yönlendirme. Zero-shot ve few-shot ile dakikalar içinde sonuç; en hızlı ve en ucuz yöntem.

model-training Fine-Tuning / PEFT

Ek veriyle ağırlık güncelleme. LoRA ve QLoRA gibi PEFT teknikleri parametrelerin %1'inden azını eğiterek maliyeti onlarca kat düşürür.

search-database RAG

Modeli değiştirmeden dış bilgi tabanından anlık belge çekme. Güncellik ve kaynak gösterme gerektiren kurumsal uygulamaların standart deseni.

compress Distilasyon

Büyük öğretmen modelin çıktılarıyla küçük öğrenci model eğitme. DeepSeek-R1'in distile 7B-70B sürümleri bu yaklaşımın 2025'teki en bilinen örneği.

Temel Modelin Ayırt Edici Özellikleri

  • check_circle Büyük ölçekli öz denetimli ön eğitim: Etiketsiz trilyonlarca token üzerinde "sonraki token'ı tahmin et" gibi hedeflerle eğitim. Llama 3 için 15T, Llama 4 için 30T+ token kullanıldı; veri çeşitliliği genelleme yeteneğinin ana kaynağıdır.
  • check_circle Görevden bağımsız genel temsiller: Model belirli bir görev için değil, dil ve dünya bilgisinin sıkıştırılmış temsili için eğitilir; bu yüzden çeviriden kod yazmaya yüzlerce göreve tek gövdeyle uyum gösterir.
  • check_circle Emergent yetenekler: Çok adımlı aritmetik, zincirleme akıl yürütme (chain-of-thought) ve araç kullanımı gibi beceriler belirli ölçek eşiklerinde belirginleşir; 2024 sonrası "reasoning" modelleri (o-serisi, DeepSeek-R1, Claude'un extended thinking modu) bunu test-zamanı hesaplamayla ayrıca güçlendirir.
  • check_circle Multimodalite: 2026 sınır modelleri metin, görüntü, ses ve videoyu tek mimaride işler; GPT-5 ve Gemini 3 doğal multimodal eğitilirken, açık tarafta Qwen3-VL ve Llama 4 aynı yönde ilerliyor.
  • check_circle Homojenizasyon ve tek nokta riski: Binlerce uygulamanın birkaç temel modele dayanması, bir modeldeki önyargı veya güvenlik açığının tüm ekosisteme yayılması riskini doğurur — Stanford HAI'nin 2021 raporunun ana uyarısı buydu.

2026 Ekosistemi: Kapalı API'ler ve Açık Ağırlıklı Modeller

Pazar iki kampa ayrılmış durumda. Kapalı tarafta OpenAI (GPT-5 ailesi), Anthropic (Claude Opus 4.5, Sonnet 4.5) ve Google (Gemini 3) sınır performansı API üzerinden sunuyor. Açık ağırlıklı tarafta Meta'nın Llama 4'ü (Scout ve Maverick, mixture-of-experts mimarili), Alibaba'nın Qwen3 serisi, Mistral ve Çin merkezli DeepSeek öne çıkıyor. DeepSeek-R1'in Ocak 2025'te sınıra yakın akıl yürütme performansını açık ağırlıkla ve düşük eğitim bütçesiyle yayımlaması, "sınır model = yüz milyonlarca dolar" varsayımını sarstı ve fiyat rekabetini sertleştirdi. Üçüncü bir eğilim küçük ama güçlü modeller: Microsoft Phi-4 (14B) ve Google Gemma 3 (1B-27B), dikkatle seçilmiş veriyle küçük ölçekte şaşırtıcı performans göstererek uç cihaz ve on-premise senaryolarını mümkün kılıyor. Türkiye'de ise Trendyol LLM gibi ticari girişimler ve İTÜ, ODTÜ, Koç gibi üniversitelerin Türkçe model çalışmaları (Hugging Face'te yayımlanan Türkçe fine-tune'lar dahil) yerel ekosistemi büyütüyor.

Kurumsal Seçim Kriterleri ve Regülasyon

  • check_circle Gizlilik ve veri egemenliği: API kullanımında veri sağlayıcı sunucusuna gider; sağlık, finans ve kamu için açık ağırlıklı modelin on-premise dağıtımı KVKK/GDPR uyumunu kolaylaştırır.
  • check_circle Maliyet dengesi: Düşük hacimde API ucuzdur; aylık milyonlarca isteğe ulaşan iş yüklerinde kendi GPU altyapısında açık model çalıştırmak toplam maliyeti düşürebilir.
  • check_circle AB AI Yasası (GPAI kuralları): Ağustos 2025'ten itibaren genel amaçlı model sağlayıcılarına eğitim verisi özeti ve telif politikası yükümlülüğü; 10^25 FLOP üzeri eğitim hesaplaması "sistemik risk" sınıfına girer ve ek değerlendirme gerektirir.
  • check_circle Tedarikçi kilidi (vendor lock-in): Prompt'lar ve değerlendirme setleri modele göre ayarlanır; çok sağlayıcılı mimari veya OpenRouter benzeri soyutlama katmanları geçiş maliyetini azaltır.

Sık Sorulan Sorular

  • check_circle Foundation model ile LLM aynı şey mi?: Hayır. Her LLM bir foundation model'dir ama tersi doğru değildir: CLIP (görüntü-metin), Whisper (ses) ve AlphaFold 3 (protein) dil modeli olmayan temel modellerdir.
  • check_circle Foundation model'e Türkçe ne denir?: "Temel model" karşılığı yerleşmiştir; akademik metinlerde "taban model" da görülür. Terim, üzerine uygulamaların inşa edildiği ortak zemini vurgular.
  • check_circle Bir foundation model eğitmek ne kadara mal olur?: Sınır modellerde hesaplama maliyeti 100M USD'yi aşar (Gemini Ultra tahmini ~190M USD). Buna karşılık DeepSeek-V3, verimli mimariyle son eğitim koşusunu ~5,6M USD hesaplama maliyetiyle tamamladığını raporladı; personel ve deney maliyetleri hariçtir.
  • check_circle Foundation model'i kendi verimle nasıl uyarlarım?: Sırasıyla deneyin: önce prompt engineering ve few-shot, yetmezse RAG, hâlâ yetmezse LoRA/QLoRA ile PEFT. 8B bir modelin LoRA ince ayarı tek GPU'da birkaç saatte, bulutta 20-200 USD bandında biter.
  • check_circle Açık ağırlıklı model ile açık kaynak model aynı mı?: Değil. Llama 4 ve Qwen3 ağırlıkları indirilebilir ama eğitim verisi ve kodun tamamı açık değildir; OSI tanımına göre bunlar "open-weight" sayılır. Tam açık örnekler (OLMo 2 gibi) veri ve eğitim tarifini de yayımlar.
  • check_circle Foundation model hangi işler için uygun değildir?: Milisaniye gecikme isteyen gerçek zamanlı sistemler, çok dar ve iyi tanımlı sınıflandırma görevleri (küçük özel model daha ucuz ve isabetli olabilir) ve modelin eğitim kesim tarihinden sonraki bilgiyi gerektiren sorgular — sonuncusu için RAG şarttır.