Parameters (Parametreler)

Eğitim sürecinde geri yayılım ile güncellenen ve modelin girdi-çıktı dönüşümünü belirleyen öğrenilebilir ağırlık ve bias değerleri.

Parametreler (parameters), makine öğrenmesi ve derin öğrenme modellerinde eğitim süreci boyunca optimizasyon algoritmaları tarafından güncellenen öğrenilebilir değerlerdir. Sinir ağlarında ağırlıklar (weights) ve biaslar (biases) en temel parametre türleridir; bu değerler, modelin girdiden çıktıya olan dönüşümü nasıl gerçekleştireceğini belirler. Model parametrelerinin sayısı, bir modelin kapasitesini ve ifade gücünü doğrudan etkiler. GPT-2 yaklaşık 117 milyon, GPT-3 ise 175 milyar parametreden oluşur; bu fark, modellerin dil anlama ve üretme kapasitelerindeki büyük uçurumu açıklar. Ancak parametre sayısı tek başına performansı garanti etmez; veri kalitesi, mimari tasarım ve eğitim stratejisi de kritik rol oynar. Parametreler, hiperparametrelerden farklıdır. Hiperparametreler (öğrenme hızı, batch boyutu, katman sayısı) eğitim öncesinde tasarımcı tarafından belirlenir ve eğitim sürecinde değişmez. Parametreler ise geri yayılım (backpropagation) algoritmasıyla her eğitim adımında güncellenir. Model büyüklüğünü ölçmek için kullanılan parametre sayısı, hesaplama maliyetini ve bellek gereksinimini de doğrudan etkiler. 7 milyar parametreli bir modelin tam hassasiyetle (FP32) yüklenmesi yaklaşık 28 GB bellek gerektirir; kuantizasyon teknikleri (INT8, INT4) büyük modelleri tüketici donanımında kullanılabilir kılmak için kritik önem taşır. Aktivasyon fonksiyonları, katman normalizasyonları ve dikkat mekanizmalarının ağırlıkları da birer parametredir. Transformer mimarilerinde dikkat başlıklarının sorgu, anahtar ve değer matrislerindeki ağırlıklar, modelin hangi bağlamsal bilgilere odaklanacağını öğrenir. Fine-tuning sırasında yalnızca belirli katmanların parametrelerini güncellemek (LoRA, prefix tuning gibi PEFT yöntemleri) hesaplama maliyetini dramatik biçimde düşürebilir; bu yaklaşımda modelin geri kalan parametreleri dondurulur (frozen) ve yalnızca küçük bir adaptasyon matrisi eğitilir. Parametre paylaşımı (parameter sharing), özellikle evrişimli sinir ağlarında (CNN) hafıza kullanımını azaltmak için başvurulan bir tekniktir; aynı filtre ağırlıkları görüntünün farklı bölgelerinde uygulanır. Mixture-of-Experts (MoE) mimarilerinde toplam parametre sayısı çok büyük olsa da her çıkarım adımında yalnızca küçük bir alt küme (uzman) aktif hâle gelir; bu yaklaşım hesaplama verimliliğini artırır. Örneğin Mixtral 8x7B modeli 46 milyar toplam parametreye sahip olsa da aktif parametre sayısı yalnızca 12 milyardır.

Parametreler Nasıl Öğrenir?

Eğitim sırasında model bir tahmin üretir ve bu tahmin ile gerçek değer arasındaki hata (kayıp fonksiyonu) hesaplanır. Geri yayılım algoritması, bu hatanın her parametreye olan katkısını gradyan hesaplamasıyla belirler. Gradyan inişi (gradient descent) ya da Adam gibi optimize ediciler, parametreleri hatayı azaltacak yönde öğrenme hızı ölçeğinde günceller. Bu süreç, milyonlarca örnek üzerinde tekrarlanır.

Parametre Sayısı ve Model Kapasitesi

Daha fazla parametre genellikle daha karmaşık örüntüleri modelleyebilme kapasitesi anlamına gelir. Ancak fazla parametre ile az veri kombinasyonu aşırı öğrenmeye (overfitting) yol açar. Modern dil modellerinde milyar parametre artık standart hale geldi; bu ölçekte modeller dil yapısını, gerçek dünya bilgisini ve akıl yürütme becerilerini aynı anda öğrenebilmektedir.

Bellek ve Hesaplama Maliyeti

Her parametre varsayılan olarak 32-bit kayan nokta (FP32) olarak saklanır ve 4 byte kaplar. 7 milyar parametreli model bu durumda 28GB RAM gerektirir; bu da tüketici GPU'larının sınırını aşar. Bu yüzden BF16, INT8 ve INT4 kantizasyon formatları devreye girer. Karma hassasiyet eğitimi (mixed precision training) ise eğitim hızını artırırken doğruluk kaybını minimumda tutar.

Hiperparametrelerle Farkı

Hiperparametreler (öğrenme hızı, epoch sayısı, batch boyutu, katman derinliği) eğitim başlamadan önce tasarımcı tarafından belirlenir ve eğitim sürecinde değişmez. Parametreler ise veriyle etkileşim yoluyla öğrenilir. İyi hiperparametre seçimi, parametrelerin doğru değerlere yakınsama hızını ve kalitesini doğrudan etkiler.

🔢 Model Parametre Sayısı ve Pratik Etkiler

  • check_circle 1-7B parametre: tüketici GPU'larında (8-24 GB VRAM) çalışır; akıllı telefon NPU'larında çıkarım
  • check_circle 7-13B parametre: kurumsal GPU'larda (24-48 GB VRAM); yüksek kalite yerel dağıtım için
  • check_circle 13-70B parametre: çok GPU sunucusu gerektirir; üretim servis için A100/H100 kümeleri
  • check_circle 70B+ parametre: veri merkezi ölçeğinde altyapı; en yüksek genel amaçlı performans
  • check_circle Parametre sayısı ≠ kalite; verimli mimari 3B'de 7B performansını geçebilir

Sıkça Sorulan Sorular

  • check_circle Daha fazla parametre her zaman daha iyi midir? Hayır. Küçük veri setleriyle büyük modeller aşırı öğrenir. Uygun model büyüklüğü görevin karmaşıklığına, veri miktarına ve hesaplama bütçesine bağlıdır.
  • check_circle Parametreler eğitim sonrası değişir mi? Standart çıkarım sırasında hayır. Ancak ince ayar (fine-tuning) veya RLHF gibi süreçlerde model yeniden eğitilerek parametreler güncellenir.
  • check_circle Aktif parametre sayısı ne anlama gelir? Mixtral gibi karma uzmanlar (MoE) modellerinde tüm parametreler her çıkarımda kullanılmaz. Örneğin 46B parametreli Mixtral 8x7B, çıkarım sırasında yalnızca 12B parametreyi aktive eder.
  • check_circle Parametre sayısı ile FLOPS ilişkisi nedir? Parametre sayısı model büyüklüğünü, FLOPS ise çıkarım sırasındaki hesaplama yükünü ölçer. MoE mimarileri yüksek parametre sayısıyla düşük FLOPS dengesini hedefler.