Parameters (Parametreler)
Eğitim sürecinde geri yayılım ile güncellenen ve modelin girdi-çıktı dönüşümünü belirleyen öğrenilebilir ağırlık ve bias değerleri.
Parametreler (parameters), makine öğrenmesi ve derin öğrenme modellerinde eğitim süreci boyunca optimizasyon algoritmaları tarafından güncellenen öğrenilebilir değerlerdir. Sinir ağlarında ağırlıklar (weights) ve biaslar (biases) en temel parametre türleridir; bu değerler, modelin girdiden çıktıya olan dönüşümü nasıl gerçekleştireceğini belirler. Model parametrelerinin sayısı, bir modelin kapasitesini ve ifade gücünü doğrudan etkiler. GPT-2 yaklaşık 117 milyon, GPT-3 ise 175 milyar parametreden oluşur; bu fark, modellerin dil anlama ve üretme kapasitelerindeki büyük uçurumu açıklar. Ancak parametre sayısı tek başına performansı garanti etmez; veri kalitesi, mimari tasarım ve eğitim stratejisi de kritik rol oynar. Parametreler, hiperparametrelerden farklıdır. Hiperparametreler (öğrenme hızı, batch boyutu, katman sayısı) eğitim öncesinde tasarımcı tarafından belirlenir ve eğitim sürecinde değişmez. Parametreler ise geri yayılım (backpropagation) algoritmasıyla her eğitim adımında güncellenir. Model büyüklüğünü ölçmek için kullanılan parametre sayısı, hesaplama maliyetini ve bellek gereksinimini de doğrudan etkiler. 7 milyar parametreli bir modelin tam hassasiyetle (FP32) yüklenmesi yaklaşık 28 GB bellek gerektirir; kuantizasyon teknikleri (INT8, INT4) büyük modelleri tüketici donanımında kullanılabilir kılmak için kritik önem taşır. Aktivasyon fonksiyonları, katman normalizasyonları ve dikkat mekanizmalarının ağırlıkları da birer parametredir. Transformer mimarilerinde dikkat başlıklarının sorgu, anahtar ve değer matrislerindeki ağırlıklar, modelin hangi bağlamsal bilgilere odaklanacağını öğrenir. Fine-tuning sırasında yalnızca belirli katmanların parametrelerini güncellemek (LoRA, prefix tuning gibi PEFT yöntemleri) hesaplama maliyetini dramatik biçimde düşürebilir; bu yaklaşımda modelin geri kalan parametreleri dondurulur (frozen) ve yalnızca küçük bir adaptasyon matrisi eğitilir. Parametre paylaşımı (parameter sharing), özellikle evrişimli sinir ağlarında (CNN) hafıza kullanımını azaltmak için başvurulan bir tekniktir; aynı filtre ağırlıkları görüntünün farklı bölgelerinde uygulanır. Mixture-of-Experts (MoE) mimarilerinde toplam parametre sayısı çok büyük olsa da her çıkarım adımında yalnızca küçük bir alt küme (uzman) aktif hâle gelir; bu yaklaşım hesaplama verimliliğini artırır. Örneğin Mixtral 8x7B modeli 46 milyar toplam parametreye sahip olsa da aktif parametre sayısı yalnızca 12 milyardır.