Hiperparametre Nedir?
Hiperparametre, bir makine öğrenimi modelinin eğitim sürecini dışarıdan yöneten ve eğitim başlamadan önce belirlenmesi gereken yapılandırma değişkenidir. Öğrenme hızı (learning rate), katman sayısı, gizli birim sayısı, batch boyutu, dropout oranı ve regularizasyon katsayısı birer hiperparametredir. Model parametrelerinden temel farkı şudur: parametreler (ağırlıklar, bias değerleri) eğitim sırasında gradyan inişiyle otomatik olarak güncellenir; hiperparametreler ise öğrenme algoritmasının dışındadır ve araştırmacı ya da otomatik bir arama süreci tarafından belirlenir. Yanlış ayarlanmış bir hiperparametre yetersiz öğrenmeye (underfitting) veya eğitim verisini ezberlemeye (overfitting) yol açar. Bu nedenle hiperparametre optimizasyonu (HPO), başarılı model geliştirmenin ayrılmaz parçasıdır.
Hiperparametre Arama Stratejileri
- check_circle :
- check_circle :
- check_circle :
- check_circle :
- check_circle :
Popüler HPO Araçları
- check_circle :
- check_circle :
- check_circle :
- check_circle :
- check_circle :
Büyük Modellerde Hiperparametre Transferi
Büyük modellerde hiperparametre aramak son derece pahalıdır: GPT-3 (175B) için tek eğitim ~4.6 milyon dolar maliyetindeydi. Bu sorunu çözmek için μP (Maximal Update Parametrization) yöntemi küçük ölçekte bulunan optimal öğrenme hızını doğrudan büyük modele aktarmayı mümkün kılar. Neural Architecture Search (NAS) ise hangi mimarinin kullanılacağını da hiperparametre gibi optimize eder; DARTS ve EfficientNet bu yöntemle bulunmuştur. Pratikte çoğu takım literatürdeki paylaşılmış değerlerden (learning rate için 3e-4 'Karpathy sabiti' gibi) başlar ve küçük bir arama ile rafine eder.
Sık Sorulan Sorular
- check_circle :
- check_circle :
- check_circle :
- check_circle :
- check_circle :