tag model-eğitimi
Bu sayfada model-eğitimi etiketi ile işaretlenmiş 17 yapay zeka kavramını bulabilirsiniz.
Batch size (yığın boyutu), bir yapay sinir ağının eğitiminde her gradyan güncellemesinde aynı anda işlenen eğitim örneği sayısını belirleyen hiperparametredir. Model tüm veri setini tek seferde hafızaya almak yerine veriyi küçük gruplara böler; batch size 32 ise ağırlıklar her 32 örnekte bir güncellenir. 10.000 örneklik bir veri setinde bu, epoch başına yaklaşık 313 güncelleme adımı demektir. Bu tek sayının önemi iki eksende toplanır: donanım ve öğrenme dinamiği. Donanım tarafında batch; model ağırlıkları, optimizer durumları ve ara aktivasyonlarla birlikte GPU belleğine (VRAM) sığmak zorundadır. Değer büyüdükçe bellek tüketimi yaklaşık orantılı artar, sınır aşıldığında Out of Memory (OOM) hatası alınır. Öğrenme tarafında ise küçük batch'ler gürültülü ama düzenleyici etki yapan gradyan tahminleri üretir ve genellemeyi iyileştirebilir; büyük batch'ler daha kararlı gradyanlar ve yüksek GPU verimliliği sunar ama keskin minimumlara (sharp minima) takılıp test performansını düşürme riski taşır. Pratikte üç yaklaşım ayırt edilir: batch size 1 ile çalışan stochastic gradient descent (SGD), tüm veriyi tek seferde işleyen full batch ve ikisinin ortasındaki mini-batch. Modern derin öğrenmede standart, 32-256 aralığındaki mini-batch değerleridir; "batch size" dendiğinde çoğunlukla bu kastedilir. Batch size tek başına değil, learning rate ile birlikte ayarlanır: batch büyütüldüğünde öğrenme hızı da genellikle orantılı artırılır (linear scaling rule) ve warmup uygulanır. Ölçek büyüdükçe kavram şekil değiştirir: büyük dil modeli ön eğitiminde global batch örnek sayısıyla değil token sayısıyla ifade edilir. Llama 3 405B'nin ön eğitiminde global batch 16 milyon token'a kadar çıkarılmıştır; bu ölçek tek GPU'ya sığmadığı için gradient accumulation ve data parallel dağıtım zorunludur. Günlük pratikte ise VRAM yetmediğinde gradient accumulation ile büyük sanal batch simüle edilir, bf16 mixed precision ve gradient checkpointing bellek ihtiyacını ciddi ölçüde azaltır. Doğru batch size veri setine, mimariye ve donanıma göre deneysel seçilir; 32 veya 64 ile başlayıp validation loss izleyerek ayarlamak en yaygın yöntemdir.
Batch Size (Yığın (Küme) Boyutu)
Batch size (yığın boyutu), bir yapay sinir ağının eğitiminde her gradyan güncellemesinde aynı anda işlenen eğitim örneği sayısını belirleyen hiperparametredir. Model tüm veri setini tek seferde hafızaya almak yerine veriyi küçük gruplara böler; batch size 32 ise ağırlıklar her 32 örnekte bir güncellenir. 10.000 örneklik bir veri setinde bu, epoch başına yaklaşık 313 güncelleme adımı demektir. Bu tek sayının önemi iki eksende toplanır: donanım ve öğrenme dinamiği. Donanım tarafında batch; model ağırlıkları, optimizer durumları ve ara aktivasyonlarla birlikte GPU belleğine (VRAM) sığmak zorundadır. Değer büyüdükçe bellek tüketimi yaklaşık orantılı artar, sınır aşıldığında Out of Memory (OOM) hatası alınır. Öğrenme tarafında ise küçük batch'ler gürültülü ama düzenleyici etki yapan gradyan tahminleri üretir ve genellemeyi iyileştirebilir; büyük batch'ler daha kararlı gradyanlar ve yüksek GPU verimliliği sunar ama keskin minimumlara (sharp minima) takılıp test performansını düşürme riski taşır. Pratikte üç yaklaşım ayırt edilir: batch size 1 ile çalışan stochastic gradient descent (SGD), tüm veriyi tek seferde işleyen full batch ve ikisinin ortasındaki mini-batch. Modern derin öğrenmede standart, 32-256 aralığındaki mini-batch değerleridir; "batch size" dendiğinde çoğunlukla bu kastedilir. Batch size tek başına değil, learning rate ile birlikte ayarlanır: batch büyütüldüğünde öğrenme hızı da genellikle orantılı artırılır (linear scaling rule) ve warmup uygulanır. Ölçek büyüdükçe kavram şekil değiştirir: büyük dil modeli ön eğitiminde global batch örnek sayısıyla değil token sayısıyla ifade edilir. Llama 3 405B'nin ön eğitiminde global batch 16 milyon token'a kadar çıkarılmıştır; bu ölçek tek GPU'ya sığmadığı için gradient accumulation ve data parallel dağıtım zorunludur. Günlük pratikte ise VRAM yetmediğinde gradient accumulation ile büyük sanal batch simüle edilir, bf16 mixed precision ve gradient checkpointing bellek ihtiyacını ciddi ölçüde azaltır. Doğru batch size veri setine, mimariye ve donanıma göre deneysel seçilir; 32 veya 64 ile başlayıp validation loss izleyerek ayarlamak en yaygın yöntemdir.
Data Drift (Veri Kayması (Bozulması))
Veri drift (data drift), bir makine ogrenimi modelinin egitildigi veri dagilimi ile modelin uretimde karsilastigi gercek dunya verisi arasindaki istatistiksel mesafenin zamanla buyumesidir. Bir model egitim sirasinda belirli bir veri dagilimini ogrendigi icin, bu dagilimdaki degisimler modelin ongorduguyle gercek dunyada karsilastiginni arasinda giderek buyuyen bir uyumsuzluk yaratir ve model performansinin bozulmasina yol acar. Drift cesitli bicimlerde gerceklesebilir. Kovaryet drift (covariate shift), girdi ozelliklerinin istatistiksel dagiliminin degismesiyle olur; ancak girdi-cikti iliskisi sabittir. Ornegin bir banka dolandiricilik modelinin egitildigi doneme kiyasla musteri yas profili veya islem buyuklukleri zamanla degisebilir. Kavram drift (concept drift) ise daha derin bir problemi temsil eder: girdi ile cikti arasindaki temel iliskinin kendisi degisir. COVID-19 pandemisi, tuketici aliskanliklarini o kadar kisa surede donusturdu ki yuzlerce sirkette alis-veri tahmin modelleri kritik performans kaybi yasadi. Drift tespiti icin cesitli istatistiksel testler kullanilir. Population Stability Index (PSI), egitim ve uretim verisinin dagilim farkliliğini sayisal olarak olcer; 0.1 altinda kritik, 0.25 uzerinde kritik drift isaretler. Kolmogorov-Smirnov testi iki dagilimlarin istatistiksel olarak anlamli farkliliği olup olmadigini test eder. KL Divergence, bir dagilimdaki bilginin digerini temsil etmek icin ne kadar eksik bilgi gerektirdigini olcer. Pratik MLOps sistemlerinde drift izleme gercek zamanli veya periyodik olarak yurutur. Bir esik gecilelince sistem uyari olusturur, log kaydeder ve bazen otomatik yeniden egitimi tetikler. Yeniden egitim her zaman dogru cevap degildir; kimi zaman ozellik muhendisligi veya modelin yeniden tasarlanmasi gerekir. Etiket gecikme sorunu da yogun gundeme gelir: drift tespitinin kalbi olan gercek etiketi elde etmek haftalar veya aylar alabilir. **Sik Sorulan Sorular** **Veri drift ile model drift arasindaki fark nedir?** Veri drift girdi dagiliminin degismesidir; model drift ise cikti kalitesinin bozulmasini ifade eder. Veri drift model driftin yaygin nedenlerinden biridir ancak tek nedeni degildir. **Drift ne siklukla kontrol edilmelidir?** Bu verinin degisim hizina baglidir. Finansal, hava durumu veya trafik verileri gunden gune bile ciddi drift gosterebilir. Urun tavsiye modelleri genellikle haftalik kontrol yeterlidir. **Drift tespitinde hangi araclar kullanilir?** Evidently AI, Arize, Whylogs, Fiddler ve bulut saglayicilarin yonetilen izleme servisleri yaygin seceneklerdir. Temel istatistiksel testler ise SciPy veya scikit-learn ile uygulanabilir. **Drift olmadan da model bozulabilir mi?** Evet. Model bozulmasi; veri altyapisindaki degisiklikler, bagimliliklarin guncellenmesi veya kodlama hatalari gibi teknik nedenlerle de olabilir; bunlar veri drift olmaksizin gerceklesir.
Epoch (Epoch (Eğitim Döngüsü))
Epoch (Epok ya da Eğitim Döngüsü), makine öğrenimi ve derin öğrenme modellerinin eğitiminde kullanılan temel bir zaman birimidir. Bir epoch; modelin tüm eğitim veri setini baştan sona tam olarak bir kez işlemesi, yani her örnek üzerinde hem ileri yayılım (forward pass) hem de geri yayılım (backward pass) gerçekleştirmesi anlamına gelir. Makine öğrenimi modellerini eğitirken, yalnızca bir epoch genellikle yeterli olmaz. Model, karmaşık kalıpları ve ilişkileri kavrayabilmek için aynı veriler üzerinde defalarca geçiş yapmak zorundadır. Bu nedenle modeller onlarca, yüzlerce hatta binlerce epoch boyunca eğitilebilir. Büyük dil modellerinin (LLM) eğitimi milyarlarca token üzerinde birden fazla epoch uygulanarak gerçekleştirilir; görüntü sınıflandırma gibi daha küçük görevlerde ise 10-100 epoch sıkça kullanılır. Epoch ve Batch İlişkisi Her epoch, büyük veri setini daha küçük parçalara (batch) bölerek işler. Bir epoch içindeki güncelleme sayısı, veri seti boyutunun batch boyutuna bölünmesiyle hesaplanır. Örneğin 10.000 örnekli bir veri seti 100'lük batch boyutuyla işleniyorsa, her epoch 100 ağırlık güncellemesi (iterasyon) içerir. Her iterasyonda gradyan hesaplanır ve model ağırlıkları güncellenir; böylece model adım adım öğrenir. Overfitting ve Erken Durdurma Epoch sayısının doğru seçilmesi kritik öneme sahiptir. Çok az epoch modelin yeterince öğrenememesine (underfitting) yol açar; model verinin altında yatan örüntüleri kavramaz ve hem eğitim hem de test verisinde kötü performans gösterir. Öte yandan, çok fazla epoch modelin eğitim verisini mekanik olarak ezberlemeye (overfitting) başlamasına neden olabilir. Bu durumda model eğitim setinde mükemmel sonuçlar verirken yeni verilerde başarısız olur. Bu dengesizliği çözmek için "Early Stopping" (Erken Durdurma) tekniği uygulanır: model her epoch sonunda doğrulama (validation) seti üzerinde değerlendirilir ve doğrulama kaybı iyileşmemeye başladığında eğitim otomatik olarak durdurularak en iyi ağırlıklar korunur. Eğitim ve doğrulama kaybının birbirinden ayrışmaya başlaması (divergence), overfitting'in erken belirtisidir. Epoch Sayısını Belirlemek Kaç epoch kullanılacağı, modelin karmaşıklığına, veri setinin büyüklüğüne ve görevin zorluğuna bağlıdır. Küçük veri setlerinde genellikle daha fazla epoch gerekir çünkü model her geçişte sınırlı miktarda örneğe maruz kalır. Büyük veri setlerinde ise tek bir epoch bile çok sayıda güncelleme içerdiğinden az epoch ile tatmin edici sonuçlar alınabilir. Epoch sayısı, öğrenme hızı (learning rate) ve model mimarisiyle birlikte hiperparametre optimizasyonunun temel bileşenlerinden biridir.
Fine-Tuning (İnce Ayar)
Fine-tuning (ince ayar), genel amaçlı büyük bir modeli, belirli bir görev veya alan için özelleştirmek amacıyla ek veriyle yeniden eğitme sürecidir. Temel modeller (foundation models), devasa metin ya da görüntü külliyatlarıyla ön eğitimden geçirilir; bu sayede dilin gramerini, mantığını ve genel bilgiyi kodlarlar. Ancak bir şirketin müşteri hizmetleri tonunu benimseyen, belgelerini hep aynı JSON şemasında döndüren ya da tıbbi terminolojiyi hatasız kullanan özel bir modele ihtiyaç duyulduğunda sıfırdan eğitim hem maliyetli hem de veri açısından olanaksız olabilir. İnce ayar, bu boşluğu doldurur: mevcut ağırlıkları başlangıç noktası olarak kullanır ve yeni veriye göre hafifçe güncelleyerek modelin davranışını, biçimini ve üslubunu kalıcı biçimde özelleştirir. Fine-tuning yöntemleri hesaplama maliyeti ve adaptasyon derinliği açısından farklılaşır. Tam ince ayar (full fine-tuning), modelin tüm parametrelerini günceller; maksimum adaptasyon gücü sunarken çok yüksek GPU belleği ve uzun eğitim süresi gerektirir. Catastrophic forgetting (felaketi unutma) da önemli bir risktir: model yeni bilgiyi öğrenirken eski bilgilerini yitirebilir. PEFT (Parameter-Efficient Fine-Tuning) yöntemleri bu sorunu çözmek için parametrelerin büyük çoğunluğunu dondurur ve yalnızca küçük bir alt kümeyi günceller. LoRA (Low-Rank Adaptation), katmanlar arasına düşük sıralı ek matrisler yerleştirerek orijinal ağırlıklara dokunmadan öğrenmeyi mümkün kılar. QLoRA ise temel modeli 4-bit'e kuantize edip üzerine LoRA uygulayarak 65 milyar parametreli modelleri bile tek bir tüketici sınıfı GPU'da eğitmeye elverişli hale getirir. İnce ayarın avantajları net ve ölçülebilirdir: prompt'la her istekte yeniden tarif edilmesi gereken kurallar modelin doğal davranışı haline gelir; bu hem token maliyetini düşürür hem de çıktı tutarlılığını artırır. Kurumsal kullanımda açık kaynak modeller kendi sunucularda ince ayardan geçirilerek hassas veriler üçüncü taraf API'lere aktarılmadan uzman model elde edilir. Eğitim verisi kalitesi ve miktarı, ince ayarın başarısını doğrudan belirleyen en kritik etkenlerdir.
GPU (Graphics Processing Unit) (Grafik İşlemci (Ekran Kartı))
GPU (Graphics Processing Unit — Grafik İşleme Birimi), başlangıçta bilgisayar grafiklerini hesaplamak için tasarlanmış; fakat binlerce küçük çekirdekli paralel mimarisi ile yapay zeka ve yüksek performanslı hesaplama (HPC) alanında vazgeçilmez hale gelmiş bir işlemci türüdür. Günümüzde derin öğrenme eğitimi ve çıkarsama işlemlerinin büyük çoğunluğu GPU üzerinde gerçekleşmektedir. GPU'ların paralel mimarisi, AI hesaplamalarında kritik öneme sahip matris çarpma ve tensor işlemlerine çok iyi uymaktadır. NVIDIA'nın CUDA (Compute Unified Device Architecture) platformu, geliştiricilere GPU üzerinde genel amaçlı hesaplama yapmayı mümkün kılan ilk geniş kapsamlı yazılım katmanıydı. 2007'de tanıtılan CUDA, bugün de derin öğrenme ekosisteminin temelini oluşturmaktadır. NVIDIA'nın AI odaklı GPU'ları GPU mimarisinin evrimini yönlendirmiştir: Tesla (2008), Kepler, Maxwell, Pascal, Volta, Ampere ve son olarak Hopper mimarisi (H100). A100 ve H100, LLM eğitiminde standart haline gelmiştir. AMD ise ROCm platformu ve MI300X çipleriyle bu pazara rakip olarak girmektedir. Apple'ın M serisi çipler ise birleşik bellek mimarisiyle AI çıkarsama için enerji verimli alternatif sunmaktadır. Derin öğrenme çerçeveleri (TensorFlow, PyTorch) GPU desteğini neredeyse tamamen CUDA/cuDNN (NVIDIA) üzerinden sağlar. Tensor Core'lar, H100 gibi modern çipler üzerinde yarı hassas (FP16/BF16) matris işlemlerini 10-100 kat hızlandırır. GPU belleği (VRAM) model büyüklüğünü doğrudan sınırlar; 80GB VRAM'e sahip H100, 70 milyar parametreli bir modeli tam hassasiyetle tutabilir. Bulut GPU hizmetleri (AWS EC2 P4d, Google Cloud A100, Azure NDv4) on-premises donanım yatırımı yapmadan büyük ölçekli model eğitimi olanağı tanır. Multi-GPU konfigürasyonlarında NVLink ve InfiniBand bant genişliği, eğitim süresini doğrusal ölçekte kısaltmaktadır. GPU kapasitesi, modern yapay zeka sistemlerinin ölçeğini doğrudan belirleyen temel mühendislik kısıtlarından biri olmaya devam etmektedir. Enerji tüketimi ve soğutma maliyetleri de GPU seçimini etkileyen önemli faktörler arasındadır; H100 çipinin maksimum güç tüketimi 700W düzeyindedir.
Hyperparameter Tuning (Hiperparametre Optimizasyonu)
Hiperparametre optimizasyonu (Hyperparameter Tuning), makine öğrenimi modelinin eğitim sürecine başlamadan önce araştırmacı veya mühendis tarafından belirlenen kontrol değişkenlerinin — öğrenme hızı (learning rate), ağaç derinliği, katman sayısı, düzenlileştirme katsayısı gibi — en uygun kombinasyonunun sistematik biçimde aranması işlemidir. Makine öğreniminde iki farklı parametre türü bulunur: modelin eğitim verisinden öğrendiği "parametreler" (ağırlıklar, bias değerleri) ve eğitimden önce dışarıdan belirlenen "hiperparametreler". Hiperparametreler model mimarisini ve öğrenme dinamiklerini doğrudan şekillendirir; yanlış seçilen bir hiperparametre seti, en kaliteli veriyle bile zayıf sonuçlar doğurabilir. Başlıca hiperparametre arama yöntemleri şöyle sıralanabilir: Grid Search (Izgara Arama): Belirlenen aralıklar içindeki tüm olası kombinasyonları dener; garanti sonuç verir ancak hesaplama maliyeti kombinasyon sayısıyla katlanarak artar. Az sayıda hiperparametre ve dar aralıklar için uygundur. Random Search (Rasgele Arama): Kombinasyonları rastgele örnekler; Grid Search'e kıyasla genellikle daha kısa sürede benzer kalitede sonuç üretir. Yüksek boyutlu arama uzaylarında tercih edilir. Bayesian Optimization: Önceki denemelerin sonuçlarını kullanarak sonraki adımda hangi kombinasyonu deneyeceğini olasılık modeline göre seçer. Deneme sayısını minimize ederek en iyi hiperparametrelere ulaşmayı hedefler; derin öğrenme gibi maliyetli modellerde yaygındır. Optuna, Ray Tune ve Hyperopt bu yaklaşımı uygulayan popüler kütüphanelerdir. Automated ML (AutoML): Hiperparametre aramasını tamamen otomatikleştirir. Google AutoML, H2O.ai ve Keras Tuner gibi araçlar hem model seçimi hem de parametre optimizasyonunu arka planda yürütür. Hiperparametre optimizasyonu sürecinde çapraz doğrulama (cross-validation) kritik bir rol oynar: her aday kombinasyon, verinin farklı katlarında test edilerek aşırı uyumu (overfitting) önleyecek şekilde değerlendirilir. Özellikle derin sinir ağlarında learning rate, momentum ve batch size değerlerinin doğru ayarlanması, model başarısını belirleyici ölçüde etkiler. Pratik projelerde hiperparametre arama sürecinin toplam eğitim süresinin %30–50'sini oluşturduğu görülmektedir.
LoRA (Low-Rank Adaptation) (Düşük Dereceli Adaptasyon)
LoRA (Low-Rank Adaptation), milyarlarca parametreli büyük dil modellerini (LLM) veya görsel difüzyon modellerini son derece verimli biçimde ince ayarlayan (fine-tune) bir parametre etkin tekniktir. Orijinal ağırlık matrislerini dondurarak yalnızca küçük ek matrisler eğiten bu yaklaşım, tam ince ayara kıyasla eğitim için gereken GPU belleğini ve hesaplama süresini dramatik ölçüde azaltır. Bu sayede tüketici sınıfı donanımlar üzerinde büyük ölçekli model uyarlaması mümkün hale gelir. Tekniğin matematiksel temeli düşük ranklı matris ayrışımına dayanır. Ağırlık güncellemesi ΔW = A × B olarak ifade edilir; burada A (d×r) ve B (r×d) boyutlarındaki küçük matrisler yalnızca r rank boyutunu eğitir. Eğitim başında A Gaussian dağılımla, B ise sıfırla başlatılır; böylece başlangıçta LoRA katkısı sıfır olur ve taban modelin davranışı bozulmaz. Çıkarım sırasında eğitilen matrisler W + (α/r) × BA formülüyle taban modele eklenir; bu işlem ek gecikme yaratmaz ve ayrı adaptör dosyaları farklı görevler için kolayca değiştirilebilir. Varyantlar arasında QLoRA özellikle dikkat çekmektedir. Taban modeli 4-bit NF4 ile nicemlendirerek belleğe yükleyen bu yöntem, 65 milyar parametreli bir modeli tek bir 48 GB GPU'ya sığdırabilmektedir; LoRA adaptörleri ise tam hassasiyetle eğitilir. AdaLoRA her katmana önem skoruna göre dinamik rank atarken DoRA ağırlığı büyüklük ve yön bileşenlerine ayırarak tam ince ayara daha yakın davranış sergiler. rsLoRA yüksek rank değerlerinde kararlı eğitim için rank normalizasyonu uygular. LoRA+ ise A ve B matrislerine farklı öğrenme hızları atayarak yakınsama hızını artırır. Görsel üretim alanında LoRA, belirli sanatçı stillerini, karakter yüzlerini veya nesne tarzlarını 10-50 görüntüyle modele öğretmek için kullanılır. Civitai platformunda on binlerce topluluk LoRA'sı ücretsiz paylaşılmakta; A1111 ve ComfyUI gibi arayüzler bu ağırlıkları çalışma zamanında kolayca yüklemeyi desteklemektedir. FLUX.1 modeli için LoRA eğitimi artık Replicate ve Hugging Face üzerinden çevrimiçi de yapılabilmektedir. Hugging Face PEFT kütüphanesi birkaç satır kodla herhangi bir Transformer mimarisine LoRA eklemek için standart araç haline gelmiştir.
Meta-Learning (Meta Öğrenme (Öğrenmeyi Öğrenmek))
Meta-öğrenme (meta-learning veya "öğrenmeyi öğrenmek"), bir yapay zeka modelinin çok sayıda farklı görev üzerinde eğitilerek yeni bir göreve çok az veriyle hızla uyum sağlayabilmesini hedefleyen öğrenme paradigmasıdır. Standart makine öğrenmesinde her yeni görev için sıfırdan eğitim yapılırken meta-öğrenme bu süreci kısaltır; model tek bir göreve özgüleşmek yerine genel bir "öğrenme stratejisi" kazanır. Bu yaklaşım özellikle etiketli verinin nadir, maliyetli veya zaman kısıtlı olduğu alanlarda büyük avantaj sunar. Meta-öğrenmenin üç temel yaklaşımı vardır. Model-tabanlı meta-öğrenme, hızlı güncelleme için tasarlanmış özel mimariler kullanır (Memory-Augmented Neural Networks, Neural Turing Machine). Optimizasyon-tabanlı meta-öğrenme, modeli hızla ince ayar yapılabilecek bir başlangıç noktasına konumlar; MAML (Model-Agnostic Meta-Learning) bu kategorinin öncü algoritmasıdır. Metrik-tabanlı meta-öğrenme ise benzerlik uzayında sınıflandırma yapar; Prototypical Networks ve Siamese Network bu yaklaşımın başlıca temsilcileridir. MAML, iç döngüde her göreve birkaç gradyan adımı atarken dış döngüde tüm görevlerin gradyanlarını birleştirerek modelin genel başlangıç parametrelerini günceller. Bu yapı, modelin herhangi bir yeni göreve birkaç adımla adapte olmasını sağlar. Hesaplama yükünü azaltmak için Reptile (birinci derece yaklaşım), iMAML ve ProtoMAML gibi hafifletilmiş alternatifler geliştirilmiştir. Az kaynaklı dil modelleme, robotik manipülasyon, ilaç keşfi, kişiselleştirilmiş tavsiye sistemleri ve sinir mimarisi araması (Neural Architecture Search) gibi veri kısıtlı alanlarda meta-öğrenme belirgin avantaj sunar. Few-shot öğrenme görevlerinde başarı için en çok başvurulan yöntemler arasındadır. Büyük dil modelleri bağlamında in-context learning, meta-öğrenmenin örtük bir biçimi olarak yorumlanmaktadır. Modeller, ön eğitim sırasında milyarlarca farklı görev örneği gördüğünden bir tür örtük öğrenme stratejisi kazanır; yeni bir göreve yalnızca birkaç prompt örneğiyle adapte olabilir. Modelin ağırlıkları güncellenmeksizin gerçekleşen bu adaptasyon "gizli meta-öğrenme" olarak nitelendirilir.
Model Collapse (Model Çöküşü)
Model Çöküşü (Model Collapse), büyük dil modellerinin (LLM) kendi ürettikleri sentetik içeriklerle döngüsel biçimde yeniden eğitildiğinde aşamalı olarak kalite kaybettiği, çeşitlilik yitirdiği ve halüsinasyon üretimini artırdığı süreçtir. Kavram, 2023 yılında Shumailov ve arkadaşlarının yayımladığı 'The Curse of Recursion: Training on Generated Data Makes Models Forget' başlıklı makaleyle teorik ve deneysel zemine oturtuldu. Model çöküşünün temel işleyişi üç bileşik mekanizmayı kapsar. İlk olarak kuyruk verisi kaybı yaşanır: İnsan yazısının doğal çeşitliliğini oluşturan nadir ifadeler, azınlık dilleri, sıradışı fikirler ve ince mizah unsurları olan 'uzun kuyruk', model eğitimi sırasında ortalama ağırlığın gerisinde kalır. Model çıktıları bu nadir unsurları ihmal eder ve bu çıktılarla eğitilen bir sonraki nesil modeli nadir bilgiden daha da uzaklaşır. İkinci olarak dağılım daralması gözlemlenir: Her eğitim nesliyle birlikte veri dağılımının varyansı azalır; model giderek daha tekdüze, öngörülebilir yanıtlar üretir. Bu, bir fotoğrafın fotokopisinin fotokopisi gibi her aktarımda ince detayları kaybeden bir bozulma sürecine benzer. Üçüncü bileşen ise hata birikimi: Küçük olgusal yanlışlıklar veya hayali bilgi parçaları, model çıktısında kalıcı yer edinerek bir sonraki eğitim yinelemesinde 'gerçek' veri gibi muamele görür ve böylece giderek büyüyerek modelin dünya anlayışını aşındırır. Pratik boyutuyla, yeterli önlem alınmadan yürütülen sentetik döngü eğitimleri modellerin Türkçe gibi kaynak bakımından zayıf dillerde hızla bozulmasına, olgusal güvenilirliğin gerilemesine ve yalnızca alışıldık kalıpları tekrarlayan monoton çıktılara yol açabilir. Araştırmacılar bu riski azaltmak için birkaç temel strateji önerir: Orijinal insan verisi eğitim karışımında belirli bir pay korunmalı; sentetik içerik kriptografik filigran ya da C2PA standardıyla işaretlenerek kaynağı izlenebilir hale getirilmeli; her eğitim döngüsünde veri çeşitlilik metrikleri ölçülmeli; gerçek insan yazısından oluşan referans korpuslar uzun vadeli arşivlerde saklanmalıdır. Phi-4 ve benzeri modellerin dikkatli kurgulanmış sentetik veri karışımıyla iyi sonuçlar elde etmesi, tam sentetik döngüden değil, denetimli sentetik veri kullanımından kaynaklanır.
Quantization (Kuantizasyon (Model Küçültme))
Quantization (niceleme), sinir agi modellerindeki parametre degerlerinin yuksek hassasiyetli sayisal formattan (genellikle 32-bit kayan nokta, float32) daha dusuk bit genisligine (8-bit tam sayi veya 4-bit gibi) donusturulme islemidir. Bu donusum model boyutunu kucultmesi, cikarim hizini artirmasi ve guc tuketimini dusurmesinin yaninda, modeli kaynak kisitli ortamlarda - ornegin akilli telefon veya kenarda calisabilen cihazlarda - calistirmaya olanak tanir. Nicelemenin temelinde bir uzlasim yatar: hassasiyet azaldikca model hafizasi ve hesaplama maliyeti duser, ancak tahmin kalitesi potansiyel olarak azalabilir. Uygulamada, ozellikle INT8 dzeyinde, bu kalite kaybi cogu gorev icin ihmal edilebilir seviyede kalir. GPTQ veya bitsandbytes gibi kutuphaneler, niceleme hatasini en aza indirmek icin kalibrasyon verisi kullanarak agirlik matrislerini yeniden optimize eder. Iki ana yaklasim mevcuttur. Post-Training Quantization (PTQ) halihazirda egitilmis bir modele uygulanir; ekstra egitim gerektirmez ve hizlidir. Quantization-Aware Training (QAT) ise niceleme etkisini eğitim dongusu icerisine dahil eder; model, daha dusuk hassasiyetle bile dogru tahmin uretmeyi ogrenir. QAT genellikle PTQ'ya kiyasla daha iyi nihai kalite sunar ama ek hesaplama maliyeti getirir. Buyuk dil modellerinin (LLM) giderek buyumesiyle quantization zorunlu bir pratik haline gelmistir. GPT-3 seviyesinde bir model tam hassasiyetle yuzlerce gigabayt RAM gerektirir; INT4 nicelemeyle bu rakam onlarca gigabayta iner ve ticarette satilan bir laptopla calistirmak mumkun olur. llama.cpp projesi ve GGUF formati, bu olasiligi genis bir topluluga acmistir: Q4_K_M, Q5_K_S gibi semboller bit genisligi ile kalite stratejisini kodlar. Donanim ekosistemi de nicelemeyi etkin sekilde destekler. NVIDIA'nin Tensor Core mimarisi INT8 ve FP8 cikarimini donanim katmaninda hizlandirir; bu sayede veri merkezi GPU'larinda ayni enerji butcesiyle cok daha yuksek islem hacmi elde edilir. Apple Silicon'un Unified Memory mimarisi ise CPU ve GPU'nun ayni bellek havuzunu paylasmasina izin vererek quantized LLM'lerin tuketu cihazlarda akici calismasi icin dogal bir avantaj sunar. **Sik Sorulan Sorular** **INT8 ile INT4 niceleme arasinda kalite farki buyuk mudur?** INT8, cogulukla ihmal edilebilir kalite kaybı uretir. INT4 ise modele ve goreve bagimlidir: genel dil anlama gorevlerinde sinirli etki gorulurken kucuk modeller veya hassas gorevlerde kayip daha belirgin olabilir. **Bir modeli niceleme yapmak icin ne gereklidir?** bitsandbytes veya AutoGPTQ kutuphanesiyle birkaç satirda Python kodla herhangi bir Hugging Face modeli niceleye bilirsiniz; kalibrasyon icin kucuk bir veri kumesi onerilen uygulamalardan biridir. **Quantization modelin egitim verilerini degistirir mi?** Hayir. Niceleme yalnizca cikarim asamasini etkiler; egitim verisi veya egitim sureci degismez. **Hangi modeller niceleye en uyundur?** Buyuk, asiri parametreli modeller genellikle niceleye daha direnclidir; parametreler arasinda islevsel fazlalik bulundugu icin bazi bilgi kaybi tolere edilebilir.
RAFT (Retrieval-Augmented Fine-Tuning) (Geri Getirim Destekli İnce Ayar)
RAFT, 2014 yılında Diego Ongaro ve John Ousterhout tarafından Paxos'a alternatif olarak tasarlanmış, anlaşılırlığı (understandability) birincil tasarım hedefi olarak benimseyen bir dağıtık konsensus algoritmasıdır. Dağıtık sistemlerde birden fazla sunucu birlikte çalışırken ağ bölünmesi veya düğüm arızası durumunda veri tutarsızlığı riski doğabilir; RAFT bu riski üç net alt probleme bölerek çözer: lider seçimi, günlük replikasyonu ve güvenlik garantileri. Lider seçimi mekanizmasında her düğüm başlangıçta izleyici (follower) konumundadır. Belirli bir süre (election timeout) liderden mesaj alamayan düğüm aday (candidate) olur ve diğer düğümlerden oy ister; kendi oyunu da sayarak çoğunluğu alan aday yeni lider olur. Rastgele belirlenen election timeout değerleri aynı anda birden fazla adayın rekabete girmesini önler ve hızlı, belirleyici bir seçim gerçekleşmesini sağlar. Her dönem (term) boyunca en fazla bir lider seçilebilir; bu kural bölünmüş beyin (split-brain) senaryolarına karşı temel güvenlik güvencesidir. Günlük replikasyonunda lider, istemciden bir komut aldığında önce kendi günlüğüne yazar, ardından AppendEntries RPC mesajlarıyla izleyicilere iletir. İzleyiciler tutarlılığı doğrulayıp kabul ederse lider çoğunluk onayını aldıktan sonra girişi commit eder. Commit edilen girişler kalıcıdır: lider değişse bile yeni lider bu girişleri mutlaka taşımak zorundadır; bu özellik günlüğün tüm düğümlerde aynı sırayla büyümesini garanti eder. etcd (Kubernetes'in durum deposu), CockroachDB ve HashiCorp Consul gibi üretim sistemleri RAFT tabanlıdır. Paxos'a kıyasla çok daha anlaşılır olması RAFT'ı modern dağıtık sistemlerin standart konsensus tercihi haline getirmiştir. Güçlü tutarlılık (strong consistency) gerektiren her sistemde RAFT, kanıtlanmış ve güvenilir bir çözüm olarak öne çıkmaktadır. Snapshot mekanizması aracılığıyla büyüyen günlük dosyaları periyodik aralıklarla sıkıştırılabilir; bu özellik uzun ömürlü kümeler için depolama yönetimini önemli ölçüde kolaylaştırır.
Self-Supervised Learning (Öz-Denetimli Öğrenme)
Öz-denetimli öğrenme (self-supervised learning, SSL), modelin etiketsiz verilerden kendi gözetim sinyalini ürettiği bir makine öğrenmesi paradigmasıdır. Veri setinin bir bölümü gizlenerek ya da bozularak yapay bir görev oluşturulur; model bu görevi çözerken verinin iç yapısını, anlamsal ilişkilerini ve temel örüntülerini öğrenir. İnsan etiketlemesine gerek duyulmadan büyük ölçekli veriyle eğitim yapılabilmesi bu yaklaşımı modern yapay zekanın temel taşlarından biri haline getirmektedir. Bu özellik özellikle etiketlemenin maliyetli olduğu tıbbi görüntüleme ve genomik gibi alanlarda kritik bir değer yaratır. Öncül görevler yönteme özgü çeşitlilik gösterir. Metin alanında kelime maskeleme ve sonraki cümle tahmini; görüntü alanında yamaların döndürülmesi, renk kanallarının gizlenmesi ve kontrast öğrenme; ses alanında zaman dilimlerinin karıştırılması veya konuşmacı tanıma görevleri öncül görevlerin başlıca örneklerindendir. Bu görevler aracılığıyla model, downstream görevlere aktarılabilecek zengin ve genelleştirilebilir temsiller öğrenir. Her görev türü modeli farklı soyutlama düzeylerine yönlendirir ve bu çeşitlilik genel amaçlı temsil kalitesini artırır. Öncül görevin seçimi doğrudan downstream performansını belirler. Contrastive öğrenme, öz-denetimli öğrenmenin görüntü alanındaki en etkili kollarından birini oluşturmaktadır. SimCLR, MoCo ve BYOL gibi çerçeveler, aynı görüntünün farklı augmentasyonlarını birbirine yakın, farklı görüntülerin temsillerini ise uzak tutacak biçimde modeli optimize eder. GPT ailesi ise bu paradigmayı dil alanında ileri taşıyarak web ölçekli ham metin üzerinden insan düzeyine yakın akıl yürütme kapasitesi geliştirdi. Öz-denetimli ön eğitim, günümüzde çoklu-modal modellerin de temelini oluşturmakta; görüntü, metin ve ses modalitelerini ortak bir temsil uzayında birleştiren sistemlerin geliştirilmesinde belirleyici rol oynamaktadır. Bu yaklaşımın biyoinformatik, robot öğrenmesi ve iklim modellemesi gibi farklı disiplinlere uyarlanması aktif araştırma konuları arasında yer almaktadır. CLIP gibi çerçeveler öz-denetimli öğrenmenin pratik gücünü açıkça ortaya koymaktadır.
Transfer Learning (Transfer Öğrenme)
Transfer Öğrenme (Transfer Learning), büyük ve kapsamlı veri kümeleriyle önceden eğitilmiş bir modelin öğrendiği bilgiyi, farklı ama ilişkili başka bir göreve aktarma tekniğidir. Geleneksel makine öğrenmesinde her görev için model sıfırdan eğitilirdi; bu yöntem hem milyonlarca etiketli örnek hem de aylarca süren hesaplama gücü gerektiriyordu. Transfer öğrenmede iki temel aşama birbirini tamamlar: ön eğitim (pre-training) ve ince ayar (fine-tuning). Ön eğitim aşamasında model, geniş kapsamlı bir veri kümesiyle genel bilgi edinir. GPT modellerinin internet metinleriyle dil kalıplarını kavraması ya da ResNet'in ImageNet üzerindeki 14 milyon görüntüyle şekil ve doku özelliklerini çıkarması bu aşamaya örnektir. İnce ayar aşamasında ise bu temel model, çok daha küçük ve görev özgü bir veri kümesiyle yeniden optimize edilir; birkaç yüz örnek bile rekabetçi sonuçlar verebilir. Üç ana strateji öne çıkar. Özellik çıkarma (feature extraction) yönteminde ön eğitimli modelin ağırlıkları dondurulur, yalnızca son katman yeni göreve göre eğitilir. Tam ince ayar (full fine-tuning) tüm ağırlıkları günceller ve daha yüksek doğruluk sunar. LoRA ile PEFT ise küçük adaptör matrisleri ekleyerek hesaplama verimliliğini korur; büyük dil modellerinin ince ayarında standart bir yaklaşım haline gelmiştir. Hangi stratejinin seçileceği, mevcut etiketli veri miktarına ve hedef görevin kaynak görevle olan yakınlığına bağlıdır. Günümüzde BERT, RoBERTa ve LLaMA gibi ön eğitimli modeller, Türkçe duygu analizi, tıbbi metin sınıflandırması ve kod üretimi gibi alanlarda az veriyle yüksek başarı oranları sunmaktadır. Kaynak ve hedef görevler arasındaki büyük farklılık "negatif transfer" riskini doğurur; bu nedenle model ve alan seçimi dikkatli yapılmalıdır. Transfer öğrenme, modern yapay zekanın temel bileşenlerinden biri olarak büyük dil modellerinin geniş kitleler tarafından kullanılmasında belirleyici bir rol üstlenmektedir.
Underfitting (Eksik Öğrenme)
Underfitting (yetersiz öğrenme), bir makine öğrenmesi modelinin hem eğitim verisini hem de daha önce hiç görmediği test verisini yeterince iyi öğrenemediği durumu ifade eder. Model, verideki temel örüntüleri ve ilişkileri yakalayacak kapasiteden yoksundur; bu nedenle eğitim hatasının kendisi bile kabul edilemez yüksek kalır. Aşırı öğrenme (overfitting) ile karşılaştırıldığında underfitting daha kolay fark edilir: hem eğitim hem de doğrulama kayıpları yüksek seyreder ve ikisi arasında büyük bir uçurum oluşmaz. Yetersiz öğrenmenin kökeninde çoğunlukla yüksek yanlılık (high bias) yatar. Model, hedef fonksiyonu temsil etmek için gereken matematiksel karmaşıklıktan yoksundur. Doğrusal bir modelle sinüs eğrisini ya da görsel nesne sınıflandırmasını öğrenmek buna tipik örnektir. Bunun yanı sıra fazla agresif L1/L2 düzenlileştirmesi model ağırlıklarını sıfıra iterek öğrenme kapasitesini yok eder. Çok az epoch, çok yüksek öğrenme hızı ya da erken durdurma da benzer sonuçlar üretir. Bias-varyans ikilemi çerçevesinde underfitting, yüksek bias-düşük varyans bölgesine karşılık gelir. Model çok basit olduğundan farklı eğitim kümeleri verseniz bile tahminler tutarlı ama sistematik biçimde yanlış kalır. Öğrenme eğrisi (learning curve) incelendiğinde hem eğitim hem doğrulama kaybının yüksek ve birbirine yakın seyrettiği görülür; daha fazla veri eklemek de bu platoya takılmış performansı iyileştirmez. Teşhis için eğitim kaybını izlemek en güvenilir yöntemdir. Eğitim kaybı tatmin edici bir seviyeye hiç inemiyorsa önce model kapasitesi sorgulanmalıdır. Çözümler arasında mimari karmaşıklığı artırmak (daha fazla katman, nöron veya dikkat başlığı), polinom özellik dönüşümleriyle doğrusal modele zenginlik katmak, düzenlileştirme katsayısını azaltmak, epoch sayısını ve öğrenme oturumunu uzatmak ve alan uzmanlığından yararlanan kapsamlı özellik mühendisliği sayılabilir. Dropout oranı düşürülmeli, erken durdurma kriteri gevşetilmelidir. Modelin karmaşıklığı veri kümesinin büyüklüğüne ve çeşitliliğine orantılı biçimde seçilmelidir; aksi hâlde model hem eğitim hem de test kümesinde yüksek hata oranları sergilemeye devam eder.
Açık Kaynak Model (Açık Kaynak Model)
Açık Kaynak Model (Open-Weight Model), model ağırlıklarının ve çoğunlukla eğitim kodunun kamuya açık biçimde yayımlandığı, araştırmacıların ve geliştiricilerin serbestçe indirip inceleyebileceği, özelleştirip dağıtabileceği yapay zeka modelidir. Kapalı API modellerin aksine açık kaynak modeller dışarıya bağımlılığı ortadan kaldırır, gizlilik açısından hassas verilerin yerel ortamda işlenmesine imkân tanır ve araştırma ekosistemini güçlendirir. Açık kaynak LLM hareketi Meta AI'ın 2023'te LLaMA modelini yayımlamasıyla hız kazandı. LLaMA serisi (LLaMA 2, LLaMA 3), Mistral, Gemma (Google), Phi (Microsoft), Falcon ve DeepSeek bu kategorinin öne çıkan örnekleridir. Bu modeller Hugging Face hub üzerinden dağıtılmakta; GGUF, GPTQ ve AWQ gibi kuantizasyon formatlarıyla tüketici donanımlarında çalıştırılabilmektedir. Açık kaynak modellerin kullanım biçimleri çeşitlidir. Yerel çalıştırma için Ollama ve LM Studio gibi araçlar basit arayüzler sunar. İnce ayar (fine-tuning) ile belirli alanlara veya kurum verilerine özelleştirme yapılır; LoRA ve QLoRA teknikleri bu süreci düşük bellek bütçesiyle mümkün kılar. RAG sistemi kurulumunda açık embedding modelleriyle birleştirilerek gizlilik korunur. Lisanslama açısından dikkat edilmesi gerekir; bazı modeller ticari kullanıma kısıtlama getirir (LLaMA 2'nin kullanıcı sayısı sınırı gibi). Apache 2.0, MIT ve Mistral'ın kendi lisansı gibi permissive lisanslar ticari kullanıma tam açıktır. Model seçiminde kapasite, lisans tipi, kuantizasyon seçenekleri ve topluluk desteği değerlendirilmesi gereken başlıca faktörlerdir. Açık kaynak model ekosistemi hızla büyümektedir. Hugging Face hub'da 800.000'den fazla model bulunmakta; topluluk tarafından geliştirilen adaptörler, değerlendirme kıyaslamaları ve entegrasyon araçları bu büyümeyi hızlandırmaktadır. Araştırma şeffaflığı açısından açık ağırlıklar, model davranışı üzerinde denetlenebilir çalışma yapılmasına imkân tanır. Türkiye'de açık kaynak modeller özellikle Türkçe NLP çalışmalarında ve veri gizliliği gerektiren kurumsal projelerde yaygın tercih haline gelmektedir. KVKK uyumluluğu bağlamında müşteri verilerini işleyen şirketler, verilerin dışarıya çıkmamasını garanti eden yerel model dağıtımını kapalı API çözümlerine tercih etmektedir.
Bias-Variance Tradeoff (Önyargı-Varyans Dengesi)
Bias-variance tradeoff (önyargı-varyans dengesi), makine öğrenimi modellerindeki toplam tahmin hatasını iki temel bileşene ayıran kritik bir istatistiksel kavramdır. **Önyargı (Bias)**, modelin gerçek veri dağılımı hakkında yaptığı yanlış varsayımlardan kaynaklanan sistemik hatadır. Yüksek önyargılı modeller çok basit olup veri içindeki gerçek örüntüleri yakalayamaz; bu durum yetersiz öğrenmeye (underfitting) yol açar. Örneğin, gerçekte ikinci dereceden bir ilişkiyi doğrusal bir model ile temsil etmeye çalışmak yüksek önyargıya neden olur. **Varyans**, modelin eğitim verilerindeki küçük dalgalanmalara duyarlılığını ölçer. Yüksek varyanslı modeller eğitim setini ezberler; ancak daha önce görülmemiş verilere iyi genelleşemez, bu da aşırı öğrenmeye (overfitting) yol açar. Çok derin sinir ağları veya büyük karar ağaçları bu riski taşır. Toplam tahmin hatası şu şekilde ayrıştırılır: Toplam Hata = Önyargı² + Varyans + İndirgenemez Gürültü İndirgenemez gürültü, verinin doğasındaki rastgelelikten gelir ve hiçbir model tarafından elimine edilemez. Bu dengeyi yönetmek için çeşitli teknikler kullanılır: Düzenlileştirme (L1/L2 regularization) modelin karmaşıklığını kısıtlayarak varyansı düşürür; çapraz doğrulama doğru model karmaşıklığını seçmeye yardımcı olur; bagging gibi topluluk yöntemleri varyansı azaltırken, boosting yöntemleri önyargıyı hedefler. Daha fazla eğitim verisi toplamak da varyansı düşürmenin pratik bir yoludur. Bias-variance tradeoff, her veri bilimcisinin ve makine öğrenimi mühendisinin iyi anlaması gereken temel bir kavramdır; model seçimi ve hiperparametre ayarlamanın merkezinde yer alır.
Hiperparametre (Hiperparametre)
Hiperparametre, bir makine öğrenimi modelinin eğitim sürecini dışarıdan yöneten ve eğitim başlamadan önce belirlenmesi gereken yapılandırma değişkenidir. Öğrenme hızı (learning rate), katman sayısı, gizli birim sayısı, batch boyutu, dropout oranı ve regularizasyon katsayısı bunun başlıca örnekleridir. Model parametrelerinden temel farkı şudur: parametreler (ağırlıklar, bias değerleri) eğitim sırasında gradyan inişiyle otomatik olarak güncellenir; hiperparametreler ise öğrenme algoritmasının dışındadır ve araştırmacı ya da otomatik bir arama süreci tarafından belirlenir. Yanlış ayarlanmış bir hiperparametre, model ne kadar güçlü olursa olsun yetersiz öğrenmeye (underfitting) veya eğitim verisini ezberlemeye (overfitting) yol açar. Öğrenme hızı çok yüksek ayarlandığında model ıraksar; çok düşük olduğunda ise eğitim aşırı yavaşlar ve yerel minimumlara takılır. Bu nedenle hiperparametre optimizasyonu (HPO), başarılı bir ML projesinin ayrılmaz parçasıdır. Günümüzde Optuna, Ray Tune ve Weights & Biases Sweeps gibi kütüphaneler bu süreci otomatikleştirir. Büyük dil modeli eğitimlerinde hiperparametre seçimi milyarlarca dolarlık hesaplama bütçelerini doğrudan etkiler; bu yüzden küçük proxy modeller üzerinde yapılan HPO denemeleri, maliyeti kısıtlamak için kritik bir strateji haline gelmiştir. Transformer mimarisinde hiperparametre uzayı geleneksel derin öğrenme modellerine kıyasla çok daha geniştir: dikkat başlığı sayısı (num_attention_heads), gömme boyutu (d_model), ileri besleme katmanı genişliği (d_ff) ve bağlam penceresi uzunluğu (context length) birbirine bağlı değerlerdir. Araştırmalar d_model ile num_attention_heads arasındaki 64:1 oranının çoğu görevde iyi bir başlangıç noktası olduğunu göstermektedir. Bu nedenle yalnızca öğrenme hızını optimize etmek yetmez; mimariye özgü değerler de sistematik biçimde keşfedilmelidir. Hiperparametre duyarlılık analizi, hangi değişkenlerin modeli en çok etkilediğini belirlemeye yarar; önemsiz boyutları sabitleyip kritik olanlara odaklanmak arama süresini önemli ölçüde kısaltır. Bütçe kısıtlı projelerde deneyimli pratisyenlerin kullandığı başlangıç değerleri bunun tipik örnekleridir: öğrenme hızı için 3e-4 (yaygın olarak Karpathy sabiti adıyla anılır), weight decay için 0.1, dropout oranı için 0.1. Bu değerlerden başlayıp küçük kapsamlı bir arama ile kendi veri setine göre rafine etmek mühendislik maliyetini minimize eder.