tag PEFT
Fine-Tuning (İnce Ayar)
Bu sayfada PEFT (Fine-Tuning (İnce Ayar)) etiketi ile işaretlenmiş 6 yapay zeka kavramını bulabilirsiniz.
Fine-tuning (ince ayar), genel amaçlı büyük bir modeli, belirli bir görev veya alan için özelleştirmek amacıyla ek veriyle yeniden eğitme sürecidir. Temel modeller (foundation models), devasa metin ya da görüntü külliyatlarıyla ön eğitimden geçirilir; bu sayede dilin gramerini, mantığını ve genel bilgiyi kodlarlar. Ancak bir şirketin müşteri hizmetleri tonunu benimseyen, belgelerini hep aynı JSON şemasında döndüren ya da tıbbi terminolojiyi hatasız kullanan özel bir modele ihtiyaç duyulduğunda sıfırdan eğitim hem maliyetli hem de veri açısından olanaksız olabilir. İnce ayar, bu boşluğu doldurur: mevcut ağırlıkları başlangıç noktası olarak kullanır ve yeni veriye göre hafifçe güncelleyerek modelin davranışını, biçimini ve üslubunu kalıcı biçimde özelleştirir. Fine-tuning yöntemleri hesaplama maliyeti ve adaptasyon derinliği açısından farklılaşır. Tam ince ayar (full fine-tuning), modelin tüm parametrelerini günceller; maksimum adaptasyon gücü sunarken çok yüksek GPU belleği ve uzun eğitim süresi gerektirir. Catastrophic forgetting (felaketi unutma) da önemli bir risktir: model yeni bilgiyi öğrenirken eski bilgilerini yitirebilir. PEFT (Parameter-Efficient Fine-Tuning) yöntemleri bu sorunu çözmek için parametrelerin büyük çoğunluğunu dondurur ve yalnızca küçük bir alt kümeyi günceller. LoRA (Low-Rank Adaptation), katmanlar arasına düşük sıralı ek matrisler yerleştirerek orijinal ağırlıklara dokunmadan öğrenmeyi mümkün kılar. QLoRA ise temel modeli 4-bit'e kuantize edip üzerine LoRA uygulayarak 65 milyar parametreli modelleri bile tek bir tüketici sınıfı GPU'da eğitmeye elverişli hale getirir. İnce ayarın avantajları net ve ölçülebilirdir: prompt'la her istekte yeniden tarif edilmesi gereken kurallar modelin doğal davranışı haline gelir; bu hem token maliyetini düşürür hem de çıktı tutarlılığını artırır. Kurumsal kullanımda açık kaynak modeller kendi sunucularda ince ayardan geçirilerek hassas veriler üçüncü taraf API'lere aktarılmadan uzman model elde edilir. Eğitim verisi kalitesi ve miktarı, ince ayarın başarısını doğrudan belirleyen en kritik etkenlerdir.
Fine-Tuning (İnce Ayar)
Fine-tuning (ince ayar), genel amaçlı büyük bir modeli, belirli bir görev veya alan için özelleştirmek amacıyla ek veriyle yeniden eğitme sürecidir. Temel modeller (foundation models), devasa metin ya da görüntü külliyatlarıyla ön eğitimden geçirilir; bu sayede dilin gramerini, mantığını ve genel bilgiyi kodlarlar. Ancak bir şirketin müşteri hizmetleri tonunu benimseyen, belgelerini hep aynı JSON şemasında döndüren ya da tıbbi terminolojiyi hatasız kullanan özel bir modele ihtiyaç duyulduğunda sıfırdan eğitim hem maliyetli hem de veri açısından olanaksız olabilir. İnce ayar, bu boşluğu doldurur: mevcut ağırlıkları başlangıç noktası olarak kullanır ve yeni veriye göre hafifçe güncelleyerek modelin davranışını, biçimini ve üslubunu kalıcı biçimde özelleştirir. Fine-tuning yöntemleri hesaplama maliyeti ve adaptasyon derinliği açısından farklılaşır. Tam ince ayar (full fine-tuning), modelin tüm parametrelerini günceller; maksimum adaptasyon gücü sunarken çok yüksek GPU belleği ve uzun eğitim süresi gerektirir. Catastrophic forgetting (felaketi unutma) da önemli bir risktir: model yeni bilgiyi öğrenirken eski bilgilerini yitirebilir. PEFT (Parameter-Efficient Fine-Tuning) yöntemleri bu sorunu çözmek için parametrelerin büyük çoğunluğunu dondurur ve yalnızca küçük bir alt kümeyi günceller. LoRA (Low-Rank Adaptation), katmanlar arasına düşük sıralı ek matrisler yerleştirerek orijinal ağırlıklara dokunmadan öğrenmeyi mümkün kılar. QLoRA ise temel modeli 4-bit'e kuantize edip üzerine LoRA uygulayarak 65 milyar parametreli modelleri bile tek bir tüketici sınıfı GPU'da eğitmeye elverişli hale getirir. İnce ayarın avantajları net ve ölçülebilirdir: prompt'la her istekte yeniden tarif edilmesi gereken kurallar modelin doğal davranışı haline gelir; bu hem token maliyetini düşürür hem de çıktı tutarlılığını artırır. Kurumsal kullanımda açık kaynak modeller kendi sunucularda ince ayardan geçirilerek hassas veriler üçüncü taraf API'lere aktarılmadan uzman model elde edilir. Eğitim verisi kalitesi ve miktarı, ince ayarın başarısını doğrudan belirleyen en kritik etkenlerdir.
LoRA (Low-Rank Adaptation) (Düşük Dereceli Adaptasyon)
LoRA (Low-Rank Adaptation), milyarlarca parametreli büyük dil modellerini (LLM) veya görsel difüzyon modellerini son derece verimli biçimde ince ayarlayan (fine-tune) bir parametre etkin tekniktir. Orijinal ağırlık matrislerini dondurarak yalnızca küçük ek matrisler eğiten bu yaklaşım, tam ince ayara kıyasla eğitim için gereken GPU belleğini ve hesaplama süresini dramatik ölçüde azaltır. Bu sayede tüketici sınıfı donanımlar üzerinde büyük ölçekli model uyarlaması mümkün hale gelir. Tekniğin matematiksel temeli düşük ranklı matris ayrışımına dayanır. Ağırlık güncellemesi ΔW = A × B olarak ifade edilir; burada A (d×r) ve B (r×d) boyutlarındaki küçük matrisler yalnızca r rank boyutunu eğitir. Eğitim başında A Gaussian dağılımla, B ise sıfırla başlatılır; böylece başlangıçta LoRA katkısı sıfır olur ve taban modelin davranışı bozulmaz. Çıkarım sırasında eğitilen matrisler W + (α/r) × BA formülüyle taban modele eklenir; bu işlem ek gecikme yaratmaz ve ayrı adaptör dosyaları farklı görevler için kolayca değiştirilebilir. Varyantlar arasında QLoRA özellikle dikkat çekmektedir. Taban modeli 4-bit NF4 ile nicemlendirerek belleğe yükleyen bu yöntem, 65 milyar parametreli bir modeli tek bir 48 GB GPU'ya sığdırabilmektedir; LoRA adaptörleri ise tam hassasiyetle eğitilir. AdaLoRA her katmana önem skoruna göre dinamik rank atarken DoRA ağırlığı büyüklük ve yön bileşenlerine ayırarak tam ince ayara daha yakın davranış sergiler. rsLoRA yüksek rank değerlerinde kararlı eğitim için rank normalizasyonu uygular. LoRA+ ise A ve B matrislerine farklı öğrenme hızları atayarak yakınsama hızını artırır. Görsel üretim alanında LoRA, belirli sanatçı stillerini, karakter yüzlerini veya nesne tarzlarını 10-50 görüntüyle modele öğretmek için kullanılır. Civitai platformunda on binlerce topluluk LoRA'sı ücretsiz paylaşılmakta; A1111 ve ComfyUI gibi arayüzler bu ağırlıkları çalışma zamanında kolayca yüklemeyi desteklemektedir. FLUX.1 modeli için LoRA eğitimi artık Replicate ve Hugging Face üzerinden çevrimiçi de yapılabilmektedir. Hugging Face PEFT kütüphanesi birkaç satır kodla herhangi bir Transformer mimarisine LoRA eklemek için standart araç haline gelmiştir.
Prompt Tuning (İstem Ayarlama (Soft Prompting))
Prompt Tuning, büyük dil modellerini (LLM) belirli bir göreve uyarlamak için model ağırlıklarını tamamen güncellemek yerine yalnızca küçük bir 'yumuşak istem' (soft prompt) vektörünü optimize eden bir Parameter-Efficient Fine-Tuning (PEFT) tekniğidir. 2021 yılında Google araştırmacıları Brian Lester, Rami Al-Rfou ve Noah Constant tarafından önerilmiş; T5-11B ölçeğindeki modellerde tam fine-tuning ile rekabet edebildiği gösterilmiştir. Geleneksel fine-tuning yöntemlerinde milyarlarca parametre yeniden eğitilirken, prompt tuning yalnızca giriş katmanına eklenen öğrenilebilir vektörleri (soft token) günceller. Bu vektörler insan tarafından okunabilen kelimeler değildir; modelin kendi embedding uzayında gradyan inişiyle optimize edilmiş sayısal temsillerdir. Model ağırlıklarının tamamı dondurulmuş halde kalır; bu sayede aynı temel model, farklı görevler için farklı soft prompt'larla verimli biçimde çalıştırılabilir. Yöntemin en önemli avantajı hesaplama verimliliğidir: tam fine-tuning'e kıyasla eğitilmesi gereken parametre sayısı dramatik biçimde azalır; daha az GPU belleği, daha kısa eğitim süresi ve her görev için yalnızca küçük bir vektörün depolanması yeterlidir. Özellikle model ağırlıklarına doğrudan erişimin mümkün olmadığı API tabanlı senaryolarda bu özellik büyük pratik değer taşır. Pratik uygulamalarda iki önemli kısıtlama göze çarpar: model boyutu küçüldükçe (10 milyarın altında parametre) tam fine-tuning'e göre performans açığı belirginleşir; giriş bağlam uzunluğunun bir kısmı soft token'lara tahsis edildiğinden kullanılabilir bağlam penceresi de daralmaktadır. Üstelik soft prompt'lar yorumlanamaz olduğundan hata ayıklaması güçleşebilir. Prompt tuning ailesi birkaç önemli varyant içerir: Prefix Tuning her transformer katmanına öğrenilebilir vektörler ekleyerek daha güçlü yönlendirme sağlar; P-Tuning doğal dil anlama görevlerine odaklanır; Multi-Task Prompt Tuning paylaşılan tek bir prompt'u birden fazla görev için eş zamanlı optimize eder. Bu varyantlar, LoRA ile birlikte günümüzde en yaygın kullanılan PEFT teknikleri arasındadır.
QLoRA (QLoRA (Nicel Düşük Sıralı Uyarlama))
QLoRA (Quantized Low-Rank Adaptation), büyük dil modellerini sınırlı GPU belleğiyle ince ayarlamayı mümkün kılan bir parametre-etkin öğrenme tekniğidir. Tim Dettmers ve ekibi tarafından 2023 NeurIPS konferansında sunulan bu yöntem, modeli 4-bit kuantize ederek dondurur; ardından üzerine küçük LoRA adaptörleri eğitir. Temel model ağırlıkları hiçbir zaman güncellenmez — gradyanlar yalnızca adaptörlerden geçer. Tekniğin üç temel yeniliği şöyle açıklanabilir: **4-bit NormalFloat (NF4):** Sinir ağı ağırlıkları çoğunlukla sıfır merkezli normal dağılım gösterir. NF4, bu dağılıma göre tasarlanmış bilgi teorisi açısından optimal bir kuantizasyon veri tipidir. Standart INT4'ün yaklaşık bir puan üzerinde MMLU doğruluğu elde eder. **Çift Kuantizasyon:** İlk kuantizasyon adımında üretilen sabitlerin kendisi de ikinci kez kuantize edilir. Bu ekstra adım parametre başına ortalama 0,37 bit tasarruf yaratır ve 65 milyar parametreli bir modelde yaklaşık 3 GB ek bellek kazandırır. **Sayfalı Optimize Ediciler:** NVIDIA'nın birleşik bellek altyapısını kullanan bu mekanizma, GPU belleği dolduğunda optimizasyon durumlarını CPU RAM'ine aktarır; böylece uzun dizilerde yaşanan bellek taşması hatalarını önler. Bellek tasarrufu dramatiktir: 65 milyar parametreli bir modelin tam ince ayarı için yaklaşık 1 TB GPU belleği gerekirken QLoRA bunu tek bir 48 GB'lık GPU'ya sığdırır. 7B-8B parametreli modeller ise 10 GB'ın altında VRAM ile, yani RTX 3090 veya RTX 4090 gibi tüketici kartlarıyla eğitilebilir hale gelir. Çalışma zamanında 4-bit ağırlıklar geçici olarak BF16 formatına dönüştürülür, hesaplama yapılır ve atar; yani kalıcı olarak yüksek hassasiyetle saklanmaz. Bu tasarım kararı belleği minimize ederken kaliteyi korur. QLoRA, LLaMA, Mistral, Qwen ve Gemma dahil pratik olarak tüm dönüştürücü tabanlı modellerle çalışır. Araştırmacılar ve geliştiriciler bu yöntemi etki alanı uyarlaması, talimat ayarlaması ve RLHF tarzı hizalama görevleri için yoğun biçimde kullanmaktadır.
Adapter Tuning (Adapter Eğitimi)
Adapter tuning (adapter eğitimi), önceden eğitilmiş büyük dil ve görü modellerini yeni bir göreve uyarlarken modelin kendi ağırlıklarına hiç dokunmayan, bunun yerine transformer katmanlarının arasına eklenen küçük öğrenilebilir modülleri (adapter) eğiten parametre-etkin ince ayar (PEFT) yöntemidir. Yöntem 2019 yılında Google'dan Houlsby ve arkadaşlarının "Parameter-Efficient Transfer Learning for NLP" çalışmasıyla yaygınlaştı. Bu tasarımda her transformer bloğunun içine, çok başlı dikkat ve ileri besleme alt katmanlarının çıkışına, darboğaz (bottleneck) yapısında iki küçük ağ yerleştirilir. Adapter, gelen d boyutlu gizli vektörü çok daha küçük bir r boyutuna indirir, doğrusal olmayan bir aktivasyondan geçirir, tekrar d boyutuna çıkarır ve sonucu artık (residual) bağlantıyla girişe ekler. Başlangıçta kimlik dönüşümüne yakın davrandığı için eğitim, temel modelin davranışını bozmadan başlar. Eğitim sırasında yalnızca adapter parametreleri ile katman normalizasyonu gibi birkaç küçük bileşen güncellenir; geri kalan yüz milyonlarca ya da milyarlarca ağırlık dondurulur. Houlsby ve ekibi BERT-large ile GLUE deneylerinde, görev başına yalnızca yüzde 3,6 ek parametreyle tam ince ayarın 0,4 puan yakınına ulaştıklarını raporladı. Darboğaz boyutu küçüldükçe bu oran yüzde birin altına iner. Adapter'ların asıl gücü modülerliktir. Her görev için ayrı bir adapter dosyası eğitilir, aynı temel model üzerinde onlarca adapter yan yana saklanır ve çıkarım anında istenen adapter yüklenir. Bu yapı, tek bir model kopyasıyla çok görevli servis kurmayı, hassas görev verisini temel modele işlemeden paylaşmayı ve yeni görev eklerken eski görevlerde felaket unutma yaşamamayı mümkün kılar. AdapterHub platformu, adapters kütüphanesi, MAD-X ve AdapterFusion gibi uzantılarla birlikte çok dilli transfer ve görevler arası bilgi birleştirme için hazır bir ekosistem sunar. LoRA ile karşılaştırıldığında adapter, ağırlık matrislerine düşük rankli bir güncelleme eklemek yerine katman sırasına yeni bir blok sokar; bu nedenle çıkarımda küçük ama ölçülebilir bir gecikme payı vardır ve ağırlıklarla birleştirilemez. Buna karşılık adapter'lar tak-çıkar biçimde bir araya getirilebilir, üst üste istiflenebilir ve dil ile görev bilgisini ayrı modüllerde tutabilir. Gecikmenin kritik olduğu servislerde LoRA, modülerliğin ve paylaşımın öne çıktığı senaryolarda ise adapter tuning daha uygun bir tercihtir.
Prefix-Tuning (Önek Ayarlama (Prefix-Tuning))
Prefix-Tuning (Önek Ayarlama), büyük dil modellerini yeni bir göreve uyarlarken modelin tüm ağırlıklarını dondurup yalnızca her transformer katmanının dikkat mekanizmasına eklenen kısa, öğrenilebilir vektör dizilerini (prefix) eğiten parametre verimli ince ayar (PEFT) yöntemidir. Yöntem, 2021 yılında Stanford Üniversitesi'nden Xiang Lisa Li ve Percy Liang tarafından "Prefix-Tuning: Optimizing Continuous Prompts for Generation" başlıklı makaleyle önerildi. Temel fikir, elle yazılan istemlerin (prompt) yerine gradyan inişiyle optimize edilen sürekli vektörler kullanmaktır; bu vektörler sözlükte karşılığı olmayan "sanal token"lar gibi davranır ve modelin dikkatini görev için doğru bağlama yönlendirir. Teknik olarak prefix, her katmandaki anahtar (key) ve değer (value) matrislerinin önüne eklenen sabit uzunlukta bir gizli durum dizisidir. Eğitim sırasında yalnızca bu diziler gradyan güncellemesi alır; GPT-2 veya BART gibi temel modelin milyonlarca ya da milyarlarca parametresi olduğu gibi kalır. Li ve Liang'ın deneylerinde toplam parametrelerin yaklaşık yüzde 0,1'i eğitilerek tablodan metne üretim ve özetleme görevlerinde tam ince ayara yakın sonuçlar elde edildi; az veri bulunan senaryolarda ve eğitimde görülmemiş konulara genelleme yaparken prefix-tuning tam ince ayarı geride bıraktı. Bu yaklaşımın en somut faydası çok görevli dağıtımda görülür. Tek bir temel model bellekte tutulur, her görev için yalnızca birkaç megabaytlık prefix dosyası saklanır ve istek geldiğinde ilgili prefix yüklenir. Böylece bir kurum aynı modeli özetleme, soru üretimi ve rapor yazımı gibi farklı işler için tam kopya oluşturmadan kullanabilir. Prefix-Tuning, yalnızca giriş katmanına vektör ekleyen Prompt Tuning'den daha derin bir müdahale sunar; ağırlık matrislerine düşük rankli güncelleme ekleyen LoRA'dan ise mekanizma olarak ayrılır. Günümüzde Hugging Face PEFT kütüphanesi bu yöntemi doğrudan destekler ve P-Tuning v2 gibi türevleri aynı fikri sınıflandırma görevlerine de taşımıştır.