tag ince-ayar
DreamBooth (DreamBooth)
Bu sayfada ince-ayar (DreamBooth (DreamBooth)) etiketi ile işaretlenmiş 4 yapay zeka kavramını bulabilirsiniz.
DreamBooth, Google Research tarafından 2022 yılında geliştirilen ve yalnızca 3-5 referans görüntüyle metin-görüntü difüzyon modellerini belirli bir özneye özgü olarak kişiselleştiren ince ayar (fine-tuning) tekniğidir. Nataniel Ruiz ve arkadaşları tarafından yayımlanan orijinal makalede tekniğin temel amacı, özne güdümlü üretim (subject-driven generation) olarak tanımlanmıştır. DreamBooth'un çalışma prensibi, modelin sözlüğüne yeni bir kavram yerleştirmeye dayanır. Bu amaçla girdi görüntüleri, dilde nadir kullanılan benzersiz bir metin belirteci (token) içeren bir istemle eşleştirilir. Örneğin "a sks dog" gibi bir istem, "sks" belirtecini yalnızca bu özneyle ilişkilendirir. Eğitim tamamlandığında bu özel belirteç, modelin doğal dil anlayışıyla birleşerek özneyi farklı sahnelerde, stillerde ve ışık koşullarında tutarlı biçimde üretmesine olanak tanır. Tekniğin en kritik bileşeni, sınıf önceli koruma kaybı (class-specific prior preservation loss) mekanizmasıdır. Standart ince ayar sırasında model, yalnızca birkaç referans görüntüye aşırı uyum sağlayarak genel bilgisini yitirebilir; bu fenomen dil kayması (language drift) ya da yıkıcı unutma (catastrophic forgetting) olarak bilinir. Prior preservation kaybı, modeli eş zamanlı olarak aynı sınıftan genel örnekler üretmeye teşvik ederek bu sorunu önler ve modelin üretim çeşitliliğini korur. DreamBooth, tüm U-Net difüzyon modelini ince ayara tabi tuttuğundan LoRA gibi hafif alternatiflere kıyasla daha yüksek kimlik tutarlılığı sağlar; ancak her yeni özne için ayrı bir model ağırlıkları seti (2-4 GB) gerektirir. Bu depolama yükünü azaltmak amacıyla DreamBooth + LoRA kombinasyonu (DreamBooth-LoRA) giderek yaygınlaşmaktadır: tüm model yerine yalnızca düşük boyutlu adaptör matrisleri güncellenerek dosya boyutu yaklaşık 150 MB düzeyine indirilebilmektedir. Uygulama tarafında Hugging Face diffusers kütüphanesi, Kohya-ss arayüzü ve Automatic1111 eklentisi gibi topluluk araçları DreamBooth eğitimini erişilebilir kılar. Stable Diffusion 1.5 ve SDXL'in yanı sıra 2024-2025 döneminde yaygınlaşan Flux.1 modeli de DreamBooth ile ince ayarlanabilmektedir. Yapay zeka topluluğunda karakter tutarlılığı, ürün fotoğrafçılığı, sanatsal portre üretimi ve kişisel avatar oluşturma gibi alanlarda geniş çaplı kullanıma sahiptir.
DreamBooth (DreamBooth)
DreamBooth, Google Research tarafından 2022 yılında geliştirilen ve yalnızca 3-5 referans görüntüyle metin-görüntü difüzyon modellerini belirli bir özneye özgü olarak kişiselleştiren ince ayar (fine-tuning) tekniğidir. Nataniel Ruiz ve arkadaşları tarafından yayımlanan orijinal makalede tekniğin temel amacı, özne güdümlü üretim (subject-driven generation) olarak tanımlanmıştır. DreamBooth'un çalışma prensibi, modelin sözlüğüne yeni bir kavram yerleştirmeye dayanır. Bu amaçla girdi görüntüleri, dilde nadir kullanılan benzersiz bir metin belirteci (token) içeren bir istemle eşleştirilir. Örneğin "a sks dog" gibi bir istem, "sks" belirtecini yalnızca bu özneyle ilişkilendirir. Eğitim tamamlandığında bu özel belirteç, modelin doğal dil anlayışıyla birleşerek özneyi farklı sahnelerde, stillerde ve ışık koşullarında tutarlı biçimde üretmesine olanak tanır. Tekniğin en kritik bileşeni, sınıf önceli koruma kaybı (class-specific prior preservation loss) mekanizmasıdır. Standart ince ayar sırasında model, yalnızca birkaç referans görüntüye aşırı uyum sağlayarak genel bilgisini yitirebilir; bu fenomen dil kayması (language drift) ya da yıkıcı unutma (catastrophic forgetting) olarak bilinir. Prior preservation kaybı, modeli eş zamanlı olarak aynı sınıftan genel örnekler üretmeye teşvik ederek bu sorunu önler ve modelin üretim çeşitliliğini korur. DreamBooth, tüm U-Net difüzyon modelini ince ayara tabi tuttuğundan LoRA gibi hafif alternatiflere kıyasla daha yüksek kimlik tutarlılığı sağlar; ancak her yeni özne için ayrı bir model ağırlıkları seti (2-4 GB) gerektirir. Bu depolama yükünü azaltmak amacıyla DreamBooth + LoRA kombinasyonu (DreamBooth-LoRA) giderek yaygınlaşmaktadır: tüm model yerine yalnızca düşük boyutlu adaptör matrisleri güncellenerek dosya boyutu yaklaşık 150 MB düzeyine indirilebilmektedir. Uygulama tarafında Hugging Face diffusers kütüphanesi, Kohya-ss arayüzü ve Automatic1111 eklentisi gibi topluluk araçları DreamBooth eğitimini erişilebilir kılar. Stable Diffusion 1.5 ve SDXL'in yanı sıra 2024-2025 döneminde yaygınlaşan Flux.1 modeli de DreamBooth ile ince ayarlanabilmektedir. Yapay zeka topluluğunda karakter tutarlılığı, ürün fotoğrafçılığı, sanatsal portre üretimi ve kişisel avatar oluşturma gibi alanlarda geniş çaplı kullanıma sahiptir.
Reward Model (Ödül Modeli)
Ödül modeli (Reward Model, RM), insanların tercihlerini veya değerlerini sayısal bir ödül sinyaline dönüştüren ve pekiştirmeli öğrenme ile dil modeli hizalama süreçlerinde kullanılan bir sinir ağıdır. RLHF (Reinforcement Learning from Human Feedback) boru hattının ikinci aşamasını oluşturur ve GPT-4, Claude ve Gemini gibi üretim modellerinin temelinde yer alır. Eğitim süreci şöyle çalışır: Bir politika modelinin ürettiği aynı isteğe karşılık gelen birden fazla yanıt, insan değerlendiriciler tarafından tercih sıralamasına konur. Ödül modeli, bu tercih çiftlerini kullanarak hangi yanıtın hangisine göre daha iyi olduğunu öğrenir. Genellikle Bradley-Terry modelini temel alan bir kayıp fonksiyonu kullanılır: model, tercih edilen yanıta yüksek skor, reddedilen yanıta düşük skor vermeyi öğrenir. L = -log(σ(r_w - r_l)) formülü bu ilişkiyi matematiksel olarak ifade eder. Eğitilmiş ödül modeli, daha sonra PPO gibi RL algoritmasıyla birleştirilir: Politika modeli yanıt üretirken ödül modeli üretilen yanıtı puanlar ve bu puan politika modelinin güncellenmesinde kullanılır. Böylece insan değerlendiricilerin her eğitim adımında tekrar geri bildirim vermesi gerekmez; ödül modeli insan tercihlerini 'dondurulmuş' hâlde temsil eder. KL sapma penaltısı, modelin SFT temel çizgisinden aşırı uzaklaşmasını frenleyerek ödül hacklemesini önler. Ödül hacklemesi (reward hacking), modelin gerçek kalite yerine ödül modelini yanıltmayı öğrenmesi sorunudur. Çok uzun yanıtlar, aşırı kibar ifadeler veya anlamsız tekrarlar yüksek puan alabilir. Constitutional AI ve Direct Preference Optimization (DPO), ayrı bir ödül modeli gerektirmeden tercih hizalaması yaparak bu bağımlılığı azaltan alternatif yaklaşımlardır. DPO özellikle daha düşük hesaplama maliyetiyle benzer hizalama kalitesine ulaşabildiği için 2024-2025'te yaygınlaşmıştır. Uygulamada ödül modelinin kalitesi, nihai modelin davranışını doğrudan etkiler: yetersiz ya da önyargılı tercih verisiyle eğitilen bir ödül modeli, politika modelini istenmeyen yönlere yönlendirebilir. Bu nedenle veri çeşitliliği, değerlendirici eğitimi ve ödül modelinin düzenli yeniden eğitimi üretim ölçeğinde kritik operasyonel gereksinimlerdir.
SFT (Supervised Fine-Tuning (Denetimli İnce Ayar))
SFT (Supervised Fine-Tuning — Denetimli İnce Ayar), önceden eğitilmiş (pretrained) bir dil modelinin, yüksek kaliteli (istek, yanıt) çiftlerinden oluşan bir veri kümesiyle talimat izleme yeteneği kazandırmak amacıyla ek eğitime tabi tutulması sürecidir. RLHF boru hattının ilk hizalama adımını oluşturur ve GPT-4, Claude, Llama-2-Chat gibi modellerin temelinde yer alır. Ön eğitim (pretraining) sırasında model yalnızca sonraki kelimeyi tahmin etmeyi öğrenir; bu model herhangi bir talimatı takip edemez. SFT aşamasında model, 'Bu metni özetle → Metin: ... → Özet: ...' biçimindeki çiftlerle eğitilir. Standart dil modellemesi kaybı (cross-entropy) kullanılır; ancak yalnızca yanıt tokenleri için kayıp hesaplanır — istek tokenleri maskelenir. Bu maskeleme ile model yanıt üretmeyi öğrenir, isteği yinelemez. SFT veri kümesinin kalitesi, miktarından çok daha kritiktir. InstructGPT'de OpenAI, yalnızca birkaç on bin örneğin yeterli olduğunu göstermiştir. Alpaca projesinde 52.000 GPT-4 üretimi sentetik örnek kullanılmış; bu, insan yazımı veriyle kıyaslanabilir sonuçlar vermiştir. Modern yaklaşımlar büyük LLM'lerle sentetik veri üretimini ve filtrelemesini içerir. SFT araçları açısından Axolotl ve Unsloth, LoRA/QLoRA ile tüketici GPU'larında verimli fine-tuning yapılmasına imkân tanır; Hugging Face TRL kütüphanesi SFTTrainer sınıfı aracılığıyla süreci standartlaştırır. Tek bir RTX 4090 üzerinde 7B modelin LoRA ile SFT eğitimi saatler içinde tamamlanabilir. SFT, DPO veya RLHF öncesinde zorunlu temel adımdır; bazı durumlarda SFT tek başına yeterince iyi chat modelleri üretmektedir. Llama ve Mistral tabanlı topluluk modellerinin büyük çoğunluğu yalnızca SFT ile oluşturulmaktadır. Chat GPT'nin ilk sürümleri dahil birçok öncü model, SFT'nin şaşırtıcı derecede güçlü bir hizalama tekniği olduğunu kanıtlamıştır. Verinin çeşitliliği — kodlama, çeviri, özetleme, soru-cevap, çok adımlı akıl yürütme — modelin genel talimat izleme kapasitesini genişletir. Tek alan veriyle SFT, modelin diğer alanlardaki performansını düşürebilir (catastrophic forgetting); bu nedenle genel amaçlı fine-tuning'de veri çeşitliliği vazgeçilmezdir.
GRPO (Grup Göreli Politika Optimizasyonu)
GRPO (Group Relative Policy Optimization / Grup Göreli Politika Optimizasyonu), büyük dil modellerini pekiştirmeli öğrenme ile ince ayarlamak için geliştirilmiş verimli bir algoritmadır. İlk olarak DeepSeek'in 2024 tarihli DeepSeekMath makalelerinde tanıtılan bu yöntem, Ocak 2025'te yayımlanan DeepSeek-R1 modeli sayesinde geniş yapay zeka camiasının dikkatini çekti. Geleneksel PPO (Proximal Policy Optimization) yönteminde, ince ayar sürecinde politika modelinin yanı sıra ayrı bir değer (critic) modeli de eğitilir. Bu değer modeli, belirli bir durum için beklenen kümülatif ödülü tahmin eder ve öğrenme sinyalini kararlı kılar. Ancak bu yaklaşım, politika modeli kadar parametre içerebilen ikinci bir modelin GPU belleğine ve hesaplama kaynaklarına sığdırılmasını gerektirir. GRPO, bu değer modelini tamamen ortadan kaldırır ve yerine grup tabanlı bir karşılaştırma mekanizması koyar. GRPO'nun çalışma mekanizması şöyledir: Eğitim sırasında her sorgu için politika modeli birden fazla (genellikle 4 ila 16) bağımsız yanıt örnekler. Her yanıt, kural tabanlı veya model tabanlı bir ödül fonksiyonu tarafından puanlanır; matematik sorularında doğru cevap kontrol edilebilir, kod sorularında birim testleri çalıştırılabilir, biçim uygunluğu değerlendirilebilir. Her yanıtın avantajı, grup içindeki ortalama ödül çıkarılarak ve grubun standart sapmasına bölünerek hesaplanır. Bu normalize edilmiş avantajlar, PPO'nun kırpılmış politika gradyanı güncelleme kuralıyla birleştirilir ve model parametreleri güncellenir. GRPO'nun başlıca avantajları şunlardır: Değer modeli eğitilmediğinden GPU belleği ve hesaplama maliyeti önemli ölçüde azalır; bu da daha büyük politika modelleriyle ya da daha dar bütçelerle çalışmayı mümkün kılar. Grup içi karşılaştırma, modelin kendi üretimlerini birbirleriyle kıyaslamasını sağlar ve daha tutarlı bir öğrenme sinyali oluşturur. Kural tabanlı ödül fonksiyonları kullanıldığında insan etiketine olan bağımlılık azalır. Buna karşın yöntemin sınırlılıkları da vardır: Grup büyüklüğü ve ödül fonksiyonu tasarımı kritik hiperparametrelerdir; hatalı ödüller hızla yayılabilir. GRPO, DeepSeek-R1'in başarısının ardından açık kaynaklı LLM eğitim ekosisteminde hızla benimsenmiş; TRL, Verl ve OpenRLHF gibi kütüphaneler GRPO desteği eklemiştir. Günümüzde bu algoritma, reasoning model eğitiminin standart araç kutusunun bir parçası haline gelmiştir.