list_altİçindekilerexpand_more
- 01LLM Hizalaması Neden Önemli?
- 02RLHF: İnsan Geri Bildirimi ve Ödül Modeli
- 03RLHF’nin Pratik Sorunları
- 04DPO: Ödül Modelsiz Tercih Öğrenmesi
- 05DPO’nun Sınırları
- 06GRPO: Grup Göreceli Politika Optimizasyonu
- 07GRPO’nun Güçlü ve Zayıf Tarafları
- 08Karşılaştırma Tablosu
- 09Gerçek Kullanım Senaryoları
- 10Hangi Yöntemi Seçmelisiniz?
- 112026’da Sektörün Tercihi
Bir dil modelini ön eğitimden sonra gerçekten kullanışlı bir asistana dönüştürmek için tek bir doğru yol yok. RLHF, DPO ve GRPO, bu problemi farklı açılardan ele alan üç temel yöntem. Her birinin hesaplama maliyeti, veri ihtiyacı ve başarısızlık noktaları farklı. 2026 itibarıyla açık kaynak ekosisteminde bu üçü de aktif kullanımda; ancak hangi senaryoda hangisini seçeceğiniz büyük ölçüde pratikte ne tür kısıtlarla çalıştığınıza bağlı.

LLM Hizalaması Neden Önemli?
Ön eğitim sırasında bir dil modeli devasa bir metin korpusu üzerinde “bir sonraki token nedir?” sorusunu tahmin etmeyi öğrenir. Bu süreç modele güçlü bir dil temsili kazandırır; ama zararsızlık, dürüstlük ya da yardımcı olma gibi özellikleri kendiliğinden vermiyor. Ham model, zararlı talepleri de rahatça karşılıyor ya da soruya doğrudan yanıt vermek yerine benzer bağlamlardaki cümle kalıplarını tekrarlıyor.
Hizalama, bu boşluğu kapatmak için insan tercihlerini veya kurallarını modelin davranışına yansıtır. RLHF, DPO ve GRPO bu işlemi farklı mekanizmalarla gerçekleştiren yaklaşımlar; üçü de SFT (Supervised Fine-Tuning) aşamasından sonra uygulanır.
RLHF: İnsan Geri Bildirimi ve Ödül Modeli
RLHF (Reinforcement Learning from Human Feedback), OpenAI’ın 2022 tarihli InstructGPT çalışmasıyla geniş kamuoyuna tanındı. Pipeline üç aşamada yürüyor.
-
SFT aşaması. Model, talimatları takip etmeyi öğrenmek için insan tarafından yazılmış örnek yanıtlarla ince ayarlanıyor. Bu adımı atlamak mümkün değil; ödül sinyali almadan önce modelin temel talimat anlayışını kazanması gerekiyor.
-
Reward model eğitimi. İnsan etiketleyiciler aynı prompt’a verilmiş iki farklı yanıtı karşılaştırıp hangisini tercih ettiğini belirtiyor. Bu tercih çiftlerinden bir sınıflandırıcı (reward model) eğitiliyor: herhangi bir yanıtın ne kadar iyi olduğunu tahmin eden bağımsız bir model.
-
PPO döngüsü. Reward modelin verdiği skorları hedefleyerek PPO (Proximal Policy Optimization) algoritması asıl LLM’i güncelliyor. Güncelleme, modelin referans noktasından çok uzaklaşmaması için KL-divergence kısıtıyla sınırlandırılıyor. Bu kısıt olmadan model reward hacking yaparak insan niyetini değil, metriği optimize eder.
RLHF’nin Pratik Sorunları
RLHF’nin belki en iyi bilinen dezavantajı bellek ayak izi. PPO döngüsü sırasında GPU’da aynı anda dört modelin tutulması gerekiyor: policy model, dondurulmuş referans model, reward model ve value modeli. Bu, büyük modellerde pratikte yalnızca iyi finanse edilmiş gruplara erişilebilir bir düzeye çıkıyor.
PPO’nun kendisi de hassas. KL katsayısı başta olmak üzere hiperparametre dengeleri yanlış seçildiğinde eğitim ya donup kalıyor ya da model reward modeli hackliyor. Kararlı bir run elde etmek iteratif deneme gerektiriyor.
Son olarak, reward modelini güncellemek için yeni insan tercih verisi toplamanız ve bunu eğitmeniz gerekiyor. Bu iterasyon döngüsü yavaş ve maliyetli.
DPO: Ödül Modelsiz Tercih Öğrenmesi
DPO (Direct Preference Optimization), reward model ve PPO’ya olan bağımlılığı ortadan kaldırmak için 2023’te Rafailov ve ekibi tarafından önerildi.
Temel fikir matematiksel bir türetmeden geliyor. Optimal RLHF politikasının analitik formülü, reward modele referans yapmadan yalnızca iki modelin log-olasılık oranları cinsinden ifade edilebilir. Başka bir deyişle: reward modeli ayrı bir bileşen olarak eğitmeye gerek yok; tercih verisi doğrudan bir kayıp fonksiyonuna dönüştürülebilir ve model bunu supervised bir döngüde optimize edebilir.
# TRL kütüphanesiyle basit DPO eğitim döngüsü
from trl import DPOTrainer, DPOConfig
config = DPOConfig(
beta=0.1, # KL katsayısı: küçükse agresif güncelleme
learning_rate=5e-7,
per_device_train_batch_size=4,
gradient_accumulation_steps=4,
num_train_epochs=3,
)
trainer = DPOTrainer(
model=model,
ref_model=ref_model, # dondurulmuş referans model
args=config,
train_dataset=dataset, # {"prompt", "chosen", "rejected"} formatı
tokenizer=tokenizer,
)
trainer.train()
Veri formatı nispeten sade: her örnek bir üçlüden oluşuyor. Prompt, tercih edilen yanıt (chosen) ve reddedilen yanıt (rejected). Bu format hazırlamak, reward model eğitimi için gereken ikili karşılaştırma pipeline’ını kurgulamaktan çok daha az altyapı istiyor.
DPO’nun iki önemli pratik avantajı var: eğitim belirgin biçimde daha stabil (supervised loop, PPO’nun hassasiyetinden uzak), ve bellek ayak izi küçük (yalnızca policy ve referans model).
DPO’nun Sınırları
DPO statik bir veri seti üzerinde çalışır. Model eğitim sırasında yeni yanıtlar üretip bunlardan öğrenmiyor; bu online exploration eksikliği, özellikle karmaşık akıl yürütme görevlerinde performans tavanını düşürebilir.
Öte yandan tercih verisinin kalitesine RLHF’den daha fazla bağımlı. Seçilen-reddedilen çiftlerdeki gürültü, doğrudan kayıp fonksiyonuna yansıdığı için reward modelin “filtre” etkisi olmadan modele sızabiliyor.
GRPO: Grup Göreceli Politika Optimizasyonu
GRPO (Group Relative Policy Optimization), DeepSeek’in 2025 başında yayınladığı R1 çalışmasıyla pratik ölçeğe taşındı. RLHF’nin online özelliğini korurken reward modeli gerektirmeyen bir orta yol arıyor.
Yöntemin özü şu: reward model eğitmek yerine, modelin aynı prompt için ürettiği birden fazla yanıtı gruplayıp bu grup içinde göreceli sıralama yap. Her yanıtı kural tabanlı bir değerlendirici ya da hafif bir skorlayıcıyla puanla. Grupta en yüksek skoru alanlar ödüllendirilir, düşük skoru alanlar cezalandırılır. Referans nokta olarak grubun kendi ortalaması kullanıldığından mutlak bir reward değeri gerekmez.
# GRPO temel döngüsü (pseudocode)
for prompt in training_data:
# G adet yanıt üret (örneğin G=8)
responses = model.generate(prompt, num_return_sequences=8)
# Her yanıtı kural tabanlı değerlendir
# (matematik: exact match, kod: test geçme, genel: hafif LLM değerlendirici)
rewards = [score_fn(prompt, r) for r in responses]
# Grup içinde normalize et
baseline = mean(rewards)
normalized = [(r - baseline) / (std(rewards) + 1e-8) for r in rewards]
# Policy güncelleme: iyi yanıtların log-olasılığını artır
loss = compute_grpo_loss(
model, ref_model, responses, normalized, beta=0.04
)
loss.backward()
optimizer.step()
Bu yaklaşım PPO’ya benziyor ama value modeli gerektirmiyor. DeepSeek-R1 bu yöntemi chain-of-thought akıl yürütme kapasitesini öğretmek için kullandı; modelin uzun düşünce zinciri üretmesini ve kendi hatalarını fark edip düzeltmesini bu online learning döngüsüne borçlu.
GRPO’nun Güçlü ve Zayıf Tarafları
GRPO’nun asıl gücü akıl yürüten modellerde ortaya çıkıyor. Model eğitim boyunca kendi üretimlerinden öğrendiği için DPO’nun statik tavanını aşabiliyor. Matematik, kod, mantık gibi nesnel kriterlerin kolayca formüle edilebildiği alanlarda bu dinamik öğrenme belirgin bir avantaj.
Öte yandan “iyi yanıt” kriterini açıkça tanımlamak her görev için kolay değil. Yaratıcı yazarlık, nüanslı diyalog ya da öznel kalite değerlendirmeleri için kural tabanlı reward fonksiyonu yazmak zorlaşıyor. Bu noktada ya hafif bir LLM değerlendirici devreye giriyor (ki bu da bir tür reward model) ya da RLHF veya DPO’ya dönmek gerekiyor.
Karşılaştırma Tablosu
| Özellik | RLHF | DPO | GRPO |
|---|---|---|---|
| Reward modeli | Zorunlu | Yok | Opsiyonel/hafif |
| Eğitim stabilitesi | Düşük (PPO hassas) | Yüksek | Orta |
| Bellek ayak izi | Çok yüksek (4 model) | Orta (2 model) | Yüksek (2 model + örnekleme) |
| Veri tipi | Tercih çiftleri + reward model | Tercih çiftleri | Kural tabanlı reward fonksiyonu |
| Online öğrenme | Evet | Hayır | Evet |
| Akıl yürütme görevleri | Orta | Zayıf | Güçlü |
| Uygulama kolaylığı | Zor | Kolay | Orta |
| Tipik kullanım | Büyük ticari modeller | Açık ağırlıklı fine-tune | Akıl yürütme modelleri |
Kaynaklar: InstructGPT: RLHF (Ouyang et al., 2022) · DPO (Rafailov et al., 2023) · DeepSeek-R1 / GRPO (DeepSeek-AI, 2025)
Gerçek Kullanım Senaryoları
Küçük ekip, sınırlı GPU: DPO açıkça öne çıkıyor. TRL kütüphanesinin hazır entegrasyonu, stabil eğitim ve nispeten az donanım ihtiyacı, PEFT/LoRA yöntemleriyle birleşince tek GPU setup’ında bile uygulanabilir hale geliyor. Llama 3 Instruct’ın topluluk fine-tune’larının büyük kısmı bu yoldan geçiyor.
Matematik, kod, mantık: GRPO veya hibrit yaklaşım. Değerlendirme kriterinin net olduğu görevlerde (doğru cevap var mı, testler geçiyor mu) online explorationın getirisi yüksek. Qwen2.5-Math, DeepSeek-R1 ve benzer akıl yürütme odaklı modeller bu kategorinin başarılı örnekleri.
Kurumsal güvenlik, içerik filtreleme: RLHF hâlâ güçlü bir seçenek. Nüanslı zararlılık değerlendirmesi, kültürel duyarlılık ya da bağlama özel uygunluk gibi öznel yargıları insan etiketçilerden reward modele aktarmak istediğinizde bu pipeline işe yarıyor.
Genel amaçlı asistan, yüksek kalite: Artık çoğu büyük model hibrit bir strateji izliyor. SFT + DPO temel hizalamayı kuruyor, GRPO veya benzeri online yöntemler akıl yürütme kapasitesini güçlendiriyor.
Hangi Yöntemi Seçmelisiniz?
Kural tabanlı reward fonksiyonu yazabilir misiniz? Matematiksel doğruluk, kod testi, biçimsel çıktı doğrulama gibi net kriterler varsa GRPO güçlü bir aday. Öznel kalite değerlendirmeleri söz konusu olduğunda ya reward modeli (RLHF) ya da iyi tercih verisi (DPO) gerekiyor.
Hesaplama bütçeniz ne kadar? DPO en erişilebilir başlangıç noktası. GRPO, örnekleme döngüsü nedeniyle orta düzey kaynak istiyor. RLHF’nin dört model gerektirmesi onu ticari ölçekli operasyonlara özel kılıyor.
Online exploration gerekiyor mu? Statik bir tercih veriseti yeterliyse DPO iyi çalışıyor. Modelin kendi üretimlerinden öğrenmesini istiyorsanız GRPO daha uygun. Bu ikinci senaryo özellikle test-time compute yaklaşımlarında kritik: modelin yanıt üretirken kendi kendini düzeltme kapasitesi büyük ölçüde burada şekilleniyor.
Instruction tuning ve SFT bağlamında bu yöntemlerin nereye oturduğunu anlamak, hangi aşamada hangi tekniği devreye soracağınız konusunda daha net bir tablo çiziyor. Her üç yöntem de SFT’den sonra uygulanır; güçlü bir base model ve temiz bir instruction dataset her birinin ön koşulu.
2026’da Sektörün Tercihi
2025 sonu itibarıyla açık kaynak ekosisteminde belirgin bir örüntü yerleşti: temel hizalama için DPO, akıl yürütme kapasitesi için GRPO. Bu iki aşamalı yapı hem hesaplama açısından makul hem de geniş bir görev yelpazesini kapsıyor.
RLHF tamamen geride kalmadı: Anthropic’in Constitutional AI ve RLAIF yaklaşımı, insan yerine model yorumlarını kullanarak reward model eğitimini ölçeklendiriyor. Meta ve Google da farklı RLHF türevlerini üretim sistemlerinde aktif kullanıyor. Ancak araştırmaların ve açık ağırlıklı modellerin yönelimi DPO ve GRPO’ya doğru şekilleniyor.
Bu üçünden birini “her durumda en iyisi” diye seçmek gerçekçi değil. Görev, veri ve bütçe üçgeni değiştiğinde tercih de değişiyor. Aynı modelin farklı yetenekleri için farklı yöntemleri art arda uygulamak bugün standart bir yaklaşım haline geldi.



