tag DPO
Bu sayfada DPO etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.
DPO (Direct Preference Optimization), Türkçesiyle Doğrudan Tercih Optimizasyonu, büyük dil modellerini insan tercihlerine göre hizalamak için kullanılan ve RLHF'nin çok aşamalı sürecini tek bir denetimli öğrenme adımına indirgeyen bir ince ayar (fine-tuning) yöntemidir. Rafailov ve arkadaşlarının 2023'te Stanford'da yayımladığı "Your Language Model is Secretly a Reward Model" makalesiyle önerildi. Yöntemin çözdüğü sorun şudur: RLHF'de önce insan tercihlerinden ayrı bir ödül modeli eğitilir, ardından bu ödülü maksimize etmek için PPO gibi pekiştirmeli öğrenme algoritmaları çalıştırılır; bu süreç karmaşık, maliyetli ve kararsızdır. DPO ise ödül fonksiyonunun kapalı formda doğrudan politika üzerinden ifade edilebildiğini matematiksel olarak gösterir. Böylece aynı hizalama hedefi, kazanan-kaybeden yanıt çiftlerinden oluşan tercih verisiyle tek aşamada optimize edilir. Kayıp fonksiyonu, modelin tercih edilen yanıta verdiği olasılığı artırırken reddedilen yanıtınkini düşürür ve KL cezasıyla referans modelden aşırı sapmayı engeller. Bu sadeleşme pratikte büyük fark yaratır: ayrı ödül modeli eğitimi, örnekleme döngüleri ve PPO'nun hiperparametre hassasiyeti ortadan kalkar; eğitim daha kararlı, daha ucuz ve tekrarlanabilir hâle gelir. Zephyr, Tülu 2 ve Meta'nın Llama 3 ailesi gibi modellerin hizalama aşamasında DPO kullanıldı. Hugging Face TRL kütüphanesindeki DPOTrainer sınıfı, LoRA veya QLoRA ile birleştiğinde yöntemi tek GPU'lu ortamlarda bile erişilebilir kılar. Bugün DPO, açık kaynak LLM hizalamasının fiili standartlarından biri kabul edilir; IPO, KTO, SimPO ve ORPO gibi varyantlar da bu çerçeveden türetilmiştir. Hangi yöntemin seçileceği veri altyapısına, hesaplama bütçesine ve hedef görevin hassasiyetine bağlıdır.
DPO (Doğrudan Tercih Optimizasyonu)
DPO (Direct Preference Optimization), Türkçesiyle Doğrudan Tercih Optimizasyonu, büyük dil modellerini insan tercihlerine göre hizalamak için kullanılan ve RLHF'nin çok aşamalı sürecini tek bir denetimli öğrenme adımına indirgeyen bir ince ayar (fine-tuning) yöntemidir. Rafailov ve arkadaşlarının 2023'te Stanford'da yayımladığı "Your Language Model is Secretly a Reward Model" makalesiyle önerildi. Yöntemin çözdüğü sorun şudur: RLHF'de önce insan tercihlerinden ayrı bir ödül modeli eğitilir, ardından bu ödülü maksimize etmek için PPO gibi pekiştirmeli öğrenme algoritmaları çalıştırılır; bu süreç karmaşık, maliyetli ve kararsızdır. DPO ise ödül fonksiyonunun kapalı formda doğrudan politika üzerinden ifade edilebildiğini matematiksel olarak gösterir. Böylece aynı hizalama hedefi, kazanan-kaybeden yanıt çiftlerinden oluşan tercih verisiyle tek aşamada optimize edilir. Kayıp fonksiyonu, modelin tercih edilen yanıta verdiği olasılığı artırırken reddedilen yanıtınkini düşürür ve KL cezasıyla referans modelden aşırı sapmayı engeller. Bu sadeleşme pratikte büyük fark yaratır: ayrı ödül modeli eğitimi, örnekleme döngüleri ve PPO'nun hiperparametre hassasiyeti ortadan kalkar; eğitim daha kararlı, daha ucuz ve tekrarlanabilir hâle gelir. Zephyr, Tülu 2 ve Meta'nın Llama 3 ailesi gibi modellerin hizalama aşamasında DPO kullanıldı. Hugging Face TRL kütüphanesindeki DPOTrainer sınıfı, LoRA veya QLoRA ile birleştiğinde yöntemi tek GPU'lu ortamlarda bile erişilebilir kılar. Bugün DPO, açık kaynak LLM hizalamasının fiili standartlarından biri kabul edilir; IPO, KTO, SimPO ve ORPO gibi varyantlar da bu çerçeveden türetilmiştir. Hangi yöntemin seçileceği veri altyapısına, hesaplama bütçesine ve hedef görevin hassasiyetine bağlıdır.
PPO (Proximal Policy Optimization)
PPO (Proximal Policy Optimization), politika güncellemelerini kırpılmış vekil kayıp (clipped surrogate loss) fonksiyonuyla sınırlı tutarak kararlı ve verimli öğrenme sunan, politika gradyanı tabanlı bir pekiştirmeli öğrenme algoritmasıdır. John Schulman ve ekibi tarafından OpenAI'da 2017'de yayımlanan yöntem (arXiv:1707.06347), TRPO'nun ikinci dereceden optimizasyon gerektiren güven bölgesi (trust region) yaklaşımını birinci dereceden, uygulaması kolay bir mekanizmayla değiştirir: yeni politika eski politikadan belirli bir oranın (tipik olarak ε=0.2) ötesinde saparsa güncelleme kırpılır. PPO iki alanda standart haline geldi. Klasik pekiştirmeli öğrenmede robotik simülasyon (MuJoCo, Isaac Lab), oyun ajanları (OpenAI Five'ın Dota 2 sistemi 2019'da dünya şampiyonunu PPO ile yendi) ve kontrol görevlerinde varsayılan algoritma oldu. Büyük dil modellerinde ise RLHF boru hattının üçüncü adımını oluşturdu: SFT modelinden başlayan politika, ürettiği yanıtlar için ödül modelinden puan alır; KL sapma penaltısı politikayı referans modele yakın tutar ve PPO bu toplam ödülle ağırlıkları günceller. InstructGPT (2022), ChatGPT ve Llama 2-Chat (2023) bu döngüyle hizalandı. 2024-2026 döneminde tablo değişti. Statik tercih verisiyle hizalamada DPO ve türevleri (IPO, KTO, ORPO) düşük maliyetleriyle öne çıkarken, muhakeme modellerinin doğrulanabilir ödüllerle (RLVR) eğitiminde PPO'nun basitleştirilmiş türevi GRPO yükseldi: DeepSeek, R1 modelini (Ocak 2025) değer ağını kaldırıp avantajı grup içi ödül ortalamasından hesaplayan GRPO ile eğitti; DAPO ve Dr. GRPO gibi düzeltmeler 2025-2026'da bu hattı sürdürdü. Yine de bu yöntemlerin tamamı PPO'nun kırpma mantığını miras alır; PPO, modern RL tabanlı LLM eğitiminin ortak atası ve referans noktası olmayı sürdürüyor.
Reward Model (Ödül Modeli)
Ödül modeli (Reward Model, RM), insanların tercihlerini veya değerlerini sayısal bir ödül sinyaline dönüştüren ve pekiştirmeli öğrenme ile dil modeli hizalama süreçlerinde kullanılan bir sinir ağıdır. RLHF (Reinforcement Learning from Human Feedback) boru hattının ikinci aşamasını oluşturur ve GPT-4, Claude ve Gemini gibi üretim modellerinin temelinde yer alır. Eğitim süreci şöyle çalışır: Bir politika modelinin ürettiği aynı isteğe karşılık gelen birden fazla yanıt, insan değerlendiriciler tarafından tercih sıralamasına konur. Ödül modeli, bu tercih çiftlerini kullanarak hangi yanıtın hangisine göre daha iyi olduğunu öğrenir. Genellikle Bradley-Terry modelini temel alan bir kayıp fonksiyonu kullanılır: model, tercih edilen yanıta yüksek skor, reddedilen yanıta düşük skor vermeyi öğrenir. L = -log(σ(r_w - r_l)) formülü bu ilişkiyi matematiksel olarak ifade eder. Eğitilmiş ödül modeli, daha sonra PPO gibi RL algoritmasıyla birleştirilir: Politika modeli yanıt üretirken ödül modeli üretilen yanıtı puanlar ve bu puan politika modelinin güncellenmesinde kullanılır. Böylece insan değerlendiricilerin her eğitim adımında tekrar geri bildirim vermesi gerekmez; ödül modeli insan tercihlerini 'dondurulmuş' hâlde temsil eder. KL sapma penaltısı, modelin SFT temel çizgisinden aşırı uzaklaşmasını frenleyerek ödül hacklemesini önler. Ödül hacklemesi (reward hacking), modelin gerçek kalite yerine ödül modelini yanıltmayı öğrenmesi sorunudur. Çok uzun yanıtlar, aşırı kibar ifadeler veya anlamsız tekrarlar yüksek puan alabilir. Constitutional AI ve Direct Preference Optimization (DPO), ayrı bir ödül modeli gerektirmeden tercih hizalaması yaparak bu bağımlılığı azaltan alternatif yaklaşımlardır. DPO özellikle daha düşük hesaplama maliyetiyle benzer hizalama kalitesine ulaşabildiği için 2024-2025'te yaygınlaşmıştır. Uygulamada ödül modelinin kalitesi, nihai modelin davranışını doğrudan etkiler: yetersiz ya da önyargılı tercih verisiyle eğitilen bir ödül modeli, politika modelini istenmeyen yönlere yönlendirebilir. Bu nedenle veri çeşitliliği, değerlendirici eğitimi ve ödül modelinin düzenli yeniden eğitimi üretim ölçeğinde kritik operasyonel gereksinimlerdir.