tag HizalamaTekniği

Constitutional AI (Anayasal Yapay Zeka)

Bu sayfada HizalamaTekniği (Constitutional AI (Anayasal Yapay Zeka)) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

Constitutional AI (CAI — Anayasal Yapay Zeka), Anthropic tarafından Aralık 2022'de yayımlanan "Constitutional AI: Harmlessness from AI Feedback" (Bai ve ark., arXiv 2212.08073) makalesiyle kamuoyuna tanıtılan bir model hizalama tekniğidir. Geleneksel RLHF yaklaşımında insan değerlendiricilerin her model yanıtını elle değerlendirmesi gerekir; bu süreç hem yavaş hem de pahalıdır, değerlendirici tutarsızlığından kaynaklanan gürültü içerir ve zararlı içeriklere maruz kalan etiketleyicileri olumsuz etkiler. Constitutional AI, bu darboğazı büyük ölçüde yapay zeka geri bildirimiyle (RLAIF — Reinforcement Learning from AI Feedback) aşar. Teknik iki ana aşamaya dayanır. SL-CAI aşamasında model önce kışkırtıcı bir istem için sorunlu bir yanıt üretir; ardından belirlenmiş "anayasa" ilkelerine göre kendi yanıtını eleştirir ve revize eder. Bu öz-eleştiri döngüsü birkaç tur tekrarlanır; elde edilen yüksek kaliteli yanıtlar denetimli öğrenme (SFT) için eğitim verisi olarak kullanılır. RL-CAI aşamasında ise insan tercih sıralaması yerine bir AI hakem modeli devreye girer; hakem, anayasadaki ilkelere göre hangi yanıtın daha iyi olduğuna karar verir ve bu tercih verileriyle ödül modeli eğitilir. Anthropic'in anayasası, BM İnsan Hakları Evrensel Beyannamesi'ndeki temel ilkeler ve "zararlı olmamak, yardımcı olmak, dürüst olmak" (harmless, helpful, honest) üçlüsünden oluşur. Bu anayasa metni kamuya açık biçimde yayımlanmış olup araştırmacılar ve kullanıcılar tarafından denetlenebilir bir değer çerçevesi sunar. Anthropic'in Claude model serisi — Claude 1'den günümüze tüm versiyonlar — Constitutional AI ve türev geliştirmeler temel alınarak eğitilmiştir; CAI bu nedenle bugüne kadarki en yaygın ve kapsamlı ticari hizalama yöntemi olarak öne çıkmaktadır. Constitutional AI, "ölçeklenebilir denetim" (scalable oversight) araştırma alanının somut bir uygulaması olarak yapay zeka güvenliği ve sorumlu AI geliştirme literatüründe önemli bir yer tutmaktadır.

account_balance

Constitutional AI (Anayasal Yapay Zeka)

Constitutional AI (CAI — Anayasal Yapay Zeka), Anthropic tarafından Aralık 2022'de yayımlanan "Constitutional AI: Harmlessness from AI Feedback" (Bai ve ark., arXiv 2212.08073) makalesiyle kamuoyuna tanıtılan bir model hizalama tekniğidir. Geleneksel RLHF yaklaşımında insan değerlendiricilerin her model yanıtını elle değerlendirmesi gerekir; bu süreç hem yavaş hem de pahalıdır, değerlendirici tutarsızlığından kaynaklanan gürültü içerir ve zararlı içeriklere maruz kalan etiketleyicileri olumsuz etkiler. Constitutional AI, bu darboğazı büyük ölçüde yapay zeka geri bildirimiyle (RLAIF — Reinforcement Learning from AI Feedback) aşar. Teknik iki ana aşamaya dayanır. SL-CAI aşamasında model önce kışkırtıcı bir istem için sorunlu bir yanıt üretir; ardından belirlenmiş "anayasa" ilkelerine göre kendi yanıtını eleştirir ve revize eder. Bu öz-eleştiri döngüsü birkaç tur tekrarlanır; elde edilen yüksek kaliteli yanıtlar denetimli öğrenme (SFT) için eğitim verisi olarak kullanılır. RL-CAI aşamasında ise insan tercih sıralaması yerine bir AI hakem modeli devreye girer; hakem, anayasadaki ilkelere göre hangi yanıtın daha iyi olduğuna karar verir ve bu tercih verileriyle ödül modeli eğitilir. Anthropic'in anayasası, BM İnsan Hakları Evrensel Beyannamesi'ndeki temel ilkeler ve "zararlı olmamak, yardımcı olmak, dürüst olmak" (harmless, helpful, honest) üçlüsünden oluşur. Bu anayasa metni kamuya açık biçimde yayımlanmış olup araştırmacılar ve kullanıcılar tarafından denetlenebilir bir değer çerçevesi sunar. Anthropic'in Claude model serisi — Claude 1'den günümüze tüm versiyonlar — Constitutional AI ve türev geliştirmeler temel alınarak eğitilmiştir; CAI bu nedenle bugüne kadarki en yaygın ve kapsamlı ticari hizalama yöntemi olarak öne çıkmaktadır. Constitutional AI, "ölçeklenebilir denetim" (scalable oversight) araştırma alanının somut bir uygulaması olarak yapay zeka güvenliği ve sorumlu AI geliştirme literatüründe önemli bir yer tutmaktadır.

arrow_forward
star

Reward Model (Ödül Modeli)

Ödül modeli (Reward Model, RM), insanların tercihlerini veya değerlerini sayısal bir ödül sinyaline dönüştüren ve pekiştirmeli öğrenme ile dil modeli hizalama süreçlerinde kullanılan bir sinir ağıdır. RLHF (Reinforcement Learning from Human Feedback) boru hattının ikinci aşamasını oluşturur ve GPT-4, Claude ve Gemini gibi üretim modellerinin temelinde yer alır. Eğitim süreci şöyle çalışır: Bir politika modelinin ürettiği aynı isteğe karşılık gelen birden fazla yanıt, insan değerlendiriciler tarafından tercih sıralamasına konur. Ödül modeli, bu tercih çiftlerini kullanarak hangi yanıtın hangisine göre daha iyi olduğunu öğrenir. Genellikle Bradley-Terry modelini temel alan bir kayıp fonksiyonu kullanılır: model, tercih edilen yanıta yüksek skor, reddedilen yanıta düşük skor vermeyi öğrenir. L = -log(σ(r_w - r_l)) formülü bu ilişkiyi matematiksel olarak ifade eder. Eğitilmiş ödül modeli, daha sonra PPO gibi RL algoritmasıyla birleştirilir: Politika modeli yanıt üretirken ödül modeli üretilen yanıtı puanlar ve bu puan politika modelinin güncellenmesinde kullanılır. Böylece insan değerlendiricilerin her eğitim adımında tekrar geri bildirim vermesi gerekmez; ödül modeli insan tercihlerini 'dondurulmuş' hâlde temsil eder. KL sapma penaltısı, modelin SFT temel çizgisinden aşırı uzaklaşmasını frenleyerek ödül hacklemesini önler. Ödül hacklemesi (reward hacking), modelin gerçek kalite yerine ödül modelini yanıltmayı öğrenmesi sorunudur. Çok uzun yanıtlar, aşırı kibar ifadeler veya anlamsız tekrarlar yüksek puan alabilir. Constitutional AI ve Direct Preference Optimization (DPO), ayrı bir ödül modeli gerektirmeden tercih hizalaması yaparak bu bağımlılığı azaltan alternatif yaklaşımlardır. DPO özellikle daha düşük hesaplama maliyetiyle benzer hizalama kalitesine ulaşabildiği için 2024-2025'te yaygınlaşmıştır. Uygulamada ödül modelinin kalitesi, nihai modelin davranışını doğrudan etkiler: yetersiz ya da önyargılı tercih verisiyle eğitilen bir ödül modeli, politika modelini istenmeyen yönlere yönlendirebilir. Bu nedenle veri çeşitliliği, değerlendirici eğitimi ve ödül modelinin düzenli yeniden eğitimi üretim ölçeğinde kritik operasyonel gereksinimlerdir.

arrow_forward