account_balance Constitutional AI Nasıl Çalışır?
Constitutional AI iki ana aşamadan oluşur. SL-CAI aşaması: İlk olarak model, zararlı veya sorunlu bir istem için yanıt üretir. Ardından modele anayasadan rastgele seçilmiş bir ilke gösterilir ("Bu yanıt dürüst, zararsız ve yardımcı mı?"). Model kendi yanıtını bu ilke ışığında eleştirir (critique). Eleştiri bağlamında yanıtı yeniden yazar (revision). Bu eleştiri-revizyon döngüsü birkaç tur tekrarlanır. En son yeniden yazılan yanıtlar SL-CAI verisi olarak kullanılır ve model bu veriyle fine-tune edilir. RL-CAI aşaması: Modele aynı isteğe karşılık iki farklı yanıt ürettirilir. Bir AI hakem modeli, anayasadaki ilkelere dayanarak hangi yanıtın tercih edilmesi gerektiğini değerlendirir. Bu AI tercih verileriyle bir ödül modeli eğitilir (RLAIF). Politika modeli bu ödül modeliyle RL ile güncellenir.
RLHF vs Constitutional AI
person RLHF
İnsan değerlendiriciler tercih sıralaması yapar. Ölçeklenmesi zordur, pahalıdır, değer kümesi örtük ve tutarsız olabilir.
account_balance Constitutional AI
Yazılı anayasa + AI hakem. İnsan etiketleyici azaltılır, değer kümesi şeffaf ve denetlenebilir, ölçeklenebilir.
refresh Öz-Eleştiri Döngüsü
Model kendi yanıtını anayasaya göre eleştirir ve düzeltir. Bu "red team + blue team" döngüsü modelin zayıf yanıtlarını tespit etmesini sağlar.
smart_toy RLAIF
Reinforcement Learning from AI Feedback: İnsan yerine AI tercihlerinden öğrenme. CAI'nın RL-CAI aşaması bu kavramın öncü uygulamasıdır.
gavel Anayasa İlkeleri
- check_circle Harmlessness (Zararsızlık): Fiziksel, psikolojik, mali veya sosyal zarar verebilecek içerik üretmemek. Silah yapımı, dolandırıcılık veya nefret söylemi içeren taleplere yardım etmemek.
- check_circle Helpfulness (Yararlılık): Meşru istemlere net, doğru ve kapsamlı yanıtlar vermek. Aşırı ihtiyatlılığın (over-refusal) gereksiz redlere yol açmaması.
- check_circle Honesty (Dürüstlük): Belirsizlik olduğunda bunu kabul etmek, hallucination yapmamak, manipülatif ikna tekniklerinden kaçınmak.
- check_circle Uluslararası İnsan Hakları: Anthropic'in anayasası BM İnsan Hakları Evrensel Beyannamesi ve diğer uluslararası belgelerden ilkeler içerir.
trending_up Constitutional AI'nin Avantajları
- check_circle Ölçeklenebilir hizalama: RLHF'ye kıyasla çok daha az insan etiketi gerektirdiğinden, büyük ölçekli modellerde ve çok dilli senaryolarda pratik biçimde uygulanabilir.
- check_circle Şeffaf değer çerçevesi: Modelin neye göre davranması gerektiğini anayasa açıkça tanımlar; bu belge kamuya açık olduğundan denetlenebilir ve tartışmaya açıktır.
- check_circle Tutarlı değerlendirme: AI hakem sabit bir anayasaya göre değerlendirme yaptığından, insan değerlendiriciler arasındaki tutarsızlık ve yorgunluk etkisinden kaçınılır.
- check_circle Azaltılmış zararlı çıktı: Öz-eleştiri döngüsü, modelin kendi zayıf yanıtlarını eğitim öncesinde tespit etmesini ve düzeltmesini mümkün kılarak zararlı içerik üretimini azaltır.
- check_circle Ölçeklenebilir denetim araştırması: CAI, gelecekte çok daha güçlü yapay zekaları insan denetimiyle hizalamanın nasıl mümkün olabileceğini gösteren erken bir kavram kanıtıdır.
quiz Sıkça Sorulan Sorular
- check_circle Constitutional AI tam olarak hangi sorunları çözer?: RLHF'nin ölçeklenebilirlik sorununu (çok fazla insan etiketi gerektirir) ve şeffaflık sorununu (değer kümesi örtük) ele alır. Anayasa herkese açık, tartışılabilir ve güncellenebilir bir belge olarak yayımlanabilir.
- check_circle Anayasayı kim yazar?: Anthropic araştırmacıları ve editörleri anayasayı hazırlar. Anayasanın içeriği şirketin değerlerini yansıtır. Anthropic, Claude modeli için kullandığı anayasayı kamuoyuyla paylaşmıştır.
- check_circle Constitutional AI ile Claude ne kadar farklı davranıyor?: CAI ile eğitilen modeller, standart RLHF modellerine kıyasla daha az saldırgan red yanıtı üretirken zararlı içerik üretimini engellemede benzer başarı sergiler. Zararsızlık-yararlılık dengesi daha iyi ayarlanmıştır.
- check_circle Anthropic'in anayasasına nereden ulaşabilirim?: Anthropic, Claude'un anayasasını "Claude's Constitution" başlığıyla kamuya açık bir araştırma belgesi olarak yayımlamıştır. anthropic.com/research/claude-s-constitution adresinden orijinal metin okunabilir; belge hangi ilkelerin neden dahil edildiğini gerekçeleriyle açıklar.
- check_circle RLAIF ile RLHF arasındaki temel fark nedir?: RLHF'de tercih sıralaması insan değerlendiriciler tarafından yapılır; bu süreç pahalı ve yavaştır. RLAIF'te (CAI'nın RL-CAI aşaması) bu görev bir AI hakeme devredilir; hakem anayasaya göre hangi yanıtın daha iyi olduğuna karar verir. İnsan müdahalesi minimum düzeye iner, bu da tekniğin çok daha büyük ölçeklerde çalışmasını mümkün kılar.