account_balance Constitutional AI Nasıl Çalışır?
Constitutional AI iki ana aşamadan oluşur. SL-CAI aşaması: İlk olarak model, zararlı veya sorunlu bir istem için yanıt üretir. Ardından modele anayasadan rastgele seçilmiş bir ilke gösterilir ("Bu yanıt dürüst, zararsız ve yardımcı mı?"). Model kendi yanıtını bu ilke ışığında eleştirir (critique). Eleştiri bağlamında yanıtı yeniden yazar (revision). Bu eleştiri-revizyon döngüsü birkaç tur tekrarlanır. En son yeniden yazılan yanıtlar SL-CAI verisi olarak kullanılır ve model bu veriyle fine-tune edilir. RL-CAI aşaması: Modele aynı isteğe karşılık iki farklı yanıt ürettirilir. Bir AI hakem modeli, anayasadaki ilkelere dayanarak hangi yanıtın tercih edilmesi gerektiğini değerlendirir. Bu AI tercih verileriyle bir ödül modeli eğitilir (RLAIF). Politika modeli bu ödül modeliyle RL ile güncellenir.
RLHF vs Constitutional AI
person RLHF
İnsan değerlendiriciler tercih sıralaması yapar. Ölçeklenmesi zordur, pahalıdır, değer kümesi örtük ve tutarsız olabilir.
account_balance Constitutional AI
Yazılı anayasa + AI hakem. İnsan etiketleyici azaltılır, değer kümesi şeffaf ve denetlenebilir, ölçeklenebilir.
refresh Öz-Eleştiri Döngüsü
Model kendi yanıtını anayasaya göre eleştirir ve düzeltir. Bu "red team + blue team" döngüsü modelin zayıf yanıtlarını tespit etmesini sağlar.
smart_toy RLAIF
Reinforcement Learning from AI Feedback: İnsan yerine AI tercihlerinden öğrenme. CAI'ın RL-CAI aşaması bu kavramın öncü uygulamasıdır.
gavel Anayasa İlkeleri
- check_circle Harmlessness (Zararsızlık): Fiziksel, psikolojik, mali veya sosyal zarar verebilecek içerik üretmemek. Silah yapımı, dolandırıcılık veya nefret söylemi içeren taleplere yardım etmemek.
- check_circle Helpfulness (Yararlılık): Meşru istemlere net, doğru ve kapsamlı yanıtlar vermek. Aşırı ihtiyatlılığın (over-refusal) gereksiz redlere yol açmaması.
- check_circle Honesty (Dürüstlük): Belirsizlik olduğunda bunu kabul etmek, hallucination yapmamak, manipülatif ikna tekniklerinden kaçınmak.
- check_circle Uluslararası İnsan Hakları: Anthropic'in anayasası BM İnsan Hakları Evrensel Beyannamesi ve diğer uluslararası belgelerden ilkeler içerir.
quiz Sıkça Sorulan Sorular
- check_circle Constitutional AI tam olarak hangi sorunları çözer?: RLHF'nin ölçeklenebilirlik sorununu (çok fazla insan etiketi gerektirir) ve şeffaflık sorununu (değer kümesi örtük) ele alır. Anayasa herkese açık, tartışılabilir ve güncellenebilir bir belge olarak yayımlanabilir.
- check_circle Anayasayı kim yazar?: Anthropic araştırmacıları ve editörleri anayasayı hazırlar. Anayasanın içeriği şirketin değerlerini yansıtır. Anthropic, Claude modeli için kullandığı anayasayı kamuoyuyla paylaşmıştır.
- check_circle Constitutional AI ile Claude ne kadar farklı davranıyor?: CAI ile eğitilen modeller, standart RLHF modellerine kıyasla daha az saldırgan red yanıtı üretirken zararlı içerik üretimini engellemede benzer başarı sergiler. Zararsızlık-yararlılık dengesi daha iyi ayarlanmıştır.