Constitutional AI (Anayasal Yapay Zeka)

Constitutional AI, modeli yazılı ilkelerden oluşan bir anayasayla hizalayan ve büyük ölçüde AI geri bildirimini kullanan Anthropic'in hizalama tekniğidir.

Constitutional AI (CAI — Anayasal Yapay Zeka), Anthropic tarafından Aralık 2022'de yayımlanan "Constitutional AI: Harmlessness from AI Feedback" (Bai ve ark., arXiv 2212.08073) makalesiyle kamuoyuna tanıtılan bir model hizalama tekniğidir. Geleneksel RLHF yaklaşımında insan değerlendiricilerin her model yanıtını elle değerlendirmesi gerekir; bu süreç hem yavaş hem de pahalıdır, değerlendirici tutarsızlığından kaynaklanan gürültü içerir ve zararlı içeriklere maruz kalan etiketleyicileri olumsuz etkiler. Constitutional AI, bu darboğazı büyük ölçüde yapay zeka geri bildirimiyle (RLAIF — Reinforcement Learning from AI Feedback) aşar. Teknik iki ana aşamaya dayanır. SL-CAI aşamasında model önce kışkırtıcı bir istem için sorunlu bir yanıt üretir; ardından belirlenmiş "anayasa" ilkelerine göre kendi yanıtını eleştirir ve revize eder. Bu öz-eleştiri döngüsü birkaç tur tekrarlanır; elde edilen yüksek kaliteli yanıtlar denetimli öğrenme (SFT) için eğitim verisi olarak kullanılır. RL-CAI aşamasında ise insan tercih sıralaması yerine bir AI hakem modeli devreye girer; hakem, anayasadaki ilkelere göre hangi yanıtın daha iyi olduğuna karar verir ve bu tercih verileriyle ödül modeli eğitilir. Anthropic'in anayasası, BM İnsan Hakları Evrensel Beyannamesi'ndeki temel ilkeler ve "zararlı olmamak, yardımcı olmak, dürüst olmak" (harmless, helpful, honest) üçlüsünden oluşur. Bu anayasa metni kamuya açık biçimde yayımlanmış olup araştırmacılar ve kullanıcılar tarafından denetlenebilir bir değer çerçevesi sunar. Anthropic'in Claude model serisi — Claude 1'den günümüze tüm versiyonlar — Constitutional AI ve türev geliştirmeler temel alınarak eğitilmiştir; CAI bu nedenle bugüne kadarki en yaygın ve kapsamlı ticari hizalama yöntemi olarak öne çıkmaktadır. Constitutional AI, "ölçeklenebilir denetim" (scalable oversight) araştırma alanının somut bir uygulaması olarak yapay zeka güvenliği ve sorumlu AI geliştirme literatüründe önemli bir yer tutmaktadır.

account_balance Constitutional AI Nasıl Çalışır?

Constitutional AI iki ana aşamadan oluşur. SL-CAI aşaması: İlk olarak model, zararlı veya sorunlu bir istem için yanıt üretir. Ardından modele anayasadan rastgele seçilmiş bir ilke gösterilir ("Bu yanıt dürüst, zararsız ve yardımcı mı?"). Model kendi yanıtını bu ilke ışığında eleştirir (critique). Eleştiri bağlamında yanıtı yeniden yazar (revision). Bu eleştiri-revizyon döngüsü birkaç tur tekrarlanır. En son yeniden yazılan yanıtlar SL-CAI verisi olarak kullanılır ve model bu veriyle fine-tune edilir. RL-CAI aşaması: Modele aynı isteğe karşılık iki farklı yanıt ürettirilir. Bir AI hakem modeli, anayasadaki ilkelere dayanarak hangi yanıtın tercih edilmesi gerektiğini değerlendirir. Bu AI tercih verileriyle bir ödül modeli eğitilir (RLAIF). Politika modeli bu ödül modeliyle RL ile güncellenir.

RLHF vs Constitutional AI

person RLHF

İnsan değerlendiriciler tercih sıralaması yapar. Ölçeklenmesi zordur, pahalıdır, değer kümesi örtük ve tutarsız olabilir.

account_balance Constitutional AI

Yazılı anayasa + AI hakem. İnsan etiketleyici azaltılır, değer kümesi şeffaf ve denetlenebilir, ölçeklenebilir.

refresh Öz-Eleştiri Döngüsü

Model kendi yanıtını anayasaya göre eleştirir ve düzeltir. Bu "red team + blue team" döngüsü modelin zayıf yanıtlarını tespit etmesini sağlar.

smart_toy RLAIF

Reinforcement Learning from AI Feedback: İnsan yerine AI tercihlerinden öğrenme. CAI'nın RL-CAI aşaması bu kavramın öncü uygulamasıdır.

gavel Anayasa İlkeleri

  • check_circle Harmlessness (Zararsızlık): Fiziksel, psikolojik, mali veya sosyal zarar verebilecek içerik üretmemek. Silah yapımı, dolandırıcılık veya nefret söylemi içeren taleplere yardım etmemek.
  • check_circle Helpfulness (Yararlılık): Meşru istemlere net, doğru ve kapsamlı yanıtlar vermek. Aşırı ihtiyatlılığın (over-refusal) gereksiz redlere yol açmaması.
  • check_circle Honesty (Dürüstlük): Belirsizlik olduğunda bunu kabul etmek, hallucination yapmamak, manipülatif ikna tekniklerinden kaçınmak.
  • check_circle Uluslararası İnsan Hakları: Anthropic'in anayasası BM İnsan Hakları Evrensel Beyannamesi ve diğer uluslararası belgelerden ilkeler içerir.

trending_up Constitutional AI'nin Avantajları

  • check_circle Ölçeklenebilir hizalama: RLHF'ye kıyasla çok daha az insan etiketi gerektirdiğinden, büyük ölçekli modellerde ve çok dilli senaryolarda pratik biçimde uygulanabilir.
  • check_circle Şeffaf değer çerçevesi: Modelin neye göre davranması gerektiğini anayasa açıkça tanımlar; bu belge kamuya açık olduğundan denetlenebilir ve tartışmaya açıktır.
  • check_circle Tutarlı değerlendirme: AI hakem sabit bir anayasaya göre değerlendirme yaptığından, insan değerlendiriciler arasındaki tutarsızlık ve yorgunluk etkisinden kaçınılır.
  • check_circle Azaltılmış zararlı çıktı: Öz-eleştiri döngüsü, modelin kendi zayıf yanıtlarını eğitim öncesinde tespit etmesini ve düzeltmesini mümkün kılarak zararlı içerik üretimini azaltır.
  • check_circle Ölçeklenebilir denetim araştırması: CAI, gelecekte çok daha güçlü yapay zekaları insan denetimiyle hizalamanın nasıl mümkün olabileceğini gösteren erken bir kavram kanıtıdır.

quiz Sıkça Sorulan Sorular

  • check_circle Constitutional AI tam olarak hangi sorunları çözer?: RLHF'nin ölçeklenebilirlik sorununu (çok fazla insan etiketi gerektirir) ve şeffaflık sorununu (değer kümesi örtük) ele alır. Anayasa herkese açık, tartışılabilir ve güncellenebilir bir belge olarak yayımlanabilir.
  • check_circle Anayasayı kim yazar?: Anthropic araştırmacıları ve editörleri anayasayı hazırlar. Anayasanın içeriği şirketin değerlerini yansıtır. Anthropic, Claude modeli için kullandığı anayasayı kamuoyuyla paylaşmıştır.
  • check_circle Constitutional AI ile Claude ne kadar farklı davranıyor?: CAI ile eğitilen modeller, standart RLHF modellerine kıyasla daha az saldırgan red yanıtı üretirken zararlı içerik üretimini engellemede benzer başarı sergiler. Zararsızlık-yararlılık dengesi daha iyi ayarlanmıştır.
  • check_circle Anthropic'in anayasasına nereden ulaşabilirim?: Anthropic, Claude'un anayasasını "Claude's Constitution" başlığıyla kamuya açık bir araştırma belgesi olarak yayımlamıştır. anthropic.com/research/claude-s-constitution adresinden orijinal metin okunabilir; belge hangi ilkelerin neden dahil edildiğini gerekçeleriyle açıklar.
  • check_circle RLAIF ile RLHF arasındaki temel fark nedir?: RLHF'de tercih sıralaması insan değerlendiriciler tarafından yapılır; bu süreç pahalı ve yavaştır. RLAIF'te (CAI'nın RL-CAI aşaması) bu görev bir AI hakeme devredilir; hakem anayasaya göre hangi yanıtın daha iyi olduğuna karar verir. İnsan müdahalesi minimum düzeye iner, bu da tekniğin çok daha büyük ölçeklerde çalışmasını mümkün kılar.