Constitutional AI (Anayasal Yapay Zeka)

Constitutional AI, modeli yazılı ilkelerden oluşan bir anayasayla hizalayan ve büyük ölçüde AI geri bildirimini kullanan Anthropic'in hizalama tekniğidir.

Constitutional AI (CAI — Anayasal Yapay Zeka), Anthropic tarafından 2022 yılında geliştirilen ve yapay zeka modellerini belirli bir etik ve değer "anayasasına" göre hizalayan bir tekniktir. Geleneksel RLHF'nin yararlılık ve zararsızlık değerlendirmesi için insanlar yerine büyük ölçüde yapay zeka geri bildirimini (AI feedback) kullanan Constitutional AI, ölçeklenebilir hizalama arayışındaki önemli bir adım olarak görülmektedir. Constitutional AI iki aşamada çalışır. SL-CAI (Supervised Learning — CAI): Modele zararlı veya sorunlu yanıt ürettirilir, ardından yazılı bir anayasadaki ilkeler listesi (örn. "Faydalı, zararsız ve dürüst ol", "İnsan haklarına saygı göster") aracılığıyla model kendi yanıtını eleştirir ve düzeltir. Bu eleştiri-revizyon döngüsü birkaç tur tekrarlanır ve üretilen yüksek kaliteli yanıtlar denetimli öğrenme için kullanılır. RL-CAI (Reinforcement Learning — CAI): RLHF'deki insan tercih sıralamasının yerine bir yapay zeka hakem modeli (AI preference model) kullanılır; hakem, anayasadaki ilkelere göre hangi yanıtın daha iyi olduğuna karar verir. Bu tercih verileriyle eğitilen ödül modeli, PPO yerine direkt tercih optimizasyonuyla politikayı günceller. Constitutional AI; insan etiketleyici gereksinimini azaltırken zararlılık değerlendirmesini şeffaf hale getirir ve denetlenebilir bir değer kümesine dayandırır. Claude modeli serisi bu teknikle eğitilmiştir.

account_balance Constitutional AI Nasıl Çalışır?

Constitutional AI iki ana aşamadan oluşur. SL-CAI aşaması: İlk olarak model, zararlı veya sorunlu bir istem için yanıt üretir. Ardından modele anayasadan rastgele seçilmiş bir ilke gösterilir ("Bu yanıt dürüst, zararsız ve yardımcı mı?"). Model kendi yanıtını bu ilke ışığında eleştirir (critique). Eleştiri bağlamında yanıtı yeniden yazar (revision). Bu eleştiri-revizyon döngüsü birkaç tur tekrarlanır. En son yeniden yazılan yanıtlar SL-CAI verisi olarak kullanılır ve model bu veriyle fine-tune edilir. RL-CAI aşaması: Modele aynı isteğe karşılık iki farklı yanıt ürettirilir. Bir AI hakem modeli, anayasadaki ilkelere dayanarak hangi yanıtın tercih edilmesi gerektiğini değerlendirir. Bu AI tercih verileriyle bir ödül modeli eğitilir (RLAIF). Politika modeli bu ödül modeliyle RL ile güncellenir.

RLHF vs Constitutional AI

person RLHF

İnsan değerlendiriciler tercih sıralaması yapar. Ölçeklenmesi zordur, pahalıdır, değer kümesi örtük ve tutarsız olabilir.

account_balance Constitutional AI

Yazılı anayasa + AI hakem. İnsan etiketleyici azaltılır, değer kümesi şeffaf ve denetlenebilir, ölçeklenebilir.

refresh Öz-Eleştiri Döngüsü

Model kendi yanıtını anayasaya göre eleştirir ve düzeltir. Bu "red team + blue team" döngüsü modelin zayıf yanıtlarını tespit etmesini sağlar.

smart_toy RLAIF

Reinforcement Learning from AI Feedback: İnsan yerine AI tercihlerinden öğrenme. CAI'ın RL-CAI aşaması bu kavramın öncü uygulamasıdır.

gavel Anayasa İlkeleri

  • check_circle Harmlessness (Zararsızlık): Fiziksel, psikolojik, mali veya sosyal zarar verebilecek içerik üretmemek. Silah yapımı, dolandırıcılık veya nefret söylemi içeren taleplere yardım etmemek.
  • check_circle Helpfulness (Yararlılık): Meşru istemlere net, doğru ve kapsamlı yanıtlar vermek. Aşırı ihtiyatlılığın (over-refusal) gereksiz redlere yol açmaması.
  • check_circle Honesty (Dürüstlük): Belirsizlik olduğunda bunu kabul etmek, hallucination yapmamak, manipülatif ikna tekniklerinden kaçınmak.
  • check_circle Uluslararası İnsan Hakları: Anthropic'in anayasası BM İnsan Hakları Evrensel Beyannamesi ve diğer uluslararası belgelerden ilkeler içerir.

quiz Sıkça Sorulan Sorular

  • check_circle Constitutional AI tam olarak hangi sorunları çözer?: RLHF'nin ölçeklenebilirlik sorununu (çok fazla insan etiketi gerektirir) ve şeffaflık sorununu (değer kümesi örtük) ele alır. Anayasa herkese açık, tartışılabilir ve güncellenebilir bir belge olarak yayımlanabilir.
  • check_circle Anayasayı kim yazar?: Anthropic araştırmacıları ve editörleri anayasayı hazırlar. Anayasanın içeriği şirketin değerlerini yansıtır. Anthropic, Claude modeli için kullandığı anayasayı kamuoyuyla paylaşmıştır.
  • check_circle Constitutional AI ile Claude ne kadar farklı davranıyor?: CAI ile eğitilen modeller, standart RLHF modellerine kıyasla daha az saldırgan red yanıtı üretirken zararlı içerik üretimini engellemede benzer başarı sergiler. Zararsızlık-yararlılık dengesi daha iyi ayarlanmıştır.