activation steering mekanik yorumlanabilirlik yapay zeka güvenliği LLM representation engineering transformer model hizalama

Activation Steering Nedir? LLM Aktivasyon Yönlendirme

İleri
person Yapay Zeka Uzmanı
list_altİçindekilerexpand_more
  1. 01Activation Steering Nedir?
  2. 02Transformer’da Aktivasyonlar Nasıl Çalışır?
  3. 03Steering Vektörleri: Mekanizma
  4. 04Representation Engineering ve Öncü Araştırmalar
  5. 05Uygulama Senaryoları
  6. 06Activation Steering vs. Fine-Tuning vs. Prompt Engineering
  7. 07Sınırlamalar ve Riskler
  8. 08Mekanik Yorumlanabilirlik ile İlişkisi
  9. 09Kontrol Edilebilir Yapay Zekaya Doğru
Editorial tech-magazine cover illustration about activation steering in large language models, glowing directional activation vectors flowing through transformer layers, luminous energy beams steering and reshaping neural network pathways, abstract artificial-intelligence motifs (glowing neural networks, flowing data, subtle circuitry), sophisticated modern concept art, clean balanced composition, soft cinematic studio lighting, rich depth of field, premium color grading in deep navy blues with cyan and magenta accents, highly detailed, polished editorial 8k. No text, no words, no letters, no captions, no logos, no watermark, no UI.

Activation steering: transformer katmanlarından geçen yönlü aktivasyon vektörlerini gösteren editöryal illüstrasyon

Bir dil modelinin davranışını değiştirmek istediğinizde akla gelen ilk yol ince ayar (fine-tuning) ya da prompt mühendisliğidir. Fine-tuning zaman ve hesaplama kaynağı gerektirir; prompt mühendisliği tutarlı sonuç vermez. Activation steering bunların ikisinin dışında üçüncü bir yol: modelin iç aktivasyonlarına doğrudan müdahale ederek tek bir iletim geçişinde davranışı yönlendirmek.

Activation Steering Nedir?

Activation steering, bir büyük dil modelinin (LLM) çıkarım (inference) aşamasında, belirli bir katmandaki gizli durumlarına (hidden states) sayısal vektörler ekleyerek ya da çıkararak modelin çıktısını şekillendiren bir tekniktir. Model ağırlıkları değişmez; değişen yalnızca o iletim geçişindeki aktivasyonlardır.

Basit bir benzetme: modelin iç temsil uzayında “mutluluk” yönüne karşılık gelen geometrik bir yön varsa, bunu aktivasyonlara yeterli büyüklükte eklemek modeli o geçişte daha olumlu yanıtlar üretmeye yönlendirebilir. Katsayı çok küçükse etki görünmez; çok büyükse model tutarsız çıktılar üretmeye başlar.

Bu tekniği adlandıran çalışma 2023’te yayımlandı. O tarihten bu yana AI güvenliği, yorumlanabilirlik ve hizalama araştırmacıları tekniği farklı modeller ve hedefler üzerinde kapsamlı biçimde test etti.

Transformer’da Aktivasyonlar Nasıl Çalışır?

Modern LLM’lerin neredeyse tamamı transformer mimarisine dayanır. Bir transformer, girdi tokenlarını art arda dizilen katmanlardan geçirir. Her katman önceki katmanın çıktısını alır, üzerine dikkat mekanizması ve ileri beslemeli ağ hesaplamaları yapar ve bir sonraki katmana iletir. Bu seri yapıya “residual stream” (artık akış) denir.

Residual stream’in önemli özelliği şu: her katman, önceki katmanın temsiliyle toplanır. Her katman kendi öğrendiklerini mevcut temsilin üstüne biriktirir. Bu toplama yapısı, dışarıdan bir vektör eklemeye doğal bir giriş noktası oluşturur. Eklenen vektör, bir katman çıktısıymış gibi sonraki hesaplamalara taşınır.

Dikkat mekanizması, hangi tokenların birbirini ne kadar etkilediğine karar verir. Her dikkat kafası farklı ilişkilere odaklanır: sözdizimsel bağlantılar, semantik benzerlik, pozisyon bilgisi. Activation steering bu dikkat hesaplamalarından önce ya da sonra müdahale edebilir; hangi katmanın seçildiği sonucu doğrudan etkiler.

Latent uzayda anlamsal bilgi doğrusal yapılar olarak kodlanmış görünür. Modelin belirli bir kavramı nasıl temsil ettiğini bir yön olarak ifade edebilirseniz, o yönü güçlendirmek ya da bastırmak da mümkün hale gelir.

Steering Vektörleri: Mekanizma

Bir steering vektörü nasıl elde edilir? En yaygın yöntem kontrastif aktivasyon farkı almak:

  1. “Pozitif” bir konsepti içeren bir prompt grubu belirlenir (örneğin korku duygusu hakkında metinler).
  2. Aynı yapıda fakat konsept içermeyen ya da zıt konsepti olan “negatif” bir prompt grubu hazırlanır.
  3. Her iki grup için model belirli bir katmanın aktivasyonları kaydedilir.
  4. Pozitif grubun ortalama aktivasyonlarından negatif grubun ortalama aktivasyonları çıkarılır.
  5. Elde edilen fark vektörü, hedef konsepte karşılık gelen yön olarak kullanılır.

Bu vektör elde edildikten sonra çıkarım aşamasında istenilen iletim geçişine eklenir. Vektörün katsayısı (scale factor) modele ne kadar kuvvetle müdahale edildiğini belirler. Pozitif katsayı konsepti güçlendirir, negatif katsayı bastırır.

Hangi katmana enjekte edileceği kritik bir hiperparametredir. Genellikle orta katmanlar tercih edilir: ilk katmanlar ham sözdizimsel bilgi işlerken, son katmanlar çıktı olasılıklarına çok yakındır ve yüksek katsayılı müdahale orada gürültü yaratabilir. Modelin derinliğine ve görevin niteliğine göre bu seçim deneysel kalibrasyonla belirlenir.

Representation Engineering ve Öncü Araştırmalar

Activation steering’in teorik zeminini en kapsamlı biçimde ortaya koyan çalışma, Andy Zou ve ekibinin 2023’te yayımladığı “Representation Engineering: A Top-Down Approach to AI Transparency” makalesidir. Bu çalışma yalnızca tekniği tanımlamakla kalmadı; “dürüstlük,” “mutluluk” ve “korku” gibi soyut kavramların modellerde lineer yönler (linear directions) olarak kodlandığını sistematik şekilde gösterdi. Bu yönler kontrollü müdahaleye açık.

Turner ve ekibinin “Activation Addition” çalışması daha doğrudan bir yaklaşım benimsedi: iki farklı prompt arasındaki aktivasyon farkını doğrudan residual stream’e ekledi ve davranış değişikliklerini gözlemledi. “Muz” konseptine karşılık gelen bir vektörü enjekte ettiklerinde modelin her yanıtında o konseptin bir şekilde belirdiğini gösterdi. Soyut görünen tekniği somutlaştıran bir kanıt oldu.

Anthropic’in 2024’te Claude 3 Sonnet üzerinde yayımladığı feature steering deneyleri bu alanda önemli bir adım. Mekanik yorumlanabilirlik araştırmacıları, sparse autoencoderlar aracılığıyla çıkardıkları özellikleri doğrudan hedefleyerek modele konseptler enjekte etti. Doğru özellik etkinleştirildiğinde model beklenen biçimde davrandı; yanlış konsept enjeksiyonu ise tutarsız çıktılar üretti.

Pratik araçlar: Activation steering deneyleri için bugün en yaygın kullanılan kütüphane TransformerLens. GPT-2’den Llama ailesine kadar pek çok modeli kapsayan bu araç, aktivasyonlara hook mekanizmasıyla müdahale etmeyi birkaç satır Python’a indiriyor. nnsight, EleutherAI’ın geliştirdiği daha yeni bir alternatif; büyük modelleri paylaşımlı sunucularda çalıştırırken bile uzaktan aktivasyon müdahalesine izin veriyor. Representation Engineering çalışmasının kendi kod deposu da Zou ekibinin deneyleri yeniden üretmek için kullanılabilecek referans uygulamalar içeriyor. Bu araçlarla bir GPT-2 Small üzerinde temel bir steering deneyi saatler içinde kurulabilir; küçük modellerden başlamak, katman seçimi ve katsayı kalibrasyonunu kavramak için doğal bir başlangıç noktasıdır. Daha büyük modellere geçiş, donanım erişiminden bağımsız olarak, aynı kavramsal çerçeveyi takip eder.

Uygulama Senaryoları

Güvenlik davranışı kontrolü: Modelin reddetme kararları belirli iç aktivasyon örüntülerine karşılık gelir. Activation steering bu örüntüleri güçlendirerek ya da zayıflatarak modeli daha katı veya daha esnek bir reddetme eşiğine taşıyabiliyor. Bu analiz hem saldırı tespiti hem de güvenli deployment kalibrasyonu için bilgi üretiyor.

Duygu ve ton yönlendirme: Bir modelin yanıtlarının duygusal tonu, kullanıcı bağlamına göre ayarlanabilir. Müşteri hizmetleri uygulamalarında empati yönündeki bir vektör eklemek ya da teknik dokümantasyonda daha nötr bir ton elde etmek için bu teknik uygulanabilir. Fine-tuning gerektirmeyen bu yaklaşım anlık ve geri alınabilir; aynı model farklı deployment’larda farklı şekilde yönlendirilebilir.

Probing ve gizli temsil sondajı: Araştırmacılar, modelin “biliyor mu?” sorusunu aktivasyon katmanlarını inceleyerek yanıtlıyor. Activation steering tersine de çalışır: modelin bir bilgiyi gizleyip gizlemediğini test etmek için o bilgiye karşılık gelen yönde müdahale yapıldığında yanıtta değişim gözlemleniyorsa, modelin o bilgiye erişimi var demektir.

Jailbreak tespiti ve savunma: Zararlı prompt’lar modelin iç aktivasyonlarında ayırt edici örüntüler bırakır. Bu örüntüleri erken katmanlarda tespit etmek ve karşı yönde bir vektörle bastırmak, çıktı katmanına ulaşmadan müdahale imkânı yaratır. AI red teaming araştırmacıları bu yaklaşımı, mevcut filtreleme katmanlarını tamamlayan bir savunma mekanizması olarak inceliyor.

Activation Steering vs. Fine-Tuning vs. Prompt Engineering

Bu üç yaklaşım birbirini dışlamaz; farklı sorunlara farklı biçimde yanıt verir.

Prompt engineering en hızlı ve en ucuz yöntem. Hiçbir model bileşenine dokunulmaz; yalnızca girdi değiştirilir. Ana sorunu tutarsızlık: aynı prompt farklı bağlamlarda farklı sonuç üretir. Modelin iç eğilimini değil, yalnızca o prompttaki davranışı değiştirdiği için derin sorunları gidermez.

Fine-tuning, model ağırlıklarını doğrudan günceller. Kalıcı ve tutarlıdır, ama ciddi hesaplama kaynağı gerektirir. RLHF ve DPO gibi hizalama teknikleri bu kategoride yer alır. Yeni davranış ağırlıklara “yazıldığı” için hangi özelliklerin değiştiğini anlamak güçleşir.

Activation steering anlık ve geri alınabilir. Ağırlıklar değişmez; müdahale yalnızca o iletim geçişinde geçerlidir. Bu, deney döngüsünü kısaltır ve A/B testi yapmayı kolaylaştırır. Temel sınırı da burada: kalıcı değil, her iletim geçişinde uygulanması gerekir. Production sistemlerinde ek hesaplama yükü getirse de ağırlık güncellemesine kıyasla bu yük ihmal edilebilir düzeyde.

Kaba bir çerçeve: prompt engineering davranışı o an şekillendirir, fine-tuning modelin “kişiliğini” kalıcı olarak yazar, activation steering belirli bir geçişte modeli yönlendirir.

Sınırlamalar ve Riskler

Özellik etkileşimi (feature interaction): LLM’lerin iç temsilleri karmaşık biçimde iç içe geçer. “Korku” yönüne müdahale edildiğinde “tehlike” ya da “uyarı” gibi kavramlar da etkilenebilir. Hangi özelliklerin birbirine geçtiğini (entangled) önceden öngörmek güçtür ve bu beklenmedik yan etkilere yol açar.

Davranış tutarsızlığı: Yüksek katsayılarla yapılan müdahaleler modeli tekrarlayan ya da anlamsız metinler üretmeye itebilir. Bu durum “oversteering” (aşırı yönlendirme) olarak adlandırılır. Katsayı seçimi bu nedenle deneysel kalibrasyona bağımlıdır; her model ve her hedef konsept için ayrı ayrı ayarlanması gerekir.

Model özgüllüğü: Bir modelde işe yarayan steering vektörü başka bir modelde çalışmayabilir. Katman sayısı, gizli boyut ve dikkat kafası sayısı gibi mimari farklılıklar transfer edilebilirliği sınırlar. Aynı model ailesinin farklı boyutları arasında kısmi transfer görülmüş olsa da genel geçer bir çözüm henüz yok.

Kötüye kullanım potansiyeli: Teknik açık kaynak ve yeniden üretilebilir. Güvenlik mekanizmalarını bastırmak için kullanılabilmesi ciddi bir risk. Bu durum, mevcut güvenlik katmanlarının tek başına yeterli olmadığına işaret ediyor; Constitutional AI gibi eğitim zamanı yaklaşımlarıyla birlikte ele alınması gerekiyor.

Mekanik Yorumlanabilirlik ile İlişkisi

Activation steering ve mekanik yorumlanabilirlik birbirini besleyen iki alan. Sparse autoencoder araçları, modelin aktivasyonlarını yorumlanabilir özelliklere ayrıştırarak hangi yönlerin anlamlı kavramlara karşılık geldiğini belirler. Bu harita, hedefli steering için bir kılavuz işlevi görür — neyi nereye enjekte edeceğinizi bilmeden aktivasyon yönlendirmesi kör bir denemedir.

Circuit analysis (devre analizi) açısından activation steering, belirli devrelerin varlığını test etmenin pratik bir yolu. “Bu bileşenler X kavramından sorumlu” hipotezini, o yönü doğrudan enjekte ederek davranışın beklendiği gibi değişip değişmediğini gözlemleyerek doğrulayabilirsiniz. Mekanik yorumlanabilirlik araştırmacıları bu yaklaşımı hipotez testi için kullanıyor.

Feature suppression da özellikle ilginç bir uygulama. Bir modelin belirli bir bilgiyi ya da davranışı bastırıp bastırmadığını anlamak için ilgili özellik yönünde güçlendirme yapıldığında davranış değişiyorsa, bastırma mekanizması doğrulanmış olur. Bu yaklaşım modelin “bilip bilmediği” ile “söyleyip söylemediği” arasındaki farkı ayırt etmek için kullanılıyor.

Kontrol Edilebilir Yapay Zekaya Doğru

Activation steering, daha geniş bir programın parçası: AI sistemlerinin davranışını eğitim sonrasında da güvenilir biçimde şekillendirebilmek. Scalable oversight tartışmalarında, insan denetiminin yetersiz kaldığı durumlarda modeli iç yapısından anlayarak yönlendirmek kritik bir araç haline gelebilir.

Interpretability-based alignment fikri şunu öne sürüyor: modelin neyi nasıl temsil ettiğini anlayabilirseniz, davranışı çok daha güvenilir biçimde şekillendirebilirsiniz. Activation steering bu fikri pratiğe taşımanın bugün elimizdeki en doğrudan yolu.

Araştırmanın önündeki büyük açık sorular şunlar: Farklı modeller arasında genel geçer özellik haritaları oluşturulabilir mi? Çok daha büyük modellerde teknik ölçeklenebilir mi? Gerçek zamanlı deployment’ta tutarlı biçimde uygulanabilir mi?

Bu sorular yanıt beklerken teknik hızla olgunlaşıyor. Güvenlik araştırmacıları, yorumlanabilirlik ekipleri ve hizalama çalışanları activation steering’i ortak bir araç olarak benimsiyor. Kontrol edilebilir yapay zeka hedefi için bu yalnızca bir parça; ancak diğer parçaların da yerine oturmasına yardımcı olan, somut ve denenebilir bir parça.

auto_stories İlgili Makaleler