Mechanistic Interpretability (Mekanistik Yorumlanabilirlik)

Mekanistik Yorumlanabilirlik, yapay sinir ağlarının iç hesaplama mekanizmalarını tersine mühendislikle analiz eden yapay zeka araştırma alanıdır.

Mekanistik Yorumlanabilirlik (Mechanistic Interpretability), yapay sinir ağlarının iç hesaplama mekanizmalarını tersine mühendislik yöntemleriyle anlama ve açıklama çabasıdır. Bu disiplin, büyük dil modelleri ve derin öğrenme sistemlerinin 'kara kutu' olarak adlandırılan opak yapısını çözerek hangi nöronların hangi kavramları kodladığını, hangi devrelerin (circuit) belirli hesaplamaları yürüttüğünü ve bu bileşenlerin birbirleriyle nasıl etkileşime girdiğini açıklamayı hedefler. Alan üç soyutlama katmanı üzerinde yoğunlaşır: Nöron düzeyinde tek bir aktivasyon biriminin hangi özellikleri (feature) temsil ettiği incelenir; devre düzeyinde nöronlar ve dikkat kafaları arasındaki örüntüler haritalanır; algoritma düzeyinde ise modelin gerçekleştirdiği üst düzey hesaplamaların soyut açıklaması yapılır. Bu hiyerarşi, 'modelde ne oluyor?' sorusunu aşamalı olarak yanıtlamayı mümkün kılar. Başlıca araçlardan biri Seyrek Otokodlayıcılardır (Sparse Autoencoder — SAE). SAE'ler, modelin iç aktivasyonlarını yorumlanabilir, monosemantik (tek anlamlı) özelliklere ayrıştırarak polisemantikliği (bir nöronun birden fazla kavramı kodlaması) azaltır. Anthropic'in geliştirdiği devre izleme (circuit tracing) tekniği, Claude 3.5 Haiku üzerinde çok adımlı akıl yürütme, halüsinasyon ve reddedişler (refusal) konusunda nedensel haritalar üretmiştir. Google DeepMind ise benzer teknikleri dil ve görüntü modellerine uygulamıştır. 2026 yılında MIT Breakthrough Technology listesine giren mekanistik yorumlanabilirlik; AI güvenliği, model denetimi, halüsinasyon tespiti ve kötüye kullanım önleme açısından kritik bir altyapı haline gelmiştir. Anthropic, Google DeepMind ve EleutherAI bu alanda öncü araştırma gruplarıdır. Alan 2021'de yalnızca bir avuç araştırmacıya sahipken 2026'da yüzlerce aktif katkıcıya ulaşmıştır.

Mekanistik Yorumlanabilirlik Neden Önemlidir?

Büyük dil modellerinin karar verme süreçleri, geleneksel makine öğrenmesine kıyasla çok daha karmaşık ve opaktır. Model milyarlarca parametre üzerinden çalışır; ancak bu parametrelerin neden o çıktıyı ürettiğini anlamak son derece güçtür. Mekanistik yorumlanabilirlik, bu belirsizliği tersine mühendislik yaklaşımıyla gidermeye çalışır. Amaç, modeli bir 'derlenmiş program' gibi inceleyerek, hangi bileşenin hangi işlevi yerine getirdiğini açıkça ortaya koymaktır. Bu yaklaşım özellikle üç kritik sorun alanında değer üretir: halüsinasyonların (uydurma bilgi) kaynağını tespit etmek, modelin istenmeyen davranışlarını (önyargı, zararlı içerik) kökten anlamak ve AI güvenliği araştırmalarına somut araçlar sunmak. Bir modelin neden yanlış bilgi verdiğini veya neden bir isteği reddettiğini mekanistik düzeyde açıklayabilmek, hem geliştirici hem de denetleyici açısından kritik bir yetenektir.

Temel Kavramlar: Devreler, Özellikler ve Dikkat Kafaları

Mekanistik yorumlanabilirlik araştırmacıları, modelleri üç katmanda inceler. Nöron düzeyinde, model içindeki her aktivasyon biriminin hangi kavramsal özellikleri temsil ettiği sorgulanır. Ancak çoğu nöron polisemantiktir — yani aynı nöron birden fazla ilgisiz kavramı birlikte kodlar. Bu, yorumlamayı güçleştirir. Devre düzeyinde, belirli bir görevi (örneğin isim-fiil eşleştirme veya baş harf büyütme) gerçekleştiren nöronlar ve dikkat kafaları arasındaki işlevsel ağlar haritalanır. Dikkat kafaları arasında 'indüksiyon kafaları' (önceki örüntüyü kopyalayan devre) bu analizlerin en çok çalışılan yapılarıdır. Algoritma düzeyinde ise modelin bir bütün olarak hangi soyut hesaplamayı yaptığı açıklanmaya çalışılır. Çok adımlı aritmetik, bağlaç kullanımı veya sözdizimsel bağımlılık gibi üst düzey görevler bu katmanda modellenir.

Seyrek Otokodlayıcı (SAE) ile Polisemantikliği Çözme

Seyrek Otokodlayıcılar (SAE), mekanistik yorumlanabilirlik araştırmalarının en güçlü araçlarından biridir. Temel fikir basittir: modelin iç aktivasyonlarını, her biri tek bir kavramla ilişkili olan çok sayıda seyrek özelliğe (sparse feature) ayrıştırmak. SAE, büyük bir modelden alınan aktivasyon vektörlerini girdi olarak alır ve onları daha geniş ama seyrek bir temsile kodlar. Bu temsildeki her boyut idealde tek bir kavramla (örneğin 'Paris şehri', 'olumsuzluk', 'kod değişkeni') eşleşir. Böylece polisemantik nöronlar monosemantik özelliklere dönüştürülür ve yorumlama kolaylaşır. Anthropic, 2024-2025 döneminde büyük ölçekli SAE analizleriyle Claude modellerindeki yüz binlerce özelliği haritalandırmış; bu özellikler arasında duygusal durumlar, coğrafi kavramlar ve programlama yapıları gibi geniş bir spektrum bulunmuştur.

Araştırma Alanları ve Kullanım Senaryoları

  • check_circle AI Güvenliği ve Denetim: Modelin güvenlik sınırlarını aşan veya zararlı içerik üreten devrelerin tespit edilmesi ve pasifleştirilmesi.
  • check_circle Halüsinasyon Tespiti: Modelin uydurma bilgi üretirken hangi devre örüntüsünü izlediğinin haritası çıkarılarak önleyici müdahale yapılması.
  • check_circle Model Hata Ayıklama: Önyargıların veya beklenmedik davranışların kaynağını tam olarak belirleyerek hedefli ince ayar (fine-tuning) yapılması.
  • check_circle Düzenleyici Şeffaflık: AB Yapay Zeka Yasası gibi düzenlemeler kapsamında modelin nedensel karar açıklamalarının sunulabilmesi.
  • check_circle Bilgi Keşfi: Modelin dünya bilgisini nasıl temsil ettiğini anlamak: coğrafi kavramlar, matematiksel ilişkiler ve dilbilgisel örüntüler.

Sıkça Sorulan Sorular

  • check_circle Mekanistik yorumlanabilirlik ile açıklanabilir AI (XAI) farkı nedir?: XAI genellikle modelin girdilere göre çıktılarını açıklamaya odaklanır (örneğin SHAP, LIME). Mekanistik yorumlanabilirlik ise modelin iç hesaplama mekanizmalarını — hangi devre, hangi nöron — nedenselliğe kadar anlamayı hedefler; bu çok daha derin bir analizdir.
  • check_circle Seyrek Otokodlayıcı (SAE) başka ne için kullanılır?: SAE'ler yorumlanabilirlik dışında model davranışını düzenleme (steering), zararlı özellikleri susturma (ablation) ve modelin hangi bilgiyi 'bildiğinin' haritasını çıkarma (knowledge mapping) gibi görevler için de kullanılmaktadır.
  • check_circle Bu alan uygulamaya ne kadar hazır?: 2026 itibarıyla Anthropic, SAE analizlerini Claude modellerinin güvenlik değerlendirmesinde aktif olarak kullanmaktadır. Ancak büyük modellerde devrelerin tam haritasını çıkarmak hâlâ onlarca araştırmacı-yılı gerektiren açık bir problemdir.
  • check_circle Neden 'mekanistik' adı kullanılıyor?: Model, tıpkı bir mekanizma gibi analiz edilir: giriş nasıl çıkışa dönüştürülüyor, bu dönüşümde hangi parçalar rol oynuyor ve bu parçalar birbiriyle nasıl etkileşiyor? Bu mekanik analoji, alanın nedensellik odaklı yaklaşımını yansıtır.