Yapay Zeka Bu Zeka Testlerinde Zorlanıyor: Siz Daha İyi Misiniz? — yapay zeka haberi
newspaper Haber edit_note yapayzekasozluk.tr Haber Masası schedule 26 Ağustos 2026 · 12:01 timer 4 dk okuma

Yapay Zeka Bu Zeka Testlerinde Zorlanıyor: Siz Daha İyi Misiniz?

Yapay zeka modelleri bulmaca çözmede hızla ilerliyor ancak uzamsal akıl yürütme, görsel bulmacalar ve sezgisel tuzaklarda hâlâ insanların gerisinde. İşte modellerin takıldığı zeka testleri ve sizin performansınızı ölçme şansı.

Bulmacalar ve Yapay Zeka Tarihi

Bulmacalar ve oyunlar, yapay zeka (YZ) araştırmalarının başlangıcından bu yana merkezi bir rol oynuyor. İnsanlar zekalarını çengel bulmaca veya mantık sorularıyla sınarken, geliştiriciler de modellerin ne kadar ilerlediğini oyun tabanlı testlerle ölçüyor. "Makine öğrenimi" (machine learning) terimi, 1959'da IBM bilgisayar bilimcisi Arthur Samuel'in dama oynamayı öğrenen bir algoritma üzerine yazdığı makaleyle popülerlik kazandı. Satranç ve Çin'in Go oyunu da ünlü YZ test alanları arasında. Sadece bulmaca becerilerine bakıldığında, YZ hızla gelişiyor. Columbia Üniversitesi'nden bir ekip, 2024 sonunda en iyi modellerin New York Times'ın ünlü Connections bulmacalarının yalnızca %18'ini çözebildiğini gösterdi; 2025 başında bazı modeller neredeyse her seferinde mükemmele yakın sonuçlar elde etti. Bu ilerleme, modellerin eğitim verisi ve algoritmalarındaki iyileşmelerin bir yansıması olarak görülüyor.

Uzamsal Akıl Yürütme Zorlukları

İnsanların büyük avantaja sahip olduğu alanlardan biri uzamsal akıl yürütme (spatial reasoning). Zeka testlerinde sıkça karşılaşılan zihinsel döndürme (mental rotation) problemleri, farklı açılardan gösterilen görsellerin aynı nesneyi temsil edip etmediğini belirlemeyi gerektirir. Günümüzün dil modelleri (LLM) görsel girdileri analiz edebilse de bu tür bulmacalarda oldukça başarısız. Dünya modellerinin (world models) fiziksel ortamları anlamaya yardımcı olabileceği konuşulsa da, LLM'ler mimarlar ve makine mühendisleri gibi 3D nesneleri zihinsel olarak manipüle edemiyor. Bu, YZ'nin görsel-uzamsal yeteneklerindeki belirgin bir eksiklik olarak öne çıkıyor. Örneğin, bir model bir küpün döndürülmüş halini tanımakta zorlanırken, bir insan bu görevi saniyeler içinde tamamlayabiliyor. Bu fark, özellikle robotik ve otonom sistemler gibi alanlarda YZ'nin fiziksel dünyayı anlama kapasitesinin sınırlı olduğunu gösteriyor.

Bellek ve Uyum Sorunları

Frontier LLM'ler devasa miktarda veriyle eğitildikleri için olağanüstü hafızalara sahip; bu, bilgi yarışmalarında insanları geride bırakmalarını sağlıyor. Ancak bu durum bir dezavantaja dönüşebiliyor. Eğitim sırasında gördüğü bir bulmacaya benzer bir soruyla karşılaştığında model, kilit farklılıkları göz ardı edip ezberlediği cevabı verebiliyor. Google ve Illinois Urbana-Champaign Üniversitesi'nden araştırmacıların 2024'te yaptığı bir çalışma, Şövalyeler ve Haydutlar (Knights and Knaves) bulmacasının küçük varyasyonlarında modellerin bu tuzağa düştüğünü gösterdi. Benzer bir durum, SimpleBench testinde de geçerli: Bu sorular, modellerin eğitimde karşılaştığı karmaşık problemleri andırıyor; insanlar hileyi hemen fark ederken, üst düzey modeller bile tökezliyor. Bu durum, modellerin ezberden çok genelleme yapma yeteneğinin sınırlı olduğunu ortaya koyuyor. Özellikle Türkçe gibi daha az kaynakla eğitilen dillerde bu sorun daha da belirgin hale gelebilir; çünkü model, eğitim verisinde benzer bir örnekle karşılaşma olasılığı düşük olduğunda dahi ezber eğilimi gösterebiliyor.

Soyut ve Görsel Bulmacalar

YZ, yalnızca 3D görsel problemlerde değil, iki boyutlu görsellerde de zorlanıyor. Bu, en ünlü bulmaca tabanlı kıyaslama olan ARC-AGI'daki performansı önemli ölçüde etkiliyor. Bu problemler, örneklerden soyut ve genel kurallar çıkarmayı gerektiriyor. Modeller, her ızgarayı görsel yerine renk kodlarını içeren sayı dizisi olarak aldıklarında daha iyi sonuç veriyor. Araştırmalar, modellerin ARC-AGI sorularını doğru yanıtlasa bile genellikle karmaşık ve genellenemeyen kurallar kullandığını, insanların ise basit görsel kavramlara dayandığını gösteriyor. Son bir yılda modeller bu alanda önemli ilerleme kaydetse de bazı bulmacalar hâlâ onları şaşırtıyor. Örneğin, bir ızgaranın dönüşüm kuralını çözmek için model, binlerce olasılık arasından geçici bir eşleşme bulabiliyor; ancak bu kuralı yeni bir örneğe uyguladığında başarısız oluyor. Bu, modellerin görsel desenleri anlamaktan çok istatistiksel kalıpları ezberleme eğiliminde olduğunu gösteriyor.

Sezgisel Tuzaklar ve İnsan Bilişi

Sadece YZ modelleri tuzaklara düşmüyor; insanların da kendi bilişsel zaafları var. Psikologlar, SimpleBench'in tersine işleyen soru setleri tasarladı: Bu sorularda insanlar genellikle ani tepkiler verirken, modeller daha düşünerek yanıt veriyor. Bazı problemler sezgisel matematik hatalarını sömürürken, diğerleri dikkatli okunmadığında bariz görünen ama aslında yanlış olan cevapları teşvik ediyor. Örneğin, bir top ve sopanın toplam 1.10 dolar tuttuğu ve sopanın toptan 1 dolar daha pahalı olduğu klasik problemde, insanlar genellikle topun 10 sent olduğunu söyler; ancak doğru cevap 5 senttir. Modeller bu tür sorularda daha dikkatli hesaplama yapabiliyor. Bu, insan ve makine bilişi arasındaki farklılıkları ortaya koyuyor; insan sezgisi hızlı ama hatalı olabilirken, modeller daha sistematik ama esneklikten yoksun kalabiliyor.

Artan Karmaşıklıkla Mücadele

LLM'lerin bulmaca çözme yeteneği bazen ölçekle ilgili. Apple'dan araştırmacıların yaptığı bir çalışma, modellerin Hanoi Kulesi ve nehir geçişi bulmacalarının basit versiyonlarını başarıyla çözdüğünü, ancak disk veya kişi sayısı altıya ulaştığında hata yapmaya başladığını gösterdi. Washington Üniversitesi, Stanford ve Allen Institute for AI'daki araştırmacılar da mantık ızgarası bulmacalarında (logic grid puzzles) benzer zorluklar gözlemledi. Apple makalesi viral olsa da, yorumcular bu sonuçların LLM akıl yürütmesine özgü bir sınırlama mı yoksa karmaşıklık arttıkça hata yapmanın normal bir durum mu olduğunu sorguladı. Bu tartışma, YZ'nin gerçek dünya problemlerinde ne kadar güvenilir olduğu konusunda önemli soruları gündeme getiriyor. Özellikle lojistik, planlama ve karar destek sistemleri gibi alanlarda, karmaşık görevlerde modellerin hata yapma olasılığı, insan denetiminin gerekliliğini vurguluyor.

Neden Önemli?

Bu bulmacalar, yapay zekanın güçlü ve zayıf yönlerini anlamak için önemli bir pencere sunuyor. Türkiye'de yapay zeka alanında çalışan araştırmacılar ve meraklılar için, modellerin uzamsal akıl yürütme ve görsel algı gibi konularda hâlâ insanlardan uzak olduğunu görmek, bu teknolojinin sınırlarını kavramak açısından değerli. Ayrıca, sezgisel tuzaklar ve ezberden kaynaklanan hatalar, modellerin gerçek dünyadaki görevlerde (örneğin görüntü analizi veya karar destek sistemleri) dikkatli kullanılması gerektiğini gösteriyor. Bu testler, YZ'nin her alanda insanları geçmediğini ve belirli bilişsel görevlerde insan sezgisinin hâlâ önemli olduğunu hatırlatıyor. Gelecekte bu tür bulmacalar, YZ sistemlerinin geliştirilmesinde rehber olmaya devam edecek gibi görünüyor. Türkiye'deki yapay zeka ekosistemi, bu tür kıyaslamaları kullanarak yerel modellerin geliştirilmesine yönelik adımlar atabilir; özellikle Türkçe veri setlerinin zenginleştirilmesi ve modellerin bu tür bilişsel görevlerde eğitilmesi, uluslararası rekabette avantaj sağlayabilir.

link Kaynak: MIT Tech Review
tag yapay zeka tag bulmaca tag zeka testleri tag LLM tag uzamsal akıl yürütme tag ARC-AGI

İlgili Terimler

3 terim