Vals AI, yapay zeka kıyaslamasında altın standart olmayı hedefliyor
Andreessen Horowitz liderliğinde 40 milyon dolar yatırım alan Vals AI, yapay zeka modellerini sektöre özel görevlerle test ederek daha güvenilir ve tarafsız bir kıyaslama platformu sunmayı amaçlıyor.
Vals AI Nedir?
Yapay zeka dünyasında şirketler, modellerinin yeteneklerini kanıtlamak ve rakiplerinden sıyrılmak için kıyaslama (benchmark) testlerine başvuruyor. İyi sonuçlar, aynı zamanda iyi bir tanıtım anlamına geliyor. Ancak mevcut kıyaslama sistemlerinin birçoğu eski ve modern modellerin yeteneklerini ölçmekte yetersiz kalıyor. İşte bu boşluğu doldurmak için 2024'te kurulan Vals AI, yapay zeka kıyaslamasını daha tarafsız ve güvenilir hale getirmeyi hedefliyor.
Geçtiğimiz ay Andreessen Horowitz liderliğinde 40 milyon dolarlık A serisi yatırım alan girişim, hızlı büyümesiyle dikkat çekiyor. Daha önce 8VC ve Bloomberg Beta'nın katıldığı tohum turuyla da önemli bir destek almıştı. 25 yaşındaki kurucu ortağı Rayan Krishnan, Palantir'de staj yapmış ve Stanford Üniversitesi'nde Microsoft ile üniversitenin yapay zeka laboratuvarında çalışmış bir isim. Krishnan'a göre Vals, kıyaslama dünyasının endüstrinin gerisinde kalmasından doğdu. Şirketin San Francisco'nun Folsom Caddesi'ndeki iki katlı ofisi, yüz yıl önce büyük bir bira fabrikasına ev sahipliği yapmış eski bir tuğla binada yer alıyor; şimdi ise teknolojinin geleceğini inşa etmeye çalışan girişimlere kucak açıyor.
Geleneksel Kıyaslamanın Sorunları
Krishnan, piyasaya hızla çok yetenekli yeni modellerin girdiğini ancak akademik kıyaslamaların bu ilerlemeyi takip edemediğini belirtiyor. Yapay zeka toplumun her alanına entegre olurken, kıyaslamaların şirketlerin iddia ettiği yetenekleri doğrulaması gerekiyor. Geleneksel testler genellikle halka açık olduğu için şirketler modellerini bu testlere göre eğitip adeta sınavda kopya çekebiliyor. Vals ise test materyallerini kamuya açıklamayarak bu sorunu aşmayı amaçlıyor.
Ayrıca Vals, modellerin genel bilgi birikimini ölçmek yerine hukuk, finans ve kodlama gibi belirli sektörlerdeki karmaşık görevleri tamamlama becerilerine odaklanıyor. Krishnan, "Biz aslında modellerin gerçek etkilerine bakıyoruz. Her alanda insan kalitesinde iş üretebiliyorlar mı?" diyor. Amaç sadece olumlu sonuçları değil, olumsuzları da tespit etmek. Modellerin kontrolsüz kalması durumunda ortaya çıkabilecek riskleri analiz etmek de hedefleniyor. Bu yaklaşım, geleneksel "model baraj sınavını geçebiliyor mu?" sorusunun ötesine geçerek, gerçek dünya senaryolarında güvenilirliği ölçmeyi amaçlıyor.
Hangi Alanlarda Test Yapılıyor?
Vals'in ölçtüğü yetenekler giderek çeşitleniyor. Geleneksel sektörlerin yanı sıra özyinelemeli kendini geliştirme, ruh sağlığı, siber güvenlik, biyogüvenlik ve hatta silahlı çatışma hukuku (Cenevre Sözleşmesi) gibi alanlarda da testler yapılıyor. Örneğin, bir modelin siber güvenlik açıklarını tespit etme veya biyolojik tehditleri analiz etme yeteneği değerlendiriliyor. Bu tür testler, yapay zekanın yüksek riskli alanlarda kullanımı öncesinde kritik önem taşıyor.
Şirketler, modellerini test ettirmek için Vals'e ödeme yapıyor. Bu durum ilk bakışta tuhaf görünebilir: Bir şirket neden modelinin kötü performansını öğrenmek için para ödesin? Ancak etkili bir ölçüm, şirketlerin sorunları giderip zamanla gelişmesine yardımcı oluyor. Krishnan, gelir modelini öğrencilerin SAT sınavı için College Board'a ödeme yapmasına benzetiyor. Aynı şekilde, yapay zeka şirketleri de modellerinin sektörel yeterliliğini belgelemek için bu hizmete yatırım yapıyor.
Bu değerlendirmeler, yeni yapay zeka modelleri satın almak isteyen şirketler için kilit karar faktörleri haline geliyor. Vals, geçen yıla kıyasla gelirini sekize katladığını açıkladı. Yıl başında 8 kişilik ekibi şimdiden 25 kişiye çıktı. Krishnan, büyümeyle birlikte daha büyük bir ofise taşınacaklarını ve 10-15 kişi daha işe alacaklarını söylüyor. Şirket ayrıca federal kurumlara model değerlendirmesi sunan bir program başlattı. Bu program, kamu sektörünün yapay zeka araçlarını tedarik ederken bağımsız değerlendirmelere duyduğu ihtiyacı yansıtıyor.
Neden Önemli?
Yapay zeka modelleri ekonomide merkezi bir rol oynamaya başladıkça, güvenilir kıyaslama ve değerlendirme sistemleri kritik hale geliyor. Krishnan'a göre yapay zeka şirketleri halka açılmaya başladı; SpaceX halka arz oldu, Anthropic'in yıl sonunda halka açılması bekleniyor ve OpenAI'ın da yakında halka arz olacağını tahmin ediyor. Modeller ekonomiyi şekillendirdikçe, Vals'in yaptığı türden kıyaslamalar şirketlerin kullanımını yönlendirecek ve halka arz dosyalarında ya da yatırım planlarında merkezi bir yer tutacak.
Türkiye açısından bakıldığında, yerli yapay zeka girişimleri ve kurumları için de benzer bir ihtiyaç kapıda. Regülasyonlar ve kamu ihaleleri için modellerin gerçek dünyada ne kadar güvenilir olduğunu kanıtlamak gerekecek. Vals gibi bağımsız değerlendirme platformları, yapay zeka ekosisteminde şeffaflık ve hesap verebilirlik için bir standart oluşturabilir. Bu da hem yatırımcı güvenini artırır hem de son kullanıcıların yapay zeka ürünlerine olan güvenini pekiştirir. Türkiye'deki üniversiteler ve araştırma merkezleri de benzer metodolojileri benimseyerek kendi dillerine ve sektörlerine özgü kıyaslama setleri geliştirebilir; böylece küresel rekabette yerli modellerin performansı daha nesnel biçimde ölçülebilir.