tag SWEBench

Bu sayfada SWEBench etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

SWE-bench, büyük dil modellerinin gerçek dünya yazılım mühendisliği görevlerini ne kadar başarılı biçimde gerçekleştirebileceğini ölçen kapsamlı bir değerlendirme çerçevesidir. 2023 yılında Princeton Üniversitesi araştırmacıları tarafından geliştirilen bu benchmark, popüler Python projelerinin GitHub depolarından toplanan gerçek issue'lar ve karşılık gelen pull request'lerden oluşur. Değerlendirme akışı şu şekilde işler: Modele bir Python deposunun belirli bir sürümü ve o sürümde açık olan bir GitHub issue verilir. Modelin görevi, bu issue'u gidermek için gereken kod değişikliklerini (patch) üretmektir. Üretilen yama, orijinal PR'ın test takımıyla otomatik olarak doğrulanır; geçen test oranı başarı metriği olarak kullanılır. SWE-bench Verified alt kümesi, yazılım mühendisleri tarafından gözden geçirilmiş 500 adet iyi kalibre edilmiş problemden oluşur. Belirsiz tanımlı issue'lar ve çözümsüz görevler bu alt kümeden elendi; sektör karşılaştırmaları çoğunlukla Verified üzerinden raporlanır. 2024 itibarıyla en iyi sistemler bu kümede yaklaşık %50–70 çözme oranına ulaşmaktadır. Maliyet açısından daha erişilebilir bir alternatif olan SWE-bench Lite ise 300 seçilmiş problemden oluşur ve hızlı prototipleme çalışmalarında tercih edilir. Liderlik tablosunda Claude 3.7 Sonnet (Anthropic), GPT-4o (OpenAI), Devin (Cognition) ve SWE-agent (Stanford) gibi model ve ajanlar yer almaktadır. Tam otonom kategorilerde başarı, asistli modlara göre belirgin şekilde düşüktür; bu durum, karmaşık yazılım görevlerinde insan rehberliğinin hâlâ kritik olduğunu ortaya koymaktadır. SWE-bench'in temel önemi, modellerin salt kod yazma becerilerinin ötesinde çok dosyalı, büyük gerçek projelerde bağımsız çalışıp çalışamadığını sınamasıdır. Başarılı bir ajan; ilgili dosyaları bulma, test anlambilimini kavrama ve depo genelinde tutarlı değişiklikler üretme gibi birleşik yetenekleri entegre etmelidir. Bu nedenle SWE-bench, AI destekli yazılım geliştirme, self-healing kod ve otonom ajan sistemleri araştırmalarında merkezi bir referans hâline gelmiştir. Dil çeşitliliği için SWE-bench Java ve çok dilli uzantılar da geliştirilmektedir.

assessment

LLM Eval (LLM Değerlendirme)

LLM Eval (LLM Evaluation — LLM Değerlendirme), büyük dil modellerinin performansını sistematik biçimde ölçmek için kullanılan metodoloji, kıyaslama ve araçların bütünüdür. Model değerlendirme; hangi modelin belirli bir göreve uygun olduğunu, hangi hata türlerini ürettiğini ve zamana göre nasıl geliştiğini anlamayı mümkün kılar. LLM değerlendirmesi iki temel eksende ele alınır. İnsan değerlendirmesi, kişilerin model çıktılarını doğrudan puanladığı veya tercih ettiği yöntemi temsil eder; pahalı ama altın standart olarak kabul edilir. Otomatik değerlendirme ise ölçüm sürecini kıyaslama verileri veya başka bir LLM kullanarak otomatikleştirir. Bu ikincisine "LLM-as-a-Judge" denilir ve özellikle GPT-4 ya da Claude gibi güçlü modellerin hakem olarak kullanıldığı yapılar giderek yaygınlaşmaktadır. Yaygın kıyaslama ölçütleri arasında bilgi ve akıl yürütme testi için MMLU (Massive Multitask Language Understanding), kod üretimi için HumanEval ve MBPP, çoklu adım akıl yürütme için GSM8K ve MATH, dil anlama için HellaSwag, WinoGrande ve ARC yer alır. RAG sistemleri için RAGAS ve TREC, çok dilli yetenekler için MGSM ve okuma anlama için SQuAD da sıkça kullanılan setler arasındadır. Bununla birlikte kıyaslamalar tek başına yeterli değildir. Ezberleme (benchmark contamination) sorunu, modelin test verilerini eğitim sırasında görmüş olabileceğine işaret eder; bu nedenle hem gizli tutulmuş hem de dinamik olarak güncellenen veri setleri önem kazanır. Gerçek dünya senaryoları için üretim ortamında izleme, A/B testi ve kullanıcı geri bildirimi toplama da değerlendirmenin ayrılmaz parçalarıdır. Uygulama özelinde değerlendirmede ise üç boyut öne çıkar: doğruluk (factual accuracy ve groundedness), zararsızlık (safety, jailbreak dayanıklılığı) ve fayda (task completion, coherence, kullanıcı memnuniyeti). Hellaswag-türü genel benchmark iyi skoru, bir müşteri hizmetleri botunun gerçek konuşmalarda başarılı olacağını garanti etmez; bu yüzden görev odaklı metrikler zorunludur.

arrow_forward
bug_report

SWE-Bench (SWE-Bench)

SWE-bench, büyük dil modellerinin gerçek dünya yazılım mühendisliği görevlerini ne kadar başarılı biçimde gerçekleştirebileceğini ölçen kapsamlı bir değerlendirme çerçevesidir. 2023 yılında Princeton Üniversitesi araştırmacıları tarafından geliştirilen bu benchmark, popüler Python projelerinin GitHub depolarından toplanan gerçek issue'lar ve karşılık gelen pull request'lerden oluşur. Değerlendirme akışı şu şekilde işler: Modele bir Python deposunun belirli bir sürümü ve o sürümde açık olan bir GitHub issue verilir. Modelin görevi, bu issue'u gidermek için gereken kod değişikliklerini (patch) üretmektir. Üretilen yama, orijinal PR'ın test takımıyla otomatik olarak doğrulanır; geçen test oranı başarı metriği olarak kullanılır. SWE-bench Verified alt kümesi, yazılım mühendisleri tarafından gözden geçirilmiş 500 adet iyi kalibre edilmiş problemden oluşur. Belirsiz tanımlı issue'lar ve çözümsüz görevler bu alt kümeden elendi; sektör karşılaştırmaları çoğunlukla Verified üzerinden raporlanır. 2024 itibarıyla en iyi sistemler bu kümede yaklaşık %50–70 çözme oranına ulaşmaktadır. Maliyet açısından daha erişilebilir bir alternatif olan SWE-bench Lite ise 300 seçilmiş problemden oluşur ve hızlı prototipleme çalışmalarında tercih edilir. Liderlik tablosunda Claude 3.7 Sonnet (Anthropic), GPT-4o (OpenAI), Devin (Cognition) ve SWE-agent (Stanford) gibi model ve ajanlar yer almaktadır. Tam otonom kategorilerde başarı, asistli modlara göre belirgin şekilde düşüktür; bu durum, karmaşık yazılım görevlerinde insan rehberliğinin hâlâ kritik olduğunu ortaya koymaktadır. SWE-bench'in temel önemi, modellerin salt kod yazma becerilerinin ötesinde çok dosyalı, büyük gerçek projelerde bağımsız çalışıp çalışamadığını sınamasıdır. Başarılı bir ajan; ilgili dosyaları bulma, test anlambilimini kavrama ve depo genelinde tutarlı değişiklikler üretme gibi birleşik yetenekleri entegre etmelidir. Bu nedenle SWE-bench, AI destekli yazılım geliştirme, self-healing kod ve otonom ajan sistemleri araştırmalarında merkezi bir referans hâline gelmiştir. Dil çeşitliliği için SWE-bench Java ve çok dilli uzantılar da geliştirilmektedir.

arrow_forward