Yapay zeka ve makine öğrenimi modellerini eğitmek, doğrulamak ve test etmek için kullanılan yapılandırılmış veri koleksiyonu.

Veri seti (İngilizce: dataset), makine öğrenimi ve yapay zeka modellerinin eğitilmesinde, doğrulanmasında ve test edilmesinde kullanılan yapılandırılmış veri koleksiyonudur. Her yapay zeka sisteminin temeli kaliteli veri setlerine dayanır; en sofistike algoritmalar bile yetersiz ya da önyargılı verilerle başarısız olur. Bir veri seti genellikle üç alt kümeye ayrılır. Eğitim seti (training set), modelin örüntüleri ve ilişkileri öğrendiği ana veri kümesidir; toplam verinin yaklaşık yüzde yetmiş ila seksenini oluşturur. Doğrulama seti (validation set), geliştirme sürecinde hiperparametrelerin ayarlanması ve aşırı uyumun (overfitting) önlenmesi için kullanılan ara değerlendirme kümesidir. Test seti ise yalnızca nihai değerlendirmede kullanılır; modelin hiç görmediği bu veriler, gerçek dünya genelleme kapasitesinin tarafsız ölçütünü sağlar. Yaygın bölünme oranı 80/10/10 olmakla birlikte, veri kümesinin büyüklüğüne göre bu oranlar ayarlanabilir. Yapay zeka tarihinde kritik rol oynayan çeşitli kıyaslama (benchmark) veri setleri mevcuttur. MNIST, 70.000 el yazısı rakam görüntüsünden oluşur ve derin öğrenme için standart giriş veri setidir. ImageNet, 14 milyondan fazla etiketlenmiş görüntü içerir; AlexNet modelinin 2012 deki çığır açan başarısı bu veriyle elde edilmiştir. COCO (Common Objects in Context), 330.000 i aşkın görüntüyle nesne algılama ve segmentasyon görevlerinin altın standardıdır. Common Crawl ise petabaytlarca web sayfasını barındıran dev bir açık kaynak olup GPT-4, Llama ve hemen tüm büyük dil modellerinin ön eğitim sürecinde kullanılmaktadır. Bir veri setinin kalitesini belirleyen dört ana faktör vardır: boyut, etiket doğruluğu, çeşitlilik ve sınıf dengesi. Düşük etiket kalitesi model doğruluğunu yüzde otuza kadar düşürebilirken, dengesiz sınıf dağılımı modeli azınlık sınıflarını tanımakta yetersiz kılar. Veri seti önyargısı (dataset bias) özellikle dikkat gerektiren bir sorundur: tarihsel ayrımcılık barındıran eğitim verileri bu önyargıyı model çıktısına taşır. Örneğin yalnızca açık tenli yüzlerle eğitilen yüz tanıma sistemleri koyu tenli bireylerde anlamlı biçimde daha yüksek hata oranı üretmektedir. Veri zehirlenmesi (data poisoning) önemli bir güvenlik tehdididir: saldırganlar eğitim setine kasıtlı olarak bozuk örnekler ekleyerek modelin davranışını manipüle eder. Araştırmalar, sağlık alanındaki AI sistemlerinin yalnızca 100-500 zehirli örnekle yüzde altmışın üzerinde olasılıkla tehlikeye atılabildiğini ortaya koymaktadır. Türkçe doğal dil işleme açısından önemli bir not: Türkçe veri setleri İngilizce emsallerine kıyasla çok daha sınırlı ölçekte kalmaktadır. Bu durum, Türkçe NLP modellerini düşük kaynaklı dil (low-resource language) kategorisinde bırakmakta ve İngilizce modellerine kıyasla daha düşük performans sergilemelerine yol açmaktadır.