Big Data (Büyük Veri)
Geleneksel araçlarla islenemeyen hacimli, hizli uretilen ve cesitli yapidaki veri kumesi ve bunlari isleme teknolojileri.
Buyuk veri (big data), geleneksel veri isleme araçlariyla yonetilemeyecek kadar buyuk, hizli uretilen veya karmasik yapidaki veri kumelerini tanimlar. Doug Laney'in 3V modeli bu alani karakterize etmek icin kullanilan klasik cercevedir: Volume (hacim — terabayt ve petabaytlarla olculen veri miktari), Velocity (hiz — veri uretim ve isleme hizi) ve Variety (cesitlilik — yapilandirılmıs, yari yapilandirılmıs ve yapilandirilmamis veri tipleri). Buyuk veri altyapisi, dagilimli depolama ve isleme sistemlerine dayanır. Hadoop, Google'in MapReduce makalesi uzerine insa edilmis acik kaynak bir dagilimli isleme cerçevesidir; HDFS (Hadoop Distributed File System) verileri kume uzerindeki bircok duguma dagilimli depolar. Apache Spark, bellek ici isleme yapisiyla Hadoop'tan cok daha hizli veri analizi ve makine ogrenmesi sunar. Apache Kafka ise gercek zamanli veri akislarini (streaming) yonetin populer aracidir. Veri boru hatlari (data pipeline) buyuk veride kritik bir yapisal unsurdur. ETL (Extract, Transform, Load) veya modern ELT yaklasimlari, farkli kaynaklardan gelen verinin temizlenmesini, donusturulmesini ve depolanmasini saglar. Veri golu (data lake), ham haliyle her turden veriyi depolamak icin kullanilirken veri ambarı (data warehouse) analiz icin yapılandirılmıs veri tutar. Bulut saglaycilari (AWS, Google Cloud, Azure) buyuk veri altyapisini yonetilen hizmetler olarak sunmaktadir. Amazon EMR, Databricks, Google BigQuery ve Azure Synapse bu alanda one cikan platformlardir. Buyuk veri ve makine ogrenmesi giderek birbirinin icine girmekte; feature store, model izleme ve MLOps sureclerinde buyuk veri araclari kritik roller ustlenmektedir.