Big Data (Büyük Veri)

Geleneksel araçlarla islenemeyen hacimli, hizli uretilen ve cesitli yapidaki veri kumesi ve bunlari isleme teknolojileri.

Büyük veri (big data), geleneksel veri işleme araçlarıyla yönetilemeyecek kadar büyük, hızlı üretilen veya karmaşık yapıdaki veri kümelerini tanımlar. Doug Laney'in 3V modeli bu alanı karakterize etmek için kullanılan klasik çerçevedir: Volume (hacim — terabayt ve petabaytlarla ölçülen veri miktarı), Velocity (hız — veri üretim ve işleme hızı) ve Variety (çeşitlilik — yapılandırılmış, yarı yapılandırılmış ve yapılandırılmamış veri tipleri). Sonraki yıllarda bu modele iki V daha eklendi: Veracity (doğruluk — verinin güvenilirliği ve tutarlılığı) ve Value (değer — ham veriden anlamlı iş içgörüsü elde etme kapasitesi). Bazı akademisyenler 10V'ye kadar genişleten çerçeveler önermiş olsa da 5V modeli pratikte en yaygın kullanılan referans olmaya devam etmektedir. Büyük veri altyapısı, dağıtık depolama ve işleme sistemlerine dayanır. Hadoop, Google'ın MapReduce makalesinden ilham alan açık kaynak bir dağıtık işleme çerçevesidir; HDFS dosyaları bloklar halinde küme düğümlerine dağıtır ve düğüm arızalarında veri kaybını önler. Apache Spark, bellek içi işleme yapısıyla Hadoop'tan çok daha hızlı veri analizi ve makine öğrenimi sunar; batch, akış ve etkileşimli sorgu modlarını tek bir çerçevede birleştirir. Apache Kafka gerçek zamanlı veri akışlarını (streaming) yönetmek için yaygınlaşmış bir mesaj sırası (message broker) platformudur; saniyede milyonlarca olayı düşük gecikmeyle işleyebilir. Apache Flink ise durum bilgili (stateful) akış işleme konusunda öne çıkan alternatif çerçevedir. Veri boru hatları (data pipeline) büyük veride kritik bir yapısal unsurdur. ETL (Extract, Transform, Load) veya modern ELT yaklaşımları, farklı kaynaklardan gelen verinin temizlenmesini, dönüştürülmesini ve depolanmasını düzenler. Veri gölü (data lake), ham haliyle her türden veriyi depolarken veri ambarı (data warehouse) analiz için yapılandırılmış veri tutar. Lakehouse mimarisi bu iki yaklaşımı birleştiren modern alternatiftir. Bulut sağlayıcıları (AWS, Google Cloud, Azure) büyük veri altyapısını yönetilen hizmetler olarak sunar. Amazon EMR, Databricks, Google BigQuery ve Azure Synapse bu alanda öne çıkan platformlardır. Büyük veri ve makine öğrenimi giderek birbirinin içine girmektedir: feature store, model izleme ve MLOps süreçlerinde büyük veri araçları kritik roller üstlenmektedir. 2024 itibarıyla küresel veri üretiminin yıllık 120 zettabaytı aştığı tahmin edilmekte olup bu hacmin büyük çoğunluğunu yapay zeka modelleri tarafından üretilen sentetik veri oluşturmaktadır.

Büyük Verinin Zorluğu Nedir?

Tek bir sunucunun depolayamayacağı veya makul sürede işleyemeyeceği veri büyüklükleriyle çalışmak farklı bir yaklaşım gerektirir. Terabayt hatta petabayt verinin saklanması için dağıtık dosya sistemleri; saniyede milyonlarca olayın işlenmesi için akış platformları; yüzlerce kaynak tipinden gelen verinin birleştirilmesi için standardize edilmiş boru hatları gerekir. Bu altyapıyı sıfırdan kurmak yerine bulut yönetimli hizmetler giderek tercih edilmektedir.

Hadoop ve MapReduce

Hadoop, Google'ın 2004'te yayımladığı MapReduce ve GFS makalelerinden ilham alan açık kaynak çerçevedir. HDFS dosyaları bloklar halinde küme düğümlerine dağıtır; düğüm arızalarında veri kaybı önlenir. MapReduce işleri Map (verileri paralel işle) ve Reduce (sonuçları birleştir) aşamalarında çalıştırarak büyük kümedeki işlemi dağıtık gerçekleştirir. Bugün toplu işleme (batch processing) için hâlâ kullanılsa da Spark'ın gerisinde kalmaktadır.

Apache Spark ve Gerçek Zamanlı İşleme

Spark, bellek içi (in-memory) işleme yapısıyla MapReduce'dan 10-100 kat daha hızlı çalışabilir. Spark MLlib makine öğrenimi; Spark Streaming gerçek zamanlı akış işleme; Spark SQL yapılandırılmış veri analizi için ayrı modüller sunar. Databricks platformu Spark'ı bulut ortamında yönetilen ve optimize edilmiş biçimde sunar.

Büyük Veri Ekosisteminin Bileşenleri

  • check_circle Apache Kafka: Saniyede milyonlarca olayı düşük gecikmeyle işleyebilen dağıtık mesaj kuyruğu ve akış platformu.
  • check_circle Veri Gölü (Data Lake): Yapılandırılmış ve yapılandırılmamış her türden ham veriyi olduğu gibi depolayan merkezi depo. S3, ADLS ve GCS popüler temel depolama katmanlarıdır.
  • check_circle Veri Ambarı (Data Warehouse): Analiz için dönüştürülmüş ve yapılandırılmış veri tutar. Google BigQuery, Snowflake ve Amazon Redshift öne çıkan örneklerdir.
  • check_circle Lakehouse Mimarisi: Delta Lake ve Apache Iceberg gibi açık tablo formatları üzerine inşa edilen lakehouse, veri gölünün esnekliğiyle veri ambarının güvenilirliğini birleştirir.

Modern Büyük Veri Mimarisi

Data Lakehouse

Veri gölünün esnekliğini veri ambarının yapısıyla birleştirir; Delta Lake, Apache Iceberg ve Hudi bu paradigmanın açık kaynak temeli.

Apache Kafka

Milyonlarca olay/saniye işleyen dağıtık mesaj kuyruğu; gerçek zamanlı veri hattı ve olay akışı altyapısının omurgası.

Snowflake / BigQuery

Bulut tabanlı yönetilen veri ambarları; ayrılmış depolama-hesaplama mimarisiyle elastik sorgu ölçeklendirme sunar.

dbt (Data Build Tool)

SQL tabanlı dönüşüm iş akışı; sürüm kontrolü, test ve lineage dokümantasyonu ile analitik mühendisliği standardize eder.

Sıkça Sorulan Sorular

  • check_circle Büyük veri ile yapay zeka arasındaki ilişki nedir? Makine öğrenimi modelleri büyük veri altyapısı olmadan eğitilemez; feature store, model izleme ve MLOps süreçlerinin tümü büyük veri araçlarına dayanır.
  • check_circle Hadoop mı Spark mı tercih edilmeli? Büyük batch işlemler için her ikisi de kullanılabilir; ancak Spark'ın bellek içi işleme avantajı ve zengin kütüphane ekosistemi onu çoğu senaryoda birincil tercih yapar.
  • check_circle Veri gölü ile veri ambarı arasındaki temel fark nedir? Veri gölü ham ve yapılandırılmamış veriyi depolar; veri ambarı ise sorgu performansı için dönüştürülmüş ve şemalandırılmış veri tutar. Lakehouse her ikisini birleştirir.
  • check_circle Bulut büyük veri hizmetleri şirket içi kuruluma kıyasla ne avantaj sunar? Yönetilen hizmetler altyapı bakım yükünü ortadan kaldırır, esnek ölçeklendirme imkânı sunar ve işlem başına ödeme modeliyle başlangıç maliyetini düşürür.