Data Lakehouse (Veri Göl Ambarı (Data Lakehouse))

Veri gölünün düşük maliyetli depolamasıyla veri ambarının ACID işlem güvenilirliğini ve SQL performansını tek mimaride birleştiren modern veri platformu.

Data lakehouse (veri göl ambarı), geleneksel veri gölü (data lake) ile veri ambarı (data warehouse) mimarilerinin avantajlarını tek bir platformda birleştiren modern bir veri yönetimi yaklaşımıdır. Terim, 2020 yılında Armbrust ve arkadaşlarının CIDR konferansındaki akademik çalışmasıyla literatüre girmiş; 2021'de Databricks tarafından ticari bir mimari olarak yaygınlaştırılmıştır. Geleneksel veri gölü yaklaşımı, Amazon S3 veya Azure Data Lake Storage gibi nesne depolarında ham, yapılandırılmamış ve yarı yapılandırılmış verileri düşük maliyetle barındırır. Ancak ACID işlem desteğinden yoksundur; bu durum veri tutarlılığı sorunlarına, gereksiz veri kopyalamaya ve 'bataklık' (data swamp) oluşumuna zemin hazırlar. Veri ambarı ise yüksek performanslı SQL sorgularını ve sıkı şema yönetimini destekler; buna karşın pahalı kapalı depolama sistemlerine bağımlıdır ve petabayt ölçeğinde ham veriyi işlemekte zorlanır. Data lakehouse bu ikilemliği çözer: Apache Iceberg, Delta Lake (Databricks) veya Apache Hudi gibi açık tablo formatları, nesne depolama katmanına ACID semantiği, şema evrimi ve zaman yolculuğu (time travel) yetenekleri ekler. Mimari üç katmandan oluşur: nesne depolama katmanı (ham veri), tablo format/metadata katmanı (ACID + şema) ve sorgu/hesaplama katmanı (Spark, Trino, Flink gibi motorlar). Bu yapı, veri bilimcilerin ham eğitim verilerine doğrudan erişmesine izin verirken veri analistlerinin küratörlü, şemaya uygun verilere SQL arayüzüyle ulaşmasına olanak tanır. Yapay zeka iş akışları açısından lakehouse mimarisinin önemi giderek artmaktadır. Büyük dil modellerinin eğitim ve ince ayar süreçlerinde petabayt ölçekli ham metin verisini versiyon kontrolüyle yönetmek, zaman yolculuğuyla önceki veri sürümlerine geri dönmek ve MLflow gibi araçlarla model sürümleri ile veri sürümlerini eşleştirmek için lakehouse tercih edilmektedir. Databricks Lakehouse, Microsoft Fabric (OneLake), Snowflake Open Catalog ve Google BigLake bu mimarinin önde gelen ticari uygulamalarıdır.

Veri Gölü ve Veri Ambarının Sınırları

Veri gölü, Amazon S3 gibi nesne depolarında ham ve yapılandırılmamış verileri petabayt ölçeğinde düşük maliyetle barındırır; ancak ACID işlem desteği eksikliği tutarsız veri ve "bataklık" riskine yol açar. Veri ambarı ACID ve hızlı SQL sunar; buna karşın kapalı, pahalı depolar kullanır ve gerçek zamanlı veri akışlarını veya petabayt ölçeği işlemekte zorlanır. Geleneksel çözüm, veriyi iki sistemde ayrı ayrı tutmaktır; bu da ETL maliyeti ve gecikme demektir.

Lakehouse Nasıl Çalışır?

Data lakehouse, nesne depolama üzerine bir açık tablo format katmanı ekler. Apache Iceberg, Delta Lake veya Apache Hudi formatları; her tablonun şemasını, versiyon geçmişini ve işlem günlüğünü metadata olarak saklar. Bu sayede Spark, Trino veya Flink gibi hesaplama motorları üç katmanlı mimaride çalışır: (1) Nesne depolama katmanı — ham Parquet/ORC dosyaları, (2) Tablo format/metadata katmanı — ACID, zaman yolculuğu, şema evrimi, (3) Sorgu/sunma katmanı — BI araçları, SQL motorları, ML çerçeveleri.

Temel Özellikler ve Yetenekler

  • check_circle ACID İşlemler: Eş zamanlı okuma/yazma işlemleri sırasında veri tutarlılığı garantisi. Çok kullanıcılı ortamlarda veri bütünlüğünü korur.
  • check_circle Zaman Yolculuğu (Time Travel): Tablonun önceki sürümlerine geri dönme ve sorgulama. Hatalı dönüşümlerden kurtarma ve denetim için kritiktir.
  • check_circle Şema Evrimi: Mevcut verilere dokunmadan yeni sütun ekleme veya tür değiştirme. Geriye dönük uyumluluk korunur.
  • check_circle Birleşik Sunma Katmanı: Aynı veri üzerinde BI analistleri (SQL), veri mühendisleri (Spark) ve veri bilimciler (Python/ML) tek kaynaktan çalışır.
  • check_circle Açık Tablo Formatları: Vendor bağımlılığı yoktur; Apache Iceberg, Delta Lake veya Apache Hudi ile istediğiniz hesaplama motorunu seçebilirsiniz.

AI ve Makine Öğrenmesi İş Akışlarında Lakehouse

Büyük dil modellerinin ön eğitimi ve ince ayarı petabayt ölçeğinde ham metin verisi gerektirir; lakehouse bu veriyi ucuz nesne depolama üzerinde versiyon kontrolüyle yönetir. Zaman yolculuğu özelliği, belirli bir tarih itibarıyla eğitim verisi anlık görüntüsü (snapshot) almanıza imkân tanır ve deney tekrarlanabilirliği açısından kritiktir. MLflow entegrasyonu, model sürümleriyle karşılık gelen veri sürümünü ilişkilendirir. Feature store ve lakehouse entegrasyonu, özellik hesaplama sonuçlarını ACID güvenliğiyle saklar ve tekrar kullanım maliyetini azaltır.

Önde Gelen Ticari Platformlar

database Databricks Lakehouse

Delta Lake formatının yaratıcısı; Unity Catalog ile veri yönetişimi. MLflow ile doğal entegrasyon.

cloud Microsoft Fabric (OneLake)

Azure ekosisteminde tek veri depolama katmanı; Power BI, Synapse ve ML araçlarını birleştirir.

storage Snowflake + Apache Iceberg

Open Catalog ile Iceberg tabloları yönetimi; Snowpark ML ile entegre veri+ML iş akışı.

gcp Google BigLake

BigQuery ile nesne depolama (GCS) üzerinde Iceberg desteği; Vertex AI ile doğal entegrasyon.

Sık Sorulan Sorular

  • check_circle Data lakehouse ile data lake arasındaki temel fark nedir?: Data lake sadece ham veri depolar; ACID işlem desteği, şema yönetimi ve sorgulama optimizasyonu yoktur. Data lakehouse, açık tablo formatları aracılığıyla bu özellikleri kazandırır.
  • check_circle Mevcut veri ambarını lakehouse ile değiştirmeli miyim?: Hemen değil. Lakehouse en çok yeni AI/ML iş akışları ve gerçek zamanlı analitik projeler için tercih edilir. Mevcut, olgun veri ambarı yatırımları kısa vadede maliyet avantajı sunmaya devam eder.
  • check_circle Apache Iceberg ve Delta Lake arasında nasıl seçim yapılır?: Iceberg daha tarafsız ve çok motorlu (Spark, Flink, Trino, BigQuery); Databricks ortamındaysanız Delta Lake daha iyi entegrasyon sunar. Snowflake ve AWS Glue öncelikle Iceberg destekler.
  • check_circle Data lakehouse pahalı mıdır?: Depolama maliyeti açısından veri ambarına kıyasla 10-100× daha ucuzdur çünkü nesne depolama kullanır. Hesaplama maliyeti kullanım bazlı ölçeklenir; BI sorgularını nadiren çalıştırıyorsanız maliyet düşük kalır.
  • check_circle LLM eğitiminde data lakehouse gerekli mi?: Zorunlu değil ancak tercih edilir. Petabayt ölçekli ham veri versiyonlaması, deney tekrarlanabilirliği ve özellik deposu entegrasyonu için lakehouse mimarisi pratik bir çözüm sunar.