tag veri-mimarisi

Data Lakehouse (Veri Göl Ambarı (Data Lakehouse))

Bu sayfada veri-mimarisi (Data Lakehouse (Veri Göl Ambarı (Data Lakehouse))) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

Data lakehouse (veri göl ambarı), geleneksel veri gölü (data lake) ile veri ambarı (data warehouse) mimarilerinin avantajlarını tek bir platformda birleştiren modern bir veri yönetimi yaklaşımıdır. Terim, 2020 yılında Armbrust ve arkadaşlarının CIDR konferansındaki akademik çalışmasıyla literatüre girmiş; 2021'de Databricks tarafından ticari bir mimari olarak yaygınlaştırılmıştır. Geleneksel veri gölü yaklaşımı, Amazon S3 veya Azure Data Lake Storage gibi nesne depolarında ham, yapılandırılmamış ve yarı yapılandırılmış verileri düşük maliyetle barındırır. Ancak ACID işlem desteğinden yoksundur; bu durum veri tutarlılığı sorunlarına, gereksiz veri kopyalamaya ve 'bataklık' (data swamp) oluşumuna zemin hazırlar. Veri ambarı ise yüksek performanslı SQL sorgularını ve sıkı şema yönetimini destekler; buna karşın pahalı kapalı depolama sistemlerine bağımlıdır ve petabayt ölçeğinde ham veriyi işlemekte zorlanır. Data lakehouse bu ikilemliği çözer: Apache Iceberg, Delta Lake (Databricks) veya Apache Hudi gibi açık tablo formatları, nesne depolama katmanına ACID semantiği, şema evrimi ve zaman yolculuğu (time travel) yetenekleri ekler. Mimari üç katmandan oluşur: nesne depolama katmanı (ham veri), tablo format/metadata katmanı (ACID + şema) ve sorgu/hesaplama katmanı (Spark, Trino, Flink gibi motorlar). Bu yapı, veri bilimcilerin ham eğitim verilerine doğrudan erişmesine izin verirken veri analistlerinin küratörlü, şemaya uygun verilere SQL arayüzüyle ulaşmasına olanak tanır. Yapay zeka iş akışları açısından lakehouse mimarisinin önemi giderek artmaktadır. Büyük dil modellerinin eğitim ve ince ayar süreçlerinde petabayt ölçekli ham metin verisini versiyon kontrolüyle yönetmek, zaman yolculuğuyla önceki veri sürümlerine geri dönmek ve MLflow gibi araçlarla model sürümleri ile veri sürümlerini eşleştirmek için lakehouse tercih edilmektedir. Databricks Lakehouse, Microsoft Fabric (OneLake), Snowflake Open Catalog ve Google BigLake bu mimarinin önde gelen ticari uygulamalarıdır.

database

Data Lakehouse (Veri Göl Ambarı (Data Lakehouse))

Data lakehouse (veri göl ambarı), geleneksel veri gölü (data lake) ile veri ambarı (data warehouse) mimarilerinin avantajlarını tek bir platformda birleştiren modern bir veri yönetimi yaklaşımıdır. Terim, 2020 yılında Armbrust ve arkadaşlarının CIDR konferansındaki akademik çalışmasıyla literatüre girmiş; 2021'de Databricks tarafından ticari bir mimari olarak yaygınlaştırılmıştır. Geleneksel veri gölü yaklaşımı, Amazon S3 veya Azure Data Lake Storage gibi nesne depolarında ham, yapılandırılmamış ve yarı yapılandırılmış verileri düşük maliyetle barındırır. Ancak ACID işlem desteğinden yoksundur; bu durum veri tutarlılığı sorunlarına, gereksiz veri kopyalamaya ve 'bataklık' (data swamp) oluşumuna zemin hazırlar. Veri ambarı ise yüksek performanslı SQL sorgularını ve sıkı şema yönetimini destekler; buna karşın pahalı kapalı depolama sistemlerine bağımlıdır ve petabayt ölçeğinde ham veriyi işlemekte zorlanır. Data lakehouse bu ikilemliği çözer: Apache Iceberg, Delta Lake (Databricks) veya Apache Hudi gibi açık tablo formatları, nesne depolama katmanına ACID semantiği, şema evrimi ve zaman yolculuğu (time travel) yetenekleri ekler. Mimari üç katmandan oluşur: nesne depolama katmanı (ham veri), tablo format/metadata katmanı (ACID + şema) ve sorgu/hesaplama katmanı (Spark, Trino, Flink gibi motorlar). Bu yapı, veri bilimcilerin ham eğitim verilerine doğrudan erişmesine izin verirken veri analistlerinin küratörlü, şemaya uygun verilere SQL arayüzüyle ulaşmasına olanak tanır. Yapay zeka iş akışları açısından lakehouse mimarisinin önemi giderek artmaktadır. Büyük dil modellerinin eğitim ve ince ayar süreçlerinde petabayt ölçekli ham metin verisini versiyon kontrolüyle yönetmek, zaman yolculuğuyla önceki veri sürümlerine geri dönmek ve MLflow gibi araçlarla model sürümleri ile veri sürümlerini eşleştirmek için lakehouse tercih edilmektedir. Databricks Lakehouse, Microsoft Fabric (OneLake), Snowflake Open Catalog ve Google BigLake bu mimarinin önde gelen ticari uygulamalarıdır.

arrow_forward
code_blocks

Data Mesh (Veri Ağı)

Data Mesh, büyük organizasyonlarda veri yönetiminin getirdiği merkezi darboğaz ve ölçek sorunlarını çözmek amacıyla Zhamak Dehghani'nin 2019'da önerdiği merkezsiz veri mimarisi yaklaşımıdır. Kavram ilk olarak "How to Move Beyond a Monolithic Data Lake to a Distributed Data Mesh" başlıklı makalede detaylandırılmıştır. Geleneksel yaklaşımlarda veriler merkezi bir veri ambarı ya da data lake'te toplanır; bu yapı küçük organizasyonlarda yeterli olsa da büyük kuruluşlarda üç kritik sorun üretir: merkezi veri ekibinin darboğaz haline gelmesi, veri setlerinin güncelliğini yitirmesi ve iş birimlerinin hızlı analitik ihtiyaçlarını karşılayamaması. Data Mesh bu monolitik yapıya alan odaklı, merkezsiz bir alternatif sunar. Yaklaşım dört temel ilkeye dayanır. Birincisi, alan sahipliği: veriler onu en iyi anlayan domain ekiplerinin sorumluluğundadır. İkincisi, veri ürünü: her veri kümesi; keşfedilebilir, belgelenmiş, güvenilir ve SLA'ya bağlı bir "ürün" olarak tasarlanır. Üçüncüsü, self-servis veri platformu: alan ekipleri merkezi mühendislik desteğine gerek kalmadan veri ürünlerini oluşturup yayımlayabilir. Dördüncüsü, federe yönetişim: bağımsız alanlar arasında veri kalitesi, güvenlik ve standart tanımları merkezi politikalarla uyumlu tutulur. Uygulama araçları arasında Apache Kafka (olay akışı), Snowflake veya Databricks Lakehouse (depolama ve sorgu), dbt (dönüşüm katmanı) ve DataHub/Amundsen (veri kataloğu) öne çıkar. Kafka 4.0, ZooKeeper bağımlılığını ortadan kaldırarak çok kiracılı Data Mesh ortamlarını önemli ölçüde basitleştirmiştir. AWS Data Zones, Azure Purview ve Google Dataplex gibi bulut hizmetleri de yerleşik Data Mesh desteği sunmaktadır. IBM'in 2024 verilerine göre şirketlerin yüzde seksen ikisi veri silolarının yapay zeka projelerini engellediğini bildiriyor; Gartner'a göre organizasyonların yüzde altmış biri yapay zeka baskısıyla veri işletme modelini yeniden yapılandırıyor. Data Mesh, bu dönüşümün teknik ve organizasyonel altyapısını bütünleşik biçimde ele alan kapsamlı bir çerçeve sunmaktadır.

arrow_forward