tag BigData

Data Lake (Veri Gölü)

Bu sayfada BigData (Data Lake (Veri Gölü)) etiketi ile işaretlenmiş 6 yapay zeka kavramını bulabilirsiniz.

Data Lake (Türkçe: Veri Gölü), yapılandırılmış, yarı yapılandırılmamış ve yapılandırılmamış verilerin orijinal ham formatlarında depolandığı merkezi, ölçeklenebilir bir büyük veri deposudur. Geleneksel veri ambarlarının aksine, Data Lake veriye önceden bir şema uygulamaz; veriler ham hâlde saklanır ve sorgu anında şema belirlenir (schema-on-read yaklaşımı). Bu esneklik aracılığıyla log dosyaları, görüntüler, videolar, sensör verileri ve JSON/CSV gibi farklı formatlardaki veriler aynı depoda bir arada tutulabilir. "Data Lake" kavramı ilk olarak 2010 yılında Pentaho'nun CTO'su James Dixon tarafından kavramsallaştırılmıştır. Dixon, veri ambarlarını sunum için hazır su şişeleriyle kıyaslarken Data Lake'i kendi doğal ve safiyetini koruyan bir göle benzetti: tüm su kaynakları (veriler) doğal hâlde bu göle akar ve kullanıcılar ihtiyaçlarına göre bu gölden istedikleri miktarda ve formatta su alır. Bir Data Lake mimarisi genellikle birkaç katmandan oluşur. Ham veri bölgesi (Raw/Landing Zone), kaynak sistemlerden gelen verilerin sıfır değişiklikle aktarıldığı giriş noktasıdır. Rafine veri bölgesi (Curated Zone), temizleme, dönüştürme ve kalite kontrolünden geçirilmiş verileri barındırır. Tüketim bölgesi (Consumption Zone) ise iş analistleri, veri bilimciler ve makine öğrenmesi uygulamaları tarafından kullanıma hazır hâle getirilmiş verileri içerir. Data Lake'in başlıca avantajları arasında yüksek ölçeklenebilirlik, düşük birim depolama maliyeti ve veri formatı esnekliği sayılabilir. Ancak yeterli yönetim ve kataloglama araçları olmadığında "Data Swamp" (Veri Bataklığı) hâline gelebilir: verinin nereden geldiği, ne anlama geldiği ve nasıl kullanılacağı belirsizleşir. Bu sorunu çözmek için veri kataloğu (data catalog), veri soyu takibi (data lineage) ve meta veri yönetimi araçları kullanılır. Günümüzde AWS S3 + Glue, Azure Data Lake Storage Gen2, Google Cloud Storage ve Apache Hadoop HDFS popüler Data Lake altyapılarıdır. Modern Delta Lake, Apache Iceberg ve Apache Hudi açık tablo formatları ise ACID işlem desteği ve şema evrimi ekleyerek Data Lake ile Data Warehouse özelliklerini "Lakehouse" mimarisinde birleştirir. Yapay zeka ve büyük dil modeli (LLM) alanında ise Data Lake, model öncesi (pre-training) ham veri havuzu ve fine-tuning veri kümesi deposu olarak kritik bir rol üstlenmektedir. 2025-2026 döneminde Apache Iceberg, AWS Athena, Google BigQuery ve Snowflake'in yerel destek eklemesiyle kurumsal standart tablo formatına dönüşmüştür. DuckDB ise geliştirici bilgisayarında Parquet/Iceberg dosyalarını saniyeler içinde sorgulamayı mümkün kılarak veri gölü erişimini demokratikleştirmiştir. LLM'lerin büyümesiyle birlikte veri gölleri, pre-training corpus yönetiminin birincil katmanı hâline gelmiştir; 2026'da kurulan pek çok AI şirketi veri katmanı olarak doğrudan Lakehouse mimarisini tercih etmektedir.

water_drop

Data Lake (Veri Gölü)

Data Lake (Türkçe: Veri Gölü), yapılandırılmış, yarı yapılandırılmamış ve yapılandırılmamış verilerin orijinal ham formatlarında depolandığı merkezi, ölçeklenebilir bir büyük veri deposudur. Geleneksel veri ambarlarının aksine, Data Lake veriye önceden bir şema uygulamaz; veriler ham hâlde saklanır ve sorgu anında şema belirlenir (schema-on-read yaklaşımı). Bu esneklik aracılığıyla log dosyaları, görüntüler, videolar, sensör verileri ve JSON/CSV gibi farklı formatlardaki veriler aynı depoda bir arada tutulabilir. "Data Lake" kavramı ilk olarak 2010 yılında Pentaho'nun CTO'su James Dixon tarafından kavramsallaştırılmıştır. Dixon, veri ambarlarını sunum için hazır su şişeleriyle kıyaslarken Data Lake'i kendi doğal ve safiyetini koruyan bir göle benzetti: tüm su kaynakları (veriler) doğal hâlde bu göle akar ve kullanıcılar ihtiyaçlarına göre bu gölden istedikleri miktarda ve formatta su alır. Bir Data Lake mimarisi genellikle birkaç katmandan oluşur. Ham veri bölgesi (Raw/Landing Zone), kaynak sistemlerden gelen verilerin sıfır değişiklikle aktarıldığı giriş noktasıdır. Rafine veri bölgesi (Curated Zone), temizleme, dönüştürme ve kalite kontrolünden geçirilmiş verileri barındırır. Tüketim bölgesi (Consumption Zone) ise iş analistleri, veri bilimciler ve makine öğrenmesi uygulamaları tarafından kullanıma hazır hâle getirilmiş verileri içerir. Data Lake'in başlıca avantajları arasında yüksek ölçeklenebilirlik, düşük birim depolama maliyeti ve veri formatı esnekliği sayılabilir. Ancak yeterli yönetim ve kataloglama araçları olmadığında "Data Swamp" (Veri Bataklığı) hâline gelebilir: verinin nereden geldiği, ne anlama geldiği ve nasıl kullanılacağı belirsizleşir. Bu sorunu çözmek için veri kataloğu (data catalog), veri soyu takibi (data lineage) ve meta veri yönetimi araçları kullanılır. Günümüzde AWS S3 + Glue, Azure Data Lake Storage Gen2, Google Cloud Storage ve Apache Hadoop HDFS popüler Data Lake altyapılarıdır. Modern Delta Lake, Apache Iceberg ve Apache Hudi açık tablo formatları ise ACID işlem desteği ve şema evrimi ekleyerek Data Lake ile Data Warehouse özelliklerini "Lakehouse" mimarisinde birleştirir. Yapay zeka ve büyük dil modeli (LLM) alanında ise Data Lake, model öncesi (pre-training) ham veri havuzu ve fine-tuning veri kümesi deposu olarak kritik bir rol üstlenmektedir. 2025-2026 döneminde Apache Iceberg, AWS Athena, Google BigQuery ve Snowflake'in yerel destek eklemesiyle kurumsal standart tablo formatına dönüşmüştür. DuckDB ise geliştirici bilgisayarında Parquet/Iceberg dosyalarını saniyeler içinde sorgulamayı mümkün kılarak veri gölü erişimini demokratikleştirmiştir. LLM'lerin büyümesiyle birlikte veri gölleri, pre-training corpus yönetiminin birincil katmanı hâline gelmiştir; 2026'da kurulan pek çok AI şirketi veri katmanı olarak doğrudan Lakehouse mimarisini tercih etmektedir.

arrow_forward
diamond

Data Mining (Veri Madenciliği)

Veri madenciliği (data mining), büyük veri kümelerinde gizli kalıpları, anlamlı ilişkileri ve öngörülebilir örüntüleri otomatik olarak keşfetme sürecidir. İstatistik, makine öğrenmesi ve veritabanı yönetiminin kesişiminde konumlanan bu alan; ham verinin işlenmesiyle iş kararlarına zemin hazırlayan eyleme dönüştürülebilir bilgiye ulaşmayı hedefler. Veri madenciliği süreci tipik olarak CRISP-DM (Cross-Industry Standard Process for Data Mining) çerçevesiyle yürütülür. Bu altı aşamalı model; iş anlayışı, veri anlayışı, veri hazırlama, modelleme, değerlendirme ve dağıtım adımlarını kapsar. Her aşama birbirini besler ve yinelemeli bir döngü oluşturur; gerçek projelerde modelleme aşamasında elde edilen bulgular çoğunlukla veri hazırlama adımına geri dönüşü zorunlu kılar. Temel veri madenciliği teknikleri şunlardır: sınıflandırma (classification) — yeni örnekleri bilinen kategorilere atama; kümeleme (clustering) — etiket olmaksızın benzer örnekleri gruplama; birliktelik kuralı öğrenme (association rule learning) — birlikte gözüklenen ögeleri keşfetme; anomali tespiti (anomaly detection) — aykırı değerleri bulma; regresyon — sayısal değerleri tahmin etme. Birliktelik kuralı öğrenme, perakende sektöründe sepet analizi (market basket analysis) olarak bilinir. Apriori ve FP-Growth algoritmaları bu alanda en yaygın kullanılan yöntemlerdir. Destek (support) ve güven (confidence) metrikleri, kuralların istatistiksel anlamlılığını ölçer; yüksek kaldıraç (lift) değeri ise bir kuralın tesadüften ibaret olmadığını gösterir. Veri madenciliği; perakende (ürün önerisi, çapraz satış), finans (kredi risk skoru, sahtecilik tespiti), sağlık (tanı desteği, hasta gruplama), telekomunikasyon (churn tahmini) ve e-ticaret (kişiselleştirme motorları) gibi alanlarda kritik iş değeri üretir. Veri madenciliği ile veri bilimi arasındaki fark ise pratik bağlamda önem taşır: veri madenciliği daha dar kapsamlı, kalıp keşfine odaklı klasik bir disiplindir; veri bilimi ise istatistik, yazılım mühendisliği ve alan uzmanlığını bir araya getiren daha geniş bir alandır. Her ikisi de Python ekosistemi (scikit-learn, pandas) ve R (arules, caret) ile uygulanabilir.

arrow_forward
warehouse

Data Warehouse (Veri Ambarı)

Veri Ambarı (Data Warehouse), farklı kaynaklardan toplanan büyük miktarda yapılandırılmış verinin analitik sorgular ve iş zekası (BI) uygulamaları için optimize edilmiş şekilde depolandığı merkezi bir veritabanı sistemidir. Günlük işlem (OLTP) veritabanlarından farklı olarak veri ambarları, tarihsel veriyi korumak, karmaşık analizler yapmak ve karar destek sistemlerine veri sağlamak amacıyla tasarlanmıştır. Bill Inmon, 1990'da veri ambarını dört temel özellikle tanımladı: (1) Konu odaklı — müşteri, ürün veya satış gibi belirli iş konuları etrafında organize edilir; (2) Entegre — farklı kaynaklardan gelen veriler tutarlı bir formatta birleştirilir; (3) Değişmez — bir kez yüklenen veriler güncellenmez, yalnızca yeni kayıtlar eklenir; (4) Zaman serili — veriler belirli dönemlere ait etiketlerle saklanır ve tarihsel analiz mümkün kılınır. Veri ambarına veri yüklemek için ETL (Extract, Transform, Load) süreci kullanılır: kaynak sistemlerden veri çekilir, temizlenip dönüştürülür ve ambar tablolarına yüklenir. Modern yaklaşımlarda ELT (ham veri önce yüklenir, sonra dönüştürülür) yöntemi de yaygınlaşmıştır. Boyutsal modelleme (dimensional modeling) tekniğiyle oluşturulan yıldız (star) ve kar tanesi (snowflake) şema tasarımları, sorgu performansını artırır ve analistlerin verileri daha kolay keşfetmesine olanak tanır. Bulut çağında Amazon Redshift, Google BigQuery, Snowflake ve Microsoft Azure Synapse Analytics gibi MPP (Massively Parallel Processing) mimarili çözümler petabayt ölçeğinde veri işlemeyi mümkün kılmaktadır. Data Lakehouse mimarisi ise veri ambarı ile Data Lake'in avantajlarını tek platformda birleştirmektedir. Veri ambarları; finans raporlaması, müşteri segmentasyonu, tedarik zinciri optimizasyonu ve makine öğrenimi feature store'ları için kritik altyapıdır. Yapay zeka modellerinin eğitim verisi yönetiminden A/B testi sonuçlarının depolanmasına dek geniş bir MLOps ekosisteminin vazgeçilmez bileşeni olmayı sürdürmektedir. Doğru kurgulanmış bir veri ambarı, kurumların veri kalitesini artırırken raporlama sürelerini önemli ölçüde kısaltır.

arrow_forward
sync_alt

ETL (Extract, Transform, Load)

ETL (Extract, Transform, Load — Çıkar, Dönüştür, Yükle), farklı kaynak sistemlerden ham verinin toplanıp temizlenerek analitik bir hedefe aktarılmasını sağlayan veri entegrasyon sürecidir. Her veri mühendisliği ve veri ambarı projesinin omurgasını oluşturur; kaliteli veriye dayanmayan hiçbir makine öğrenimi modeli ya da iş zekası raporu başarılı olamaz. Extract (Çıkarma) aşamasında veri; ilişkisel veritabanları, REST API'ları, dosya sistemleri (CSV, JSON, XML, Parquet), akış platformları (Kafka, Kinesis) veya SaaS uygulamalarından ham biçimde çekilir. Artımlı çıkarma (CDC — Change Data Capture) yalnızca değişen kayıtları çekerek bant genişliğini ve işlem süresini önemli ölçüde azaltır. Transform (Dönüştürme) aşamasında bu ham veri; temizlenir (eksik ve tutarsız değerler giderilir), normalize edilir (farklı kaynaklardaki kodlamalar birleştirilir), zenginleştirilir (dış referans tablolarıyla birleştirilir) ve hedef şemaya dönüştürülür. Load (Yükleme) aşamasında işlenmiş veri; veri ambarı, veri gölü veya analitik veritabanına tam veya artımlı biçimde yazılır. Modern mimarilerde ETL'nin yerini giderek ELT (Extract, Load, Transform) alıyor: ham veri önce bulut veri ambarına yükleniyor (Amazon Redshift, Google BigQuery, Snowflake), ardından dönüşümler SQL veya dbt (data build tool) aracılığıyla doğrudan hedefteki güçlü işlem kapasitesiyle gerçekleştiriliyor. Reverse ETL ise bu akışı tersine çevirerek ambar verilerini operasyonel sistemlere (CRM, pazarlama araçları) geri göndermek için kullanılır. Makine öğrenimi hattında ETL, feature store'ları besleyen ve model eğitimi için veri setleri hazırlayan kritik bileşendir. Yaygın ETL araçları arasında Apache Airflow, dbt, Apache Spark, Fivetran, Talend ve AWS Glue sayılabilir. Büyük ölçekli sistemlerde mikro-toplu (micro-batch) ve akış (streaming) ETL da standart pratikler arasındadır. Veri kalitesi izleme, veri soyağacı (data lineage) takibi ve şema yönetimi modern ETL boru hatlarının ayrılmaz parçaları haline gelmiştir. Great Expectations ve dbt tests gibi araçlar ETL sürecine otomatik veri doğrulama katıyor; böylece hatalı verinin aşağı akış sistemlerine sızması engelleniyor. Doğru tasarlanmış bir ETL mimarisi, veri güvenilirliğini ve tekrarlanabilirliğini doğrudan belirleyen altyapısal temel taştır; kurumsal ölçekte analitik olgunluğun en önemli göstergelerinden biri olarak kabul edilmektedir.

arrow_forward
explore

Unsupervised Learning (Denetimsiz Öğrenme)

Gözetimsiz öğrenme (unsupervised learning), etiketlenmemiş veriden gizli yapı, örüntü ve ilişkileri keşfeden makine öğrenmesi paradigmasıdır. Denetimli öğrenmeden farklı olarak doğru cevap yoktur; algoritma veriyi anlamlandırmak için kendi iç organizasyonunu geliştirir. Kümeleme (clustering), gözetimsiz öğrenmenin en yaygın uygulamasıdır. K-Means, birbirine benzer örnekleri gruplara ayırır; her grup bir merkoid (centroid) tarafından temsil edilir. Hiyerarşik kümeleme dendogram adı verilen bir ağaç yapısı oluşturarak farklı çözünürlük seviyelerinde gruplar sunar. DBSCAN ise yoğunluk tabanlı bir yaklaşımla düzensiz şekilli kümeler ve aykırı değerleri ayırt edebilir. Boyut azaltma, yüksek boyutlu veriyi anlamlı alt uzaylara projeksiyon yaparak hem görselleştirme hem de hesaplama verimliliğini artıran başka bir gözetimsiz öğrenme alanıdır. PCA (Temel Bileşen Analizi) varyansı maksimize eden ortogonal bileşenler bulurken, t-SNE ve UMAP yerel yapıyı koruyarak 2D veya 3D görselleştirme için idealdir. Üretken modeller de gözetimsiz öğrenme kapsamında değerlendirilebilir. Otokodlayıcılar (autoencoders) veriyi sıkıştıran ve yeniden üreten bir enkoder-dekoder mimarisi kurar; öğrenilen gizli temsil anomali tespiti, gürültü giderme ve özellik çıkarımı için kullanılır. Üretken Çekişmeli Ağlar (GAN) ve Değişimsel Otokodlayıcılar (VAE) gerçekçi yapay veri üretimi için gözetimsiz öğrenmenin ulaştığı doruk noktalardır. Gözetimsiz öğrenme, etiket maliyetinin yüksek olduğu tıbbi görüntü analizi, müşteri segmentasyonu, belge kümeleme ve öneri sistemi gibi alanlarda kritik değer taşır. Ayrıca denetimli öğrenme öncesinde veri keşfi ve ön işleme aşamasında standart bir araç olarak kullanılır. Öz-denetimli öğrenme (self-supervised learning), gözetimsiz öğrenmenin modern bir uzantısı olarak büyük dil modellerinin temelini oluşturur. BERT ve GPT gibi modeller, etiket gerektirmeksizin milyarlarca token üzerinde ön eğitim yaparak dil yapısını içselleştirir. Bu temsiller daha sonra az miktarda etiketli veriyle ince ayar yapılarak aşağı yönlü görevlerde kullanılır; bu yaklaşım günümüz yapay zeka uygulamalarının merkezindedir.

arrow_forward
content_cut

Web Scraping (Veri Kazıma (Web Kazıma))

Web kazıma (web scraping), bir web sitesinin HTML içeriğini programatik olarak indirip anlamlı verileri çıkarma sürecidir. Manuel kopyala-yapıştırmanın aksine, web kazıma belirli bir hedef yapıya sahip veriler için — fiyat takibi, araştırma verisi toplama, pazar analizi — büyük ölçekte otomasyon imkânı tanır. Temel web kazıma süreci üç adımdan oluşur: istek gönderme (HTTP GET/POST), HTML ayrıştırma (parsing) ve veri çıkarma. Python'da Requests kütüphanesi HTTP isteklerini yönetirken BeautifulSoup veya lxml, CSS seçiciler ve XPath ifadeleriyle istenen elemanları ayıklar. Scrapy ise asenkron mimarisiyle binlerce sayfayı verimli biçimde gezebilen tam donanımlı bir web kazıma çerçevesidir. Dinamik web siteleri, JavaScript ile içeriklerini tarayıcıda oluşturduğundan geleneksel HTTP tabanlı kazıma yetersiz kalır. Bu durumda Playwright veya Selenium gibi tarayıcı otomasyon araçları, gerçek bir tarayıcı ortamında sayfayı render ederek dinamik içeriğe erişimi mümkün kılar. Playwright, Chrome, Firefox ve WebKit desteği ile asenkron mimarisiyle modern kazıma projelerinde tercih edilen araç hâline gelmiştir. Web kazımada etik ve hukuki boyutlar büyük önem taşır. robots.txt dosyası, site sahiplerinin hangi yolların kazınmasını istemediğini belirtir; bu dosyaya uymak etik bir zorunluluktur. Hizmet şartları (Terms of Service), bazı siteler için kazıma işlemini yasal zeminde sınırlandırabilir. Kişisel veri içeren içerik GDPR ve KVKK kapsamında ek duyarlılık gerektirir. Sunuculara aşırı istek göndermek hedef siteyi yavaşlatabilir veya yasal sorumluluk doğurabilir; bu nedenle istekler arasında makul gecikmeler bırakmak standart uygulamadır. Anti-kazıma teknolojileri de gelişmiştir: CAPTCHA, IP engelleme, istek parmak izi analizi ve JavaScript zorunluluğu bunlar arasındadır. Bu engelleri aşmak için proxy rotasyonu, kullanıcı-ajanı (user-agent) değiştirme ve ScrapingBee, Apify, Bright Data gibi yönetimli web kazıma API hizmetleri yaygın biçimde kullanılmaktadır. Büyük ölçekli projelerde veri depolama, temizleme ve doğrulama süreçleri de kazıma pipeline'ının ayrılmaz parçalarıdır.

arrow_forward