category Veri Madenciliği

Veri Madenciliği kategorisi, yapay zeka ve makine öğrenimi alanındaki 46 temel terim ve kavramı kapsar: Apriori Algoritması, Association Rule Mining, Association Rules, Causal AI, Causal Inference, Churn Prediction. Her terim için tanım, örnek ve ilgili kavramları bu sayfadan keşfedebilirsiniz.

🛒

Apriori Algoritması (Apriori Algoritması)

Apriori, işlem veritabanlarındaki sık geçen öğe kümelerini (frequent itemsets) bulmak ve bunlardan birliktelik kuralları (association rules) çıkarmak için kullanılan temel veri madenciliği algoritmasıdır. Rakesh Agrawal ve Ramakrishnan Srikant tarafından IBM'de geliştirilerek 1994 VLDB konferansında yayımlanan bu yöntem, özellikle market sepeti analizi alanında devrim yaratan bir teknik oldu. Algoritma üç temel ölçüte dayanır. Destek (Support), bir öğe kümesinin tüm işlemler içindeki görünme oranıdır. Güven (Confidence), bir öncül kümesi satın alındığında ardıl kümesinin de satın alınma olasılığını ifade eder. Kaldıraç (Lift), gözlemlenen destek ile rasgele beklentinin oranıdır; lift>1 ise iki öğe arasında pozitif bir korelasyon vardır. Algoritma yinelemeli (iterative) bir yaklaşımla çalışır. İlk adımda her ürünün tek başına minimum destek eşiğini geçip geçmediği kontrol edilerek sık 1-öğe kümeleri belirlenir. Ardından bu sık kümeler birleştirilerek aday k-öğe kümeleri oluşturulur. Burada Apriori'nin güç noktası devreye girer: bir öğe kümesinin sık olması için tüm alt kümelerinin de sık olması zorunludur (downward closure özelliği). Bu kural, herhangi bir alt kümesi seyrek olan adayları tarama yapılmadan elemeye olanak tanır ve hesaplama maliyetini önemli ölçüde azaltır. Her adımda veritabanı taranarak destek sayımı yapılır; minimum destek eşiğinin altındakiler elenerek bir sonraki adıma geçilir. Pratik bir örnekle açıklamak gerekirse: 10.000 süpermarket işleminden 3.000'inde {ekmek, tereyağı} birlikte satın alınmışsa destek %30'dur. Ekmek alanların %72'si tereyağı da almışsa güven %72'dir. Bu durumda kaldıraç 1'den büyük olduğundan bu kural rasgele birlikteliğin ötesinde anlamlı bir ilişkiye işaret eder; çapraz satış veya raf düzenleme kararı için kullanılabilir. Algoritmanın temel sınırlılığı her öğe kümesi boyutu için veritabanının baştan taranmasıdır; büyük veri setlerinde bu çok sayıda G/Ç işlemi anlamına gelir. FP-Growth algoritması tek geçişte bir ağaç (FP-Tree) yapısı oluşturarak bu sorunu büyük ölçüde ortadan kaldırır ve pratikte Apriori'nin yerini almıştır. Python'da mlxtend.frequent_patterns.apriori fonksiyonuyla, büyük ölçekte ise PySpark MLlib'in FP-Growth implementasyonuyla kolayca uygulanabilir. Kullanım alanları arasında e-ticaret ürün öneri sistemleri, tıbbi tanı örüntü tespiti, web kullanım madenciliği, dolandırıcılık tespiti ve ağ güvenliği anomali analizi öne çıkar. Türkiye'deki e-ticaret platformları ve perakende CRM sistemleri bu tür birliktelik analizine dayanmaktadır.

arrow_forward
hub

Association Rule Mining (Birliktelik Kuralı Madenciliği)

Birliktelik kuralı madenciliği (association rule mining), büyük işlem veritabanlarında öğeler arasındaki anlamlı birlikte-oluşum örüntülerini keşfeden denetimsiz bir makine öğrenmesi yöntemidir. Temel çıktısı "Eğer A ise B" biçiminde ifade edilen kurallar bütünüdür; bu kurallar destek (support), güven (confidence) ve kaldıraç (lift) metrikleriyle değerlendirilir. Destek, bir kural ya da öğe kümesinin tüm işlemler içindeki görülme sıklığını gösterir; çok düşük destekli kurallar istatistiksel açıdan anlamsız kabul edilir. Güven, A gerçekleştiğinde B'nin de gerçekleşme olasılığını, yani öngörücü gücü ölçer. Lift ise A ve B'nin bağımsız olması durumuna göre gözlemlenen birlikteliğin kaç kat daha güçlü olduğunu hesaplar: lift değeri birden büyükse pozitif ilişki, birden küçükse negatif ilişki vardır, bire eşitse iki öğe birbirinden bağımsızdır. Temel algoritmalar üç ana grupta toplanır. Apriori, anti-monoton özelliği kullanan klasik yaklaşımdır: seyrek olan bir kümenin üst kümesi de seyrek olacağından budama (pruning) ile aday küme uzayı sistematik biçimde daraltılır. FP-Growth ise veriyi bir ağaç yapısına (FP-Tree) sıkıştırarak tek geçişte sık öğe kümelerini çıkarır; bu yöntem Apriori'den 10 ila 100 kat daha hızlı çalışabilmektedir. Eclat, dikey veri biçimini kullanarak küme kesişim işlemiyle destek hesabını hızlandırır. Uygulama alanları son derece geniştir: e-ticaret öneri motorları, market sepet analizi, ilaç yan etki kombinasyonu tespiti, siber güvenlikte saldırı örüntüsü tanıma, finans sektöründe dolandırıcılık tespiti ve biyoinformatikte gen ifadesi analizi bu yöntemin aktif kullanım alanlarıdır. Kural patlaması (rule explosion) sorununa karşı chi-kare testi ve conviction gibi ek filtreler uygulanabilir; ancak kuralların nedensellik değil yalnızca korelasyon gösterdiği her zaman göz önünde bulundurulmalıdır. Veri kalitesi, minimum destek ve güven eşiklerinin doğru ayarlanması, elde edilen kuralların pratik değerini doğrudan belirler.

arrow_forward
hub

Association Rules (Birliktelik Kuralları)

Birliktelik kuralları (Association Rules), büyük işlem veri kümelerinde birlikte görünen öğe grupları arasındaki ilişkileri otomatik olarak keşfeden temel bir veri madenciliği tekniğidir. "Market sepeti analizi" adıyla da bilinen bu yöntem, süpermarket alışveriş verilerinden "ekmek alan müşteriler yüksek olasılıkla tereyağı da alır" gibi kalıpları ortaya çıkarır. Bir birliktelik kuralı A → B biçiminde gösterilir; A kümesinin bulunduğu işlemlerde B kümesinin de görünme eğilimini ifade eder. Bu ilişkinin gücü üç temel istatistiksel ölçütle değerlendirilir: Destek (Support), bir öğe kümesinin tüm işlemler içindeki görünme sıklığını ölçer. Düşük destekli kurallar yeterli işlem verisi olmadığından istatistiksel açıdan güvenilmezdir. Güven (Confidence), A içeren işlemlerde B'nin de yer alma oranını verir. Yüksek güven kuralın sık doğrulandığını gösterir; ancak B'nin genel popülaritesini yansıtmadığı için tek başına yorumlandığında yanıltıcı olabilir. Kaldıraç (Lift), A ve B'nin birlikte görünmesinin rastlantısal eş-oluşumun ötesinde olup olmadığını gösterir. Lift > 1 anlamlı ilişki, Lift = 1 bağımsızlık, Lift < 1 olumsuz ilişki anlamına gelir. Birliktelik kurallarını çıkarmak için en bilinen algoritma Apriori'dir ve aday üretme ile budama döngüsüyle çalışır. Büyük veri kümelerinde FP-Growth (Frequent Pattern Growth) bellek açısından çok daha verimli bir alternatif sunar. ECLAT ise dikey veri formatını kullanarak kural setlerini hızla bulur. Perakende sektörünün ötesinde; web clickstream analizi, tıbbi teşhis (birlikte ortaya çıkan hastalıklar), tavsiye sistemleri, ağ güvenliği ve metin madenciliği gibi pek çok alanda etkin biçimde uygulanır. Minimum destek ve güven eşiklerinin doğru seçilmesi, anlamlı kuralların sahte pozitiflerden ayırt edilmesi açısından kritik öneme sahiptir. Modern yapay zeka yaklaşımları karmaşık örüntüleri öğrenebilse de, birliktelik kurallarının güçlü yanı insan tarafından doğrudan yorumlanabilir ve açıklanabilir çıktılar üretmesidir. Bu özellik, açıklanabilir yapay zeka (XAI) bağlamında karar destek sistemleri için önemini korumaktadır. Ölçeklenebilirlik açısından ise milyarlarca işlem içeren büyük veri ortamlarında Spark MLlib veya Apache Flink gibi dağıtık çerçeveler kullanılmakta; bu sayede kural keşif süreci gerçek zamanlı akış verisine de uygulanabilmektedir.

arrow_forward
🔗

Causal AI (Nedensellik Tabanlı Yapay Zeka)

Nedensel AI (Causal AI), geleneksel makine ogrenimi sistemlerinin korelasyon kaliplarini ogrenme otesine gecip degiskenler arasindaki gercek neden-sonuc iliskilerini modellemeyi hedefleyen bir yapay zeka yaklasimidur. Temel sorusu "X, Y ile ne kadar iliskili?" degil, "X degistirdigimde Y ne olur?" veya "X olmasaydı Y ne olurdu?"dur. Judea Pearl'un nedensel merdiveni (causal ladder / ladder of causation), bu alandaki temel kavramsal cercevedir. Birinci basamak gozlemdir: veri analizi, korelasyon ve tahmin bu duzeydir; standart ML burada kalmaktadir. Ikinci basamak mudahaledir (intervention): do() operatoru ile bir degiskene mudahale ettigimizde ne olur sorusu sorulur; bu duzey RCT ve politika degerlendirmesi icin kritiktir. Ucuncu ve en guclu basamak karsi-olgusaldur (counterfactual): "Tedaviyi alsaydim ne olurdu?" veya "Bu terori olmasaydı X kac canı kurtardi?" gibi tanimsallik gerektiren sorular bu duzeydir. Yapisal Nedensel Model (Structural Causal Model - SCM), degiskenler arasindaki iliskileri Yonlu Asiklik Graf (DAG) ile temsil eder. Grafin her ok, nedensel bir iliskiyi ifade eder. d-ayrima ve arka kapi (backdoor) kriterleri, gozlemsel veri uzerinde hangi degiskenlerin kontrol edilip edilmemesi gerektigini belirler. Bu matematiksel kesinlik, nedensel cikarimi soyut yorumlamanin otesinde tutar. Saglik alaninda nedensel AI ozellikle kritik uygulamalar sunar. Bireysel Tedavi Etkisi (Individual Treatment Effect - ITE) hesaplamasi, belirli bir hastanin tedaviden fayda gorip gormeyecegini tahmin eder; ayni tedavi biri icin etkili diger biri icin etkisiz veya zararli olabilir. Standart RCT ortalamalari bu heterojenlik bilgisini gizler. Adil AI perspektifinden nedensel yaklasilm, hangi yollarin ayrimciliga yol actigini ayirt edebilir: hem dogrudan etkiler hem de dolayimi yollar modellenir. Bu, neden-sonuc tabanli bir adalet tanimina olanak tanir. **Sik Sorulan Sorular** **Nedensel AI ile klasik makine ogrenimi arasindaki temel fark nedir?** Klasik ML istatistiksel korelasyona dayali tahmin yapar; dagılım degistiginde (distribution shift) bozulabilir. Nedensel AI neden-sonuc iliskilerini modeller; mudahale sonuclarini onceden tahmin edip yeni senaryolara genelleme yapar. **Nedensel AI pratik sistemlerde kullanılıyor mu?** Evet. Amazon ve Meta A/B testi motoru gelistirilerinde nedensel cikarim teknikleri kullanmaktadir. Saglik alaninda kisisellestirilmis tedavi oneri sistemleri ITE modellemesini uygulamaktadir. **Buyuk dil modelleri nedensel akil yurutme yapabilir mi?** LLM'ler nedensel dil kaliplari ogrenerek bazi nedensel sorulari cevaplayabilir; ancak gercek yapisal nedensel akil yurutme gerceklestirdikleri tartismalıdır. Bunun icin genellikle dis bir DAG veya nedensel model katmani gerekir. **Nedensel AI ogrenmeye nereden baslarim?** Judea Pearl'un "The Book of Why" popular bilim kitabi ve "Causal Inference: The Mixtape" (Scott Cunningham) ucretsiz onlline erisislebilir iyi baslangic kaynaklaridur.

arrow_forward
🔗

Causal Inference (Nedensellik Çıkarımı)

Nedensel cikarim (causal inference), iki degisken arasindaki iliskinin yalnizca korelasyon mu yoksa gercek nedensel baglanti mi oldugunu belirlemeye yonelik istatistiksel ve deneysel yontemler butunudur. "Korelasyon nedensellik degildir" ifadesi bu alanin temel motivasyonunu ozetler: buzullamanin azalmasi ile ayı saldırılarının artmasi korele olabilir; ancak ikisi arasinda nedensel bir baglanti aramak yanlis cikarima yol acar. Nedensel cikarimin altin standardi Randomize Kontrollu Deney (RCT)'dir. Bireyler veya birimler rastgele tedavi grubu (intervention alan) ve kontrol grubu (almayan) olarak atanir. Bu rastgele atama, gozlemlenmemis karıstırıcı degiskenlerin (confounders) gruplar arasinda dengeli dagilmasını saglar; boylece gozlemlenen fark yalnizca tedavi etkisine atfedilebilir. A/B testi, RCT'nin dijital ortamdaki en yaygin uygulamasidur. Gozlemsel verilerle calisirken, kontrollu deney mumkun olmadigi durumlarda, alternatif yontemlere basvurulur. Arasal degisken (instrumental variable) yontemi, tedaviyi etkiledigide ancak ciktiyi yalnizca tedavi uzerinden etkileyen bir "arac" degiskeni kullanarak nedensel etkiyi izole eder. Fark farklar (difference-in-differences), tedavi oncesi ve sonrasi trendlerin karsilastirilmasiyla etki hesaplanir. Regression Discontinuity Design (RDD), belirli bir esik degerinden once ve sonra tedavi alan gruplari karsilastirir. Judea Pearl'un yapisal nedensel model cercevesi, DAG (Yonlu Asiklik Graf) ile degiskenler arasindaki nedensel iliskileri gorsel ve matematiksel olarak temsil eder. do() operatoru, bir degiskene mudahale etmek ile yalnizca gozlemlemek arasindaki farki net biçimde ifade eder; bu nedensel merdivenin (korelasyon → mudahale → karsi-olgusal) matematiksel temeli saglar. **Sik Sorulan Sorular** **Neden korelasyon nedensellik degildir?** Korelasyon iki degiskenin birlikte hareket ettigini gosterir; ancak ucuncu bir degisken her ikisini de etkileyebilir (confounding) veya iliskinin yonu ters olabilir. Nedensel cikarim bu alternatifleri sistematik bicimde elemek icin tasarlanmistir. **Buyuk veri nedensellik sorununu cozer mi?** Hayir. Daha fazla gozlemsel veri toplanmasi korelasyonu kesinlestirip nedensellige donusturmez. Yalnizca daha buyuk bir verinin daha buyuk bir confounding problemini beraberinde getirmesi de mumkundur. **A/B testinin sinirliliklari nelerdir?** Spillover etkisi (kontrol grubunun tedavi grubundan etkilenmesi), kararlasma ogretisine (novelty effect) duyarlilik ve uzun vadeli etkileri yakalamada gucluk A/B testinin bilinen sinirliliklandirir. **Machine learning ile nedensel cikarim birlestirilebilir mi?** Evet. Double ML ve causal forests gibi yontemler ML'in tahmin gucunu nedensel cikarimin sertligiyle birlestirerek heterojen tedavi etkilerini bulmak icin kullanilmaktadir.

arrow_forward
code_blocks

Churn Prediction (Müşteri Kaybı Tahmini)

Churn prediction (müşteri kaybı tahmini), bir işletmenin mevcut müşterilerinden hangilerinin yakın gelecekte hizmeti bırakacağını ya da rakibe geçeceğini önceden tahmin eden makine öğrenmesi disiplinidir. "Churn" kavramı, bir müşterinin aboneliğini iptal etmesi, uygulamayı silmesi veya alışveriş yapmayı bırakması gibi davranışları kapsar. Modeller genellikle denetimli öğrenme (supervised learning) paradigmasıyla kurulur: geçmişte kaybedilen müşteriler pozitif (1), kalan müşteriler negatif (0) etiketiyle eğitim setine dahil edilir. Lojistik regresyon, yorumlanabilirliği nedeniyle temel bir başlangıç noktası olarak sıklıkla tercih edilir. Karar ağaçları ve onların topluluk varyantları olan rastgele ormanlar, doğrusal olmayan ilişkileri yakalamada güçlüdür. Gradient boosting yöntemleri (XGBoost, LightGBM, CatBoost) tablo verilerinde sektördeki en yüksek performansı sunar. Derin öğrenme tabanlı ağlar ise zaman serisi ve sekans verisi barındıran durumlarda (çağrı merkezi kayıtları, clickstream) üstünlük sağlar. Özellik mühendisliği bu alanda kritik öneme sahiptir. RFM analizi (Recency, Frequency, Monetary) müşterinin ne zaman, kaç kez ve ne kadar harcadığını özetler. Tenure (hizmet yaşı), kullanım yoğunluğu, destek talebi sayısı, fiyat değişikliğine verilen tepki ve ürün kullanım derinliği en sık kullanılan özellikler arasındadır. Model başarısını ölçmede doğruluk (accuracy) yanıltıcı olabilir; sınıf dengesizliği (class imbalance) nedeniyle AUC-ROC eğrisi ve kesinlik-duyarlılık (precision-recall) dengesi daha güvenilir metriklerdir. Confusion matrix, iş maliyetleriyle uyumlu eşik optimizasyonuna olanak tanır. Uygulamalar telekomünikasyon, bankacılık, SaaS platformları ve e-ticaret başta olmak üzere abonelik ekonomisinin tüm kollarına yayılmıştır. Amaç yalnızca tahminde değil; zamanında müdahale (indirim, kişiselleştirilmiş temas, ürün yükseltme teklifi) ile müşteri yaşam boyu değerini (CLV) korumaktır.

arrow_forward
code_blocks

Class Imbalance (Sınıf Dengesizliği (Class Imbalance))

Sınıf Dengesizliği (Class Imbalance), bir sınıflandırma veri kümesinde farklı sınıflara ait örnek sayısının birbirine eşit olmaması durumudur. Gerçek dünya veri kümelerinin büyük çoğunluğu bu sorunu taşır: sahtekarlık tespitinde meşru işlemler sahte işlemlere göre yüzlerce kat fazla olabilirken, nadir hastalık teşhisinde hasta örnekleri sağlıklı bireylere oranla son derece azdır. Bir model dengesiz veriyle eğitildiğinde çoğunluk sınıfını tahmin etmeyi öğrenerek yüksek genel doğruluk (accuracy) elde eder; ancak gerçek hayatta kritik olan azınlık sınıfı için yetersiz kalır. Örneğin %99 sağlıklı ve %1 hasta içeren bir veri kümesinde model her zaman 'sağlıklı' tahmin yapsa da %99 doğruluk elde eder. Bu durum, doğruluğun yanlış bir başarı metriği olduğunu ortaya koyar; Precision, Recall, F1 ve AUC-ROC bu tür senaryolarda daha güvenilir metriklerdir. Dengesizlikle başa çıkmanın temel yöntemleri dört grupta toplanır. Veri düzeyinde yöntemler; azınlık sınıfını yapay olarak artıran aşırı örnekleme (oversampling) ve çoğunluk sınıfını azaltan alt örnekleme (undersampling) tekniklerini kapsar. SMOTE (Synthetic Minority Over-sampling Technique), 2002'de sunulmuş en yaygın aşırı örnekleme yöntemi olup mevcut azınlık örneklerini interpolasyon ile çoğaltır. Algoritma düzeyinde yöntemler ise hatalı sınıflandırılmış azınlık örneklerini daha ağır cezalandıran maliyet-duyarlı öğrenmeyi (cost-sensitive learning) kapsar. Sınıf ağırlıkları parametresi (class_weight='balanced' scikit-learn'de) otomatik dengeleme sunar. Ensemble yöntemleri arasında BalancedRandomForest ve EasyEnsemble öne çıkar. Son olarak eşik (threshold) ayarı, model tahmin olasılık eşiğini kaydırarak hassasiyet-geri çağırma dengesini yönetir. Türkiye'deki veri bilimi pratiğinde sahtekarlık tespiti, kredi risk modelleme ve hastalık erken tanı gibi yüksek değerli uygulamaların tamamı sınıf dengesizliği sorunuyla yüzleşmek zorundadır. Bu sorunun farkında olmadan geliştirilen modeller üretim ortamında ciddi hatalara yol açar. Sınıf dengesizliğini doğru teşhis etmek ve uygun yöntemi seçmek, güvenilir bir makine öğrenimi sistemi inşa etmenin temel adımlarından biridir.

arrow_forward
code_blocks

Clustering (Kümeleme (Clustering))

Kümeleme (clustering), bir veri setindeki örnekleri önceden tanımlanmış etiketler kullanmadan, yalnızca verinin iç yapısına dayalı benzerlik ölçütlerine göre gruplara ayıran denetimsiz öğrenme tekniğidir. Her küme, üyeleri arasındaki mesafenin (veya başka bir benzerlik metriğinin) küme dışı noktalara göre daha küçük olduğu, homojen bir veri alt kümesidir. Kümeleme algoritmaları farklı geometrik varsayımlara dayanır; bu nedenle algoritma seçimi verinin şekline ve yoğunluğuna bağlıdır. K-Means, veriyi önceden belirtilen k merkeze (centroid) yakınlığa göre böler; kümelerin yaklaşık küresel ve eşit büyüklükte olduğu varsayımıyla çalışır. Hierarchical Clustering (hiyerarşik kümeleme), dendogram adı verilen ağaç yapısı üzerinden küme sayısına önceden karar vermeye gerek duymadan farklı granülerlikte kümeler sunar. DBSCAN (Density-Based Spatial Clustering of Applications with Noise) ise yoğunluk tabanlı çalışır; keyfi şekilli kümeleri bulabilir ve gürültü noktalarını aykırı değer olarak etiketler — bu özellik K-Means'e kıyasla önemli bir avantajdır. Küme kalitesini değerlendirmek için gerçek etiketler olmadan da kullanılabilen iç metrikler mevcuttur. Silhouette skoru, her noktanın kendi kümesine ne kadar yakın, komşu kümelere ne kadar uzak olduğunu -1 ile +1 arasında ölçer; yüksek skor iyi ayrışmış kümelere işaret eder. Davies-Bouldin indeksi ve Calinski-Harabasz skoru da benzer amaçla kullanılan yaygın metriklerdir. K-Means için en uygun k değerini bulmak amacıyla "dirsek yöntemi" (elbow method) ve silhouette analizi birlikte kullanılır. Pratik uygulamaları arasında müşteri segmentasyonu, belge sınıflandırma, anomali tespiti, görüntü renk nicemleme (color quantization), gen ifadesi analizi ve sosyal ağ topluluğu tespiti sayılabilir. Makine öğrenmesinde kümeleme ayrıca özellik mühendisliği aşamasında yeni değişkenler türetmek veya yarı-denetimli öğrenme için etiketleme maliyetini düşürmek amacıyla da kullanılır. Python'da scikit-learn kütüphanesi KMeans, DBSCAN, AgglomerativeClustering gibi tüm temel algoritmaları standart arayüzle sunar.

arrow_forward
recommend

Collaborative Filtering (İşbirlikçi Filtreleme)

Collaborative Filtering (İşbirlikçi Filtreleme), kullanıcıların geçmiş davranışlarını ve tercihlerini analiz ederek kişiselleştirilmiş öneriler sunan temel bir makine öğrenimi tekniğidir. Bu yaklaşım, benzer tercihlere sahip kullanıcıların gelecekte de benzer şeyleri beğeneceği varsayımına dayanır. Netflix, Amazon, Spotify ve YouTube gibi büyük platformların tavsiye sistemlerinin temelini oluşturur. Collaborative Filtering iki ana kategoriye ayrılır: bellek tabanlı (memory-based) ve model tabanlı (model-based) yaklaşımlar. Bellek tabanlı yaklaşımlarda, kullanıcı-kullanıcı veya öğe-öğe benzerlik matrisleri hesaplanarak en yakın komşular belirlenir ve bu komşuların tercihlerine göre öneriler yapılır. Kullanıcı tabanlı (user-based) CF, hedef kullanıcıya en benzer kullanıcıları bulur ve onların beğendiği ancak hedef kullanıcının henüz görmediği öğeleri önerir. Öğe tabanlı (item-based) CF ise kullanıcının daha önce beğendiği öğelere en çok benzeyen yeni öğeleri bulur. Model tabanlı yaklaşımlarda matris çarpanlarına ayırma (matrix factorization) teknikleri kullanılır. Tekil Değer Ayrışımı (SVD) ve Dönüşümlü En Küçük Kareler (ALS) gibi yöntemler, kullanıcı-öğe etkileşim matrisini gizli özellik uzayına (latent feature space) yansıtarak büyük ölçekli sistemlerde verimli çalışır. 2009 Netflix Prize yarışmasında Simon Funk'ın SVD++ algoritması öneri kalitesini yüzde on beş oranında iyileştirerek bu yöntemlerin endüstriyel değerini kanıtlamıştır. Başlıca zorluklar şunlardır: yeni kullanıcı veya öğe için veri bulunmaması (soğuk başlama — cold start), kullanıcıların mevcut öğelerin yalnızca küçük bir kısmıyla etkileşime geçmesi nedeniyle seyrek matris oluşması (sparsity), ve sisteme gizlice sahte tercihler enjekte eden Shilling Attack tehditleri. Bu sorunların üstesinden gelmek için içerik tabanlı filtreleme ile hibrit sistemler oluşturulur. Derin öğrenme çağında Neural Collaborative Filtering (NCF) ve dikkat mekanizmalı modeller, geleneksel yöntemlere kıyasla önemli başarım artışları sağlamaktadır. Python ekosisteminde Surprise, LightFM ve implicit kütüphaneleri yaygın olarak kullanılmaktadır. Modern öneri sistemleri klasik işbirlikçi filtrelemenin ötesine geçmiştir. Derin öğrenme tabanlı NCF (Neural Collaborative Filtering), sinir ağlarıyla doğrusal olmayan etkileşimleri yakalar. Sıra duyarlı modeller (RNN, Transformer), geçmiş etkileşimlerin sırasını modelleyerek 'bir sonraki öğe' tahminini geliştirir. Hibrit sistemler ise içerik tabanlı filtrelemeyle CF'yi birleştirerek soğuk başlangıç sorununu hafifletir. LightGCN gibi grafik sinir ağı tabanlı yaklaşımlar da kullanıcı-ürün grafik yapısını doğrudan öğrenerek 2020'lerden itibaren akademik kıyaslamalarda referans haline gelmiştir.

arrow_forward
hub

Community Detection (Topluluk Tespiti)

Topluluk tespiti (community detection), bir grafın (ağın) kendi içinde yoğun bağlantılı, diğer gruplardan görece seyrek bağlantılı alt yapılarını — toplulukları — ortaya çıkaran graf analizi yöntemidir. Sosyal ağlarda arkadaşlık kümeleri, web grafiklarında konu kümeleri, biyolojik ağlarda işlevsel protein modülleri ve bilgi graflarında kavram grupları bu yöntemle tespit edilebilir. Topluluk tespiti algoritmaları dört ana sınıfa ayrılır. Modülarite optimizasyonu sınıfında Louvain algoritması, grafı aşamalı olarak birleştirerek modülariteyi (Q) maksimize eder; O(n log n) karmaşıklığıyla milyonlarca düğüme ölçeklenir ve literatürün en yaygın kullanılan yöntemidir. Leiden algoritması Louvain'in geliştirilmiş halidir: lokal boşluk sorununu gidererek daha bağlantılı topluluklar üretir ve 2019'dan itibaren büyük ölçekli ağ analizinde standart hâle gelmiştir. Hiyerarşik bölme yöntemlerinde Girvan-Newman algoritması, arasındalık merkeziyeti (betweenness centrality) en yüksek kenarları iteratif biçimde çıkararak toplulukları ayırır; hesaplama maliyeti yüksek olduğundan büyük graflarda daha az tercih edilir. Spektral kümeleme, grafın Laplacian matrisinin özvektörlerini kullanarak düğümleri özellik uzayında kümelendirir ve görüntü segmentasyonu ile doküman kümeleme alanlarında öne çıkar. Etiket yayılımı (label propagation) ise her düğümün komşularındaki en yaygın etiketi benimsemesine dayanan hızlı ve paralel bir yöntemdir. Yapay zeka uygulamalarında topluluk tespiti kritik bir bileşen hâline gelmiştir. Microsoft'un GraphRAG sistemi (2024), metin belgelerinden çıkarılan varlık grafındaki toplulukları Leiden algoritmasıyla tespit eder ve her topluluk için hiyerarşik özet raporlar üretir. Bu raporlar, "sektörde hangi trendler öne çıkıyor?" gibi geniş kapsamlı sorgulara yanıt verirken bağlam olarak kullanılır — standart vektör RAG'ın başarısız olduğu global sorularda çarpıcı biçimde daha iyi sonuçlar elde eder. Öneri sistemlerinde kullanıcı-ürün grafındaki topluluklar, soğuk başlangıç (cold start) sorununu azaltmak için grup tabanlı öneriler üretmekte kullanılır. Doğruluk tespitinde (misinformation detection) sosyal ağ topluluklarının yapısı, koordineli dezenformasyon kampanyalarını tespit etmek için analiz edilmektedir.

arrow_forward
sync_problem

Concept Drift (Kavram Kayması)

Kavram kayması (concept drift), makine öğrenmesi modellerinin eğitiminde kullanılan verinin istatistiksel dağılımının zamanla değişmesi ve bunun sonucunda modelin performansının düşmesi olgusudur. Model yayına alındıktan sonra gerçek dünya verisi sürekli evrilirken model, eğitimde öğrendiği eski kalıpları uygulamaya devam eder; bu uyumsuzluk tahmin hatalarının artmasına yol açar. Kavram kayması dört temel türde gözlemlenir: ani kayma (abrupt drift), ekonomik kriz veya yasal değişiklik gibi anlık olaylarda dağılımın topluca değişmesidir; kademeli kayma (gradual drift), uzun sürede yavaş yavaş meydana gelir; tekrarlayan kayma (recurring drift), mevsimsellik gibi periyodik değişimler içerir; kör nokta kayması (blind spot drift) ise eğitim verisinde hiç görünmemiş yeni veri türlerinin üretimde ortaya çıkmasıdır. Gerçek dünya senaryolarında bu türler iç içe geçebilir; bir e-ticaret platformu hem mevsimsel (recurring) hem de uzun dönemli tüketici tercihi değişimlerine (gradual) maruz kalabilir. Drift tespitinde istatistiksel testler (Kolmogorov-Smirnov, Chi-square), özellik dağılımı izleme (Population Stability Index — PSI), referans pencere ile kayan pencere karşılaştırma ve model performans metriklerinin takibi (doğruluk, AUC, RMSE) en yaygın yöntemlerdir. Evidently AI, River, NannyML ve Alibi-Detect bu analizler için açık kaynaklı araçlar sunar. Yanıt stratejileri arasında periyodik yeniden eğitim (scheduled retraining), drift algılandığında tetiklenen otomatik güncelleme (triggered retraining), her yeni örnekle güncellenen online öğrenme ve farklı döneme ait modelleri birleştiren ensemble yaklaşımları öne çıkar. MLOps altyapısı bu stratejileri drift → uyarı → yeniden eğitim döngüsüyle otomatik biçimde işletir. Kredi riski değerlendirmesinden öneri sistemlerine, doğal dil işlemeden görüntü tanımaya kadar üretimdeki tüm ML modelleri kavram kaymasına karşı savunmasızdır. Pandemi döneminde tüketici harcama kalıpları dramatik biçimde değişmiş, bu durum perakende öneri sistemlerinde ani doğruluk düşüşlerine yol açmıştır. Model izleme ve zamanında yeniden eğitim, güvenilir yapay zeka sistemlerinin temel bileşenleridir.

arrow_forward
trending_down

Data Drift (Veri Kayması (Bozulması))

Veri drift (data drift), bir makine ogrenimi modelinin egitildigi veri dagilimi ile modelin uretimde karsilastigi gercek dunya verisi arasindaki istatistiksel mesafenin zamanla buyumesidir. Bir model egitim sirasinda belirli bir veri dagilimini ogrendigi icin, bu dagilimdaki degisimler modelin ongorduguyle gercek dunyada karsilastiginni arasinda giderek buyuyen bir uyumsuzluk yaratir ve model performansinin bozulmasina yol acar. Drift cesitli bicimlerde gerceklesebilir. Kovaryet drift (covariate shift), girdi ozelliklerinin istatistiksel dagiliminin degismesiyle olur; ancak girdi-cikti iliskisi sabittir. Ornegin bir banka dolandiricilik modelinin egitildigi doneme kiyasla musteri yas profili veya islem buyuklukleri zamanla degisebilir. Kavram drift (concept drift) ise daha derin bir problemi temsil eder: girdi ile cikti arasindaki temel iliskinin kendisi degisir. COVID-19 pandemisi, tuketici aliskanliklarini o kadar kisa surede donusturdu ki yuzlerce sirkette alis-veri tahmin modelleri kritik performans kaybi yasadi. Drift tespiti icin cesitli istatistiksel testler kullanilir. Population Stability Index (PSI), egitim ve uretim verisinin dagilim farkliliğini sayisal olarak olcer; 0.1 altinda kritik, 0.25 uzerinde kritik drift isaretler. Kolmogorov-Smirnov testi iki dagilimlarin istatistiksel olarak anlamli farkliliği olup olmadigini test eder. KL Divergence, bir dagilimdaki bilginin digerini temsil etmek icin ne kadar eksik bilgi gerektirdigini olcer. Pratik MLOps sistemlerinde drift izleme gercek zamanli veya periyodik olarak yurutur. Bir esik gecilelince sistem uyari olusturur, log kaydeder ve bazen otomatik yeniden egitimi tetikler. Yeniden egitim her zaman dogru cevap degildir; kimi zaman ozellik muhendisligi veya modelin yeniden tasarlanmasi gerekir. Etiket gecikme sorunu da yogun gundeme gelir: drift tespitinin kalbi olan gercek etiketi elde etmek haftalar veya aylar alabilir. **Sik Sorulan Sorular** **Veri drift ile model drift arasindaki fark nedir?** Veri drift girdi dagiliminin degismesidir; model drift ise cikti kalitesinin bozulmasini ifade eder. Veri drift model driftin yaygin nedenlerinden biridir ancak tek nedeni degildir. **Drift ne siklukla kontrol edilmelidir?** Bu verinin degisim hizina baglidir. Finansal, hava durumu veya trafik verileri gunden gune bile ciddi drift gosterebilir. Urun tavsiye modelleri genellikle haftalik kontrol yeterlidir. **Drift tespitinde hangi araclar kullanilir?** Evidently AI, Arize, Whylogs, Fiddler ve bulut saglayicilarin yonetilen izleme servisleri yaygin seceneklerdir. Temel istatistiksel testler ise SciPy veya scikit-learn ile uygulanabilir. **Drift olmadan da model bozulabilir mi?** Evet. Model bozulmasi; veri altyapisindaki degisiklikler, bagimliliklarin guncellenmesi veya kodlama hatalari gibi teknik nedenlerle de olabilir; bunlar veri drift olmaksizin gerceklesir.

arrow_forward
code_blocks

Data Labeling (Veri Etiketleme)

Veri etiketleme, ham veri örneklerine anlamlı etiket veya meta veri atamanın sürecidir. Makine öğrenimi modelleri yalnızca gördüğü örneklerden öğrenebilir; bu örneklerin hangi sınıfa, nesneye veya kavrama ait olduğunu belirtmek için etiketleme yapılır. Denetimli öğrenme paradigmasında etiketleme, modelin öğrenebileceği altın standardı (ground truth) tanımlar. Etiketleme yöntemleri üç ana grupta incelenir. Manuel etiketleme, insan uzmanlar veya kalabalık kaynak platformları (Amazon Mechanical Turk, Scale AI, Appen) tarafından gerçekleştirilir; yüksek doğruluk sağlar ancak maliyetli ve yavaştır. Yarı otomatik etiketlemede bir makine öğrenimi modeli ön tahmin üretir ve insan uzmanlar yalnızca belirsiz örnekleri düzeltir; maliyet ile hız arasında pratik bir denge sağlar. Otomatik etiketleme (weak supervision) ise kural tabanlı sistemler veya düşük maliyetli modellerin büyük veri kümelerini hızla etiketlemesine dayanır; Snorkel gibi çerçeveler bu yaklaşımı sistematize eder. Etiket kalitesi model performansını doğrudan etkiler. Gürültülü veya tutarsız etiketler, iyi tasarlanmış bir modelin başarısını dahi düşürebilir. Kaliteyi ölçmek için etiketçi anlaşma oranı (inter-annotator agreement) Cohen's Kappa katsayısıyla hesaplanır; düşük kappa değerleri yeniden etiketleme sürecini tetikler. Çift-kör etiketleme ve etiketçi kalibrasyonu en yaygın kalite güvence yöntemlerindendir. Büyük dil modellerinin yaygınlaşmasıyla etiketleme paradigması dönüşüm geçirmektedir. RLHF sürecinde insan değerlendiriciler modelin iki farklı yanıtından daha iyisini seçerek tercih verisi oluşturur. Bu etiket türü modelin yardımcılık ve zararsızlık yetkinliklerini şekillendirir. RLAIF yaklaşımında ise insan yerine gelişmiş bir model etiketleme görevini üstlenerek ölçeklenebilirliği artırır. Aktif öğrenme, sınırlı etiketleme bütçesiyle maksimum bilgi kazanmayı hedefler. Model, tahmininde en belirsiz olduğu örnekleri insanlara göndererek az etiketlenmiş veriyle yüksek performansa ulaşabilir. Bu yöntem özellikle tıbbi görüntüleme ve hukuki belge sınıflandırma gibi uzman emek gerektiren alanlarda kritik bir tasarruf aracıdır. Etiketleme sürecinde sık karşılaşılan sorunlar şunlardır: etiketçi önyargısı, sınıf tanım belirsizliği, ölçeklenebilirlik güçlükleri ve sınıf dengesizliği. Veri artırma teknikleri ve SMOTE, az örnekli sınıflar için sentetik etiketli veri üretiminde kullanılır.

arrow_forward
water_drop

Data Lake (Veri Gölü)

Data Lake (Türkçe: Veri Gölü), yapılandırılmış, yarı yapılandırılmamış ve yapılandırılmamış verilerin orijinal ham formatlarında depolandığı merkezi, ölçeklenebilir bir büyük veri deposudur. Geleneksel veri ambarlarının aksine, Data Lake veriye önceden bir şema uygulamaz; veriler ham hâlde saklanır ve sorgu anında şema belirlenir (schema-on-read yaklaşımı). Bu esneklik aracılığıyla log dosyaları, görüntüler, videolar, sensör verileri ve JSON/CSV gibi farklı formatlardaki veriler aynı depoda bir arada tutulabilir. "Data Lake" kavramı ilk olarak 2010 yılında Pentaho'nun CTO'su James Dixon tarafından kavramsallaştırılmıştır. Dixon, veri ambarlarını sunum için hazır su şişeleriyle kıyaslarken Data Lake'i kendi doğal ve safiyetini koruyan bir göle benzetti: tüm su kaynakları (veriler) doğal hâlde bu göle akar ve kullanıcılar ihtiyaçlarına göre bu gölden istedikleri miktarda ve formatta su alır. Bir Data Lake mimarisi genellikle birkaç katmandan oluşur. Ham veri bölgesi (Raw/Landing Zone), kaynak sistemlerden gelen verilerin sıfır değişiklikle aktarıldığı giriş noktasıdır. Rafine veri bölgesi (Curated Zone), temizleme, dönüştürme ve kalite kontrolünden geçirilmiş verileri barındırır. Tüketim bölgesi (Consumption Zone) ise iş analistleri, veri bilimciler ve makine öğrenmesi uygulamaları tarafından kullanıma hazır hâle getirilmiş verileri içerir. Data Lake'in başlıca avantajları arasında yüksek ölçeklenebilirlik, düşük birim depolama maliyeti ve veri formatı esnekliği sayılabilir. Ancak yeterli yönetim ve kataloglama araçları olmadığında "Data Swamp" (Veri Bataklığı) hâline gelebilir: verinin nereden geldiği, ne anlama geldiği ve nasıl kullanılacağı belirsizleşir. Bu sorunu çözmek için veri kataloğu (data catalog), veri soyu takibi (data lineage) ve meta veri yönetimi araçları kullanılır. Günümüzde AWS S3 + Glue, Azure Data Lake Storage Gen2, Google Cloud Storage ve Apache Hadoop HDFS popüler Data Lake altyapılarıdır. Modern Delta Lake, Apache Iceberg ve Apache Hudi açık tablo formatları ise ACID işlem desteği ve şema evrimi ekleyerek Data Lake ile Data Warehouse özelliklerini "Lakehouse" mimarisinde birleştirir. Yapay zeka ve büyük dil modeli (LLM) alanında ise Data Lake, model öncesi (pre-training) ham veri havuzu ve fine-tuning veri kümesi deposu olarak kritik bir rol üstlenmektedir. 2025-2026 döneminde Apache Iceberg, AWS Athena, Google BigQuery ve Snowflake'in yerel destek eklemesiyle kurumsal standart tablo formatına dönüşmüştür. DuckDB ise geliştirici bilgisayarında Parquet/Iceberg dosyalarını saniyeler içinde sorgulamayı mümkün kılarak veri gölü erişimini demokratikleştirmiştir. LLM'lerin büyümesiyle birlikte veri gölleri, pre-training corpus yönetiminin birincil katmanı hâline gelmiştir; 2026'da kurulan pek çok AI şirketi veri katmanı olarak doğrudan Lakehouse mimarisini tercih etmektedir.

arrow_forward
code_blocks

Data Leakage (Veri Sızıntısı (Data Leakage))

Veri sızıntısı (data leakage), makine öğrenimi modelinin eğitim sürecine gerçek dünya tahmin anında bulunmaması ya da bilinmemesi gereken bilgilerin karışması ve bu durumun modelin performans değerlendirmesini yanıltmasıdır. Ortaya çıkan en belirgin belirti, geliştirme aşamasında olağandışı yüksek doğruluk, F1 veya AUC değerleri elde edilmesidir; ancak model üretime geçtiğinde bu başarım bir anda çöker çünkü o "sızan" bilgi artık mevcut değildir. Veri sızıntısının iki ana türü vardır. Birinci tür olan hedef sızıntısı (target leakage), eğitim setindeki bir özelliğin tahmin edilmek istenen sonuçla zamansal ya da korelasyonel bağ üzerinden kirlendiği durumu tanımlar. Klasik örnek: sigorta hasar tahmin modelinde "hasar sonrası müşteri iletişim kaydı" özelliğinin kullanılması. Bu değişken modelin sonucu önceden "bilmesine" yol açar; üretimde tahmin anında henüz o kayıt oluşmadığından model başarısız olur. İkinci tür olan eğitim-test kirliği ise ön işleme adımlarının test verisine sıçramasından kaynaklanır. StandardScaler veya MinMaxScaler'ı tüm veri seti üzerinde fit edip ardından bölümleme yapmak bu hatanın en yaygın biçimidir: test setinden gelen istatistikler normalleştirmede kullanıldığından test seti gerçek anlamda görülmemiş olmaktan çıkar. Zaman serisi verileri özellikle yüksek risk taşır. Rastgele train/test bölümlemesi bu tür verilerde her zaman yanlıştır: gelecekteki gözlemler eğitim setine girebilir ve model aslında geleceği görerek geçmişi tahmin eder. Doğru yöntem TimeSeriesSplit veya walk-forward validation kullanmaktır. Tespitte en etkili yöntem, Scikit-learn Pipeline nesneleridir: her çapraz doğrulama kıvrımında ön işleme adımlarını yalnızca o kıvrımın eğitim verisine uyguladığından test kirliğini yapısal olarak engeller. Özellik önem sıralamalarında şaşırtıcı derecede yüksek katkı gösteren değişkenler hedef sızıntısı açısından mutlaka sorgulanmalıdır. Üretim ile geliştirme ortamı arasındaki ani performans düşüşü her zaman veri sızıntısının güçlü bir göstergesidir.

arrow_forward
diamond

Data Mining (Veri Madenciliği)

Veri madenciliği (data mining), büyük veri kümelerinde gizli kalıpları, anlamlı ilişkileri ve öngörülebilir örüntüleri otomatik olarak keşfetme sürecidir. İstatistik, makine öğrenmesi ve veritabanı yönetiminin kesişiminde konumlanan bu alan; ham verinin işlenmesiyle iş kararlarına zemin hazırlayan eyleme dönüştürülebilir bilgiye ulaşmayı hedefler. Veri madenciliği süreci tipik olarak CRISP-DM (Cross-Industry Standard Process for Data Mining) çerçevesiyle yürütülür. Bu altı aşamalı model; iş anlayışı, veri anlayışı, veri hazırlama, modelleme, değerlendirme ve dağıtım adımlarını kapsar. Her aşama birbirini besler ve yinelemeli bir döngü oluşturur; gerçek projelerde modelleme aşamasında elde edilen bulgular çoğunlukla veri hazırlama adımına geri dönüşü zorunlu kılar. Temel veri madenciliği teknikleri şunlardır: sınıflandırma (classification) — yeni örnekleri bilinen kategorilere atama; kümeleme (clustering) — etiket olmaksızın benzer örnekleri gruplama; birliktelik kuralı öğrenme (association rule learning) — birlikte gözüklenen ögeleri keşfetme; anomali tespiti (anomaly detection) — aykırı değerleri bulma; regresyon — sayısal değerleri tahmin etme. Birliktelik kuralı öğrenme, perakende sektöründe sepet analizi (market basket analysis) olarak bilinir. Apriori ve FP-Growth algoritmaları bu alanda en yaygın kullanılan yöntemlerdir. Destek (support) ve güven (confidence) metrikleri, kuralların istatistiksel anlamlılığını ölçer; yüksek kaldıraç (lift) değeri ise bir kuralın tesadüften ibaret olmadığını gösterir. Veri madenciliği; perakende (ürün önerisi, çapraz satış), finans (kredi risk skoru, sahtecilik tespiti), sağlık (tanı desteği, hasta gruplama), telekomunikasyon (churn tahmini) ve e-ticaret (kişiselleştirme motorları) gibi alanlarda kritik iş değeri üretir. Veri madenciliği ile veri bilimi arasındaki fark ise pratik bağlamda önem taşır: veri madenciliği daha dar kapsamlı, kalıp keşfine odaklı klasik bir disiplindir; veri bilimi ise istatistik, yazılım mühendisliği ve alan uzmanlığını bir araya getiren daha geniş bir alandır. Her ikisi de Python ekosistemi (scikit-learn, pandas) ve R (arules, caret) ile uygulanabilir.

arrow_forward
code_blocks

Data Preprocessing (Veri Ön İşleme)

Veri Ön İşleme (Data Preprocessing), ham verinin makine öğrenmesi veya derin öğrenme modelleri tarafından işlenebilecek kalitede ve formatta hale getirilmesi için uygulanan dönüşüm süreçlerinin bütünüdür. Gerçek dünya verileri çoğunlukla eksik değerler, aykırı gözlemler, tutarsız formatlar ve gürültü içerir; veri ön işleme bu sorunları gidererek modelin sağlıklı kalıplar öğrenmesini sağlar. Temel adımlar şunlardır: Eksik değer yönetimi — boş hücreler ortalama, medyan veya KNN gibi yöntemlerle doldurulur ya da silinir. Aykırı değer tespiti ve giderimi — istatistiksel sınır dışına çıkan veri noktaları belirlenir, düzeltilir veya kaldırılır. Ölçeklendirme ve normalleştirme — farklı ölçeklerdeki sayısal değişkenler (örneğin yaş ile maaş) Min-Max normalleştirme veya Z-score standartlaştırma ile ortak bir aralığa çekilir; böylece mesafe tabanlı algoritmalar (KNN, SVM) ya da gradyan inişli modeller (sinir ağları) dengeli çalışır. Kategorik kodlama — metin tabanlı kategorik değişkenler One-Hot Encoding veya Label Encoding ile sayısal formata dönüştürülür. Boyut indirgeme — gereksiz veya birbiriyle yüksek korelasyonlu özellikler PCA gibi yöntemlerle elenerek model karmaşıklığı azaltılır. Veri ön işlemenin en kritik hatası, test setindeki bilgiyi eğitime sızdırmaktır (data leakage). Doğru yaklaşımda fit() yalnızca eğitim seti üzerinde çalışır, transform() ise her iki sete ayrı ayrı uygulanır. scikit-learn Pipeline bu akışı otomatik yönetir; cross-validation döngülerinde bile her fold için bağımsız fit/transform garantilenir. Metin verilerinde ön işleme; tokenizasyon, stop word kaldırma, lemmatizasyon, lowercasing ve noktalama temizleme adımlarını kapsar. Görüntü verilerinde ise yeniden boyutlandırma, piksel normalleştirme ve veri artırma (data augmentation) temel adımlardır. Veri ön işleme, makine öğrenmesi projesinin en fazla zaman harcanan aşamasıdır; veri bilimcilerin yaklaşık yüzde seksenini bu süreç kapsar. Doğru veri ön işleme olmadan en güçlü algoritma bile güvenilir tahminler üretemez; model başarısının temeli veri kalitesidir.

arrow_forward
code_blocks

Data Profiling (Veri Profilleme)

Veri profilleme (data profiling), bir veri kümesinin yapısını, içeriğini, kalitesini ve ilişkilerini kapsamlı biçimde inceleme sürecidir. Bu süreçte her sütunun veri tipi, benzersiz değer sayısı, boş (null) değer oranı, minimum/maksimum değerleri, dağılımı ve desenleri otomatik olarak analiz edilir. Makine öğrenimi ve veri bilimi projelerinde model eğitimine başlamadan önce veri profilleme zorunlu bir adımdır; çünkü kalitesiz verilerle eğitilen modeller gerçek dünya koşullarında güvenilmez sonuçlar üretir. Veri profilleme üç temel boyutta gerçekleştirilir: Yapı profilleme, veri şemasını, alan adlarını ve tipleri doğrular; İçerik profilleme, değerlerin geçerlilik ve eksiksizlik açısından denetimini yapar; İlişki profilleme ise tablolar arası yabancı anahtar uyumlarını ve bağımlılıkları keşfeder. Modern veri profilleme araçları (Apache Griffin, Great Expectations, Deequ, Atlan) istatistiksel özetlerin yanı sıra kural tabanlı kalite kontrolleri de sunar. Yapay zeka destekli profilleme araçları ise geçmiş verileri kullanarak anormallik eşikleri belirler ve veri kayması (data drift) ile konsept kaymasını (concept drift) otomatik olarak algılar. MLOps bağlamında veri profilleme, eğitim-çıkarım dağılımı uyumsuzluklarını (training-serving skew) erkenden yakalamak için sürekli izleme bileşeni olarak entegre edilir. Her yeni veri partisi profillenip referans dağılımıyla karşılaştırıldığında, model performansını olumsuz etkileyecek kayma olayları önceden tespit edilebilir. Büyük ölçekli kurumsal veri ambarlarında profilleme, veri kataloğu (data catalog) platformlarıyla entegre çalışır. Sütun düzeyinde istatistikler, veri soyu (data lineage) bilgisiyle birleştirildiğinde veri mühendisleri hangi kaynağın ne zaman bozulduğunu dakikalar içinde tespit edebilir. Türkiye'deki finansal kuruluşlar ve e-ticaret firmaları, KVKK uyumluluğu kapsamında profilleme çıktılarını kişisel veri envanteri olarak da kullanmaktadır. Profilleme sonuçları aynı zamanda veri bilimi ekiplerinin hangi özelliklerin (feature) modele dahil edilmeye değer olduğunu belirlemesinde kritik bir ön adım işlevi görür; yüksek oranda eksik değer içeren veya tekdüze dağılım gösteren sütunlar özellik mühendisliği aşamasında elenebilir.

arrow_forward
fact_check

Data Quality (Veri Kalitesi)

Veri kalitesi (Data Quality), bir veri kümesinin belirli bir kullanım amacı için ne derece uygun olduğunu ifade eden çok boyutlu bir kavramdır. Yapay zeka, makine öğrenimi ve veri madenciliği projelerinde, veri kalitesi modelin ne kadar doğru ve güvenilir sonuç üreteceğini belirleyen temel etkendir. Veri kalitesi altı standart boyutla ölçülür. Doğruluk (accuracy), veri değerlerinin gerçek dünyadaki durumu yansıtıp yansıtmadığını ölçer. Tamlık (completeness), gerekli alanların eksiksiz biçimde dolu olup olmadığını denetler. Tutarlılık (consistency), aynı verinin farklı sistemler veya tablolar arasında çelişip çelişmediğini kontrol eder. Zamansallık (timeliness), verinin analiz amacına yetecek kadar güncel olup olmadığını sorgular. Geçerlilik (validity), verilerin tanımlanmış iş kurallarına ve formatlara uygunluğunu belirler. Benzersizlik (uniqueness) ise yinelenen kayıtları tespit eder. Sektörde yerleşik olan 'Çöp içeri, çöp dışarı' (Garbage In, Garbage Out) ilkesi, veri kalitesinin modeller üzerindeki doğrudan etkisini özetler. Hatalı veya eksik verilerle eğitilen bir yapay zeka modeli, gerçek dünya koşullarında güvenilmez tahminler üretir. Araştırmalar, veri bilimcilerinin zamanının yüzde altmış ila seksenini veri temizleme ve kalite iyileştirmeye ayırdığını ortaya koymaktadır. Veri kalitesini ölçmek ve artırmak için kullanılan başlıca araçlar arasında Great Expectations, dbt testleri, Apache Soda ve Pandas Profiling yer almaktadır. Bu araçlar veri boru hatlarına (pipeline) entegre edilerek kalite sorunlarını anlık raporlar ve anomalileri uyarı sistemlerine bildirir. Üretim ortamlarında sürekli veri kalitesi izleme (data quality monitoring), sapmalar gerçekleşir gerçekleşmez mühendis ekipleri uyarır. Regülasyon boyutunda AB Yapay Zeka Yasası (AI Act) Madde 10, yüksek riskli yapay zeka sistemlerinde veri yönetim uygulamalarını ve kalite metriklerini belgelemeyi yasal yükümlülük haline getirmiştir. ISO/IEC 25012 standardı da veri kalitesi özelliklerini sistematik biçimde tanımlar. Bu nedenle veri kalitesi artık yalnızca teknik bir uygulama değil, kurumsal yönetişim ve uyum çerçevelerinin ayrılmaz bir parçasıdır.

arrow_forward
code_blocks

DBSCAN (Yoğunluk Tabanlı Kümeleme (DBSCAN))

DBSCAN (Density-Based Spatial Clustering of Applications with Noise), 1996 yılında Martin Ester ve ekibi tarafından tanıtılan, yoğunluk tabanlı bir kümeleme algoritmasıdır. K-Means gibi yöntemlerin aksine, küme sayısını önceden belirleme zorunluluğu taşımaz ve keyfi geometrik şekillerdeki kümeleri tespit edebilir. Bunun yanı sıra gürültü noktalarını açıkça etiketleyerek aykırı değer tespitine de doğal destek verir. Algoritma iki temel parametreye dayanır: ε (epsilon), bir noktanın komşuluk yarıçapını tanımlar; minPts ise bir bölgenin çekirdek nokta sayılabilmesi için gereken asgari komşu sayısıdır. DBSCAN her nokta için ε yarıçaplı komşuluk bölgesini inceler. MinPts veya daha fazla komşuya sahip noktalar çekirdek nokta olarak sınıflandırılır ve bir kümenin çekirdeğini oluşturur. Bir çekirdek noktanın ε-komşuluğunda bulunan ancak kendisi çekirdek olmayan noktalar kenar nokta (border point) adını alır. Hiçbir çekirdek noktanın ε-komşuluğunda yer almayan noktalar ise gürültü (noise) olarak etiketlenir ve -1 etiketi atanır. Algoritma, birbirine yoğunluk-bağlantılı tüm noktaları tek bir kümede toplar. Parametre seçimi DBSCAN'ın başarısını doğrudan belirler. ε için yaygın yöntem k-en yakın komşu (kNN) grafiğidir: her noktanın minPts'inci en yakın komşusuna mesafesi grafiğe dökülerek dirsek (elbow) noktası bulunur. minPts için genel kural, boyut sayısının iki katı (2×d) olmakla birlikte veri setinin yoğunluğuna göre ayarlanması önerilir. Büyük veri kümelerinde standart DBSCAN O(n²) zaman karmaşıklığı gösterir. Bu kısıtlamayı aşmak için HDBSCAN (Hierarchical DBSCAN), OPTICS ve Approximated DBSCAN gibi varyantlar geliştirilmiştir. HDBSCAN, sabit ε yerine adaptif yoğunluk eşiği kullanarak değişken yoğunluktaki karmaşık küme yapılarını başarıyla tespit eder ve Python'daki hdbscan kütüphanesiyle kolayca uygulanabilir. DBSCAN başlıca şu alanlarda kullanılır: coğrafi veri analizinde olay noktalarını doğal kümeler halinde gruplama, anomali tespitinde gürültü noktalarını anormallik göstergesi olarak değerlendirme, görüntü bölütlemede piksel uzayında renk ve doku benzerliğine göre bölge oluşturma ve müşteri segmentasyonunda keyfi şekilli davranış gruplarını belirleme. Scikit-learn'ün sklearn.cluster.DBSCAN sınıfı, algoritmayı yalnızca birkaç satır Python kodu ile kullanılabilir hale getirir.

arrow_forward
code_blocks

Digital Twin (Dijital İkiz)

Dijital ikiz (Digital Twin), fiziksel bir nesnenin, sistemin veya sürecin gerçek zamanlı veri akışıyla beslenen ve sürekli güncellenen sanal temsilidir. Terim, NASA'nın 2010 yılında uzay araçlarını izlemek için geliştirdiği simülasyon yaklaşımına dayanır; sonraki on yılda endüstriyel IoT ve yapay zekayla birleşerek farklı sektörlere yayıldı. Dijital ikizin üç katmanı bulunur: **Fiziksel varlık**, üzerindeki sensörler ve aktuatörler aracılığıyla çevresel verileri üretir. **Veri ve iletişim katmanı**, IoT protokolleri (MQTT, OPC-UA) ile bu verileri buluta veya yerel sunuculara aktarır. **Dijital model**, aldığı anlık verileri fizik tabanlı ya da makine öğrenimi tabanlı simülasyonlarla işleyerek öngörü ve optimizasyon üretir. Kullanım alanları son derece geniştir: **Üretim ve endüstri 4.0**, makinelerin arıza tahminini (predictive maintenance) ve üretim hattı optimizasyonunu kapsar; Siemens ve GE bu alanda öncü uygulamalara sahiptir. **Şehir planlaması**, trafik akışı, enerji tüketimi ve acil durum senaryolarını sanal ortamda test eder — Singapur ve Helsinki dijital ikiz altyapısı kuran öncü şehirler arasındadır. **Sağlık**, kişiselleştirilmiş tedavi planlaması ve organ simülasyonları için araştırma aşamasındadır. **İnşaat ve gayrimenkul**, BIM (Building Information Modeling) modellerinin sensör verileriyle yaşayan dijital ikize dönüşmesini tanımlar. Yapay zeka ile entegrasyon, dijital ikizlerin tahmin doğruluğunu önemli ölçüde artırır: makine öğrenimi modelleri sensör gürültüsünü filtreler, anomali tespiti yapar ve ne zaman bakım yapılacağını öngörür. NVIDIA Omniverse gibi platformlar dijital ikiz geliştirme altyapısı olarak öne çıkmaktadır. Başlıca zorluklar şunlardır: yüksek başlangıç maliyeti ve karmaşık entegrasyon, sensör verisi kalitesi ve güvenilirliği, siber güvenlik (gerçek sisteme saldırı kapısı açılabilir), model ile gerçek sistem arasındaki sapma (model drift) ve veri gizliliği endişeleri. Piyasa ekosistemi açısından Microsoft Azure Digital Twins, AWS IoT TwinMaker, PTC ThingWorx ve Siemens Xcelerator öne çıkan kurumsal platformlardır. Açık kaynak tarafında Eclipse Ditto ve FIWARE bağlam yöneticisi küçük ölçekli projelere kapı aralamaktadır.

arrow_forward
📊

Dizi Madenciliği (Sequence Mining) (Dizi Madenciliği)

Sequence mining (dizi madenciliği veya sıralı örüntü madenciliği), zaman içinde veya belirli bir sıraya göre gerçekleşen olaylardan oluşan veri kümelerinde sık tekrar eden alt dizileri keşfetmeye yarayan veri madenciliği tekniğidir. 1995 yılında Agrawal ve Srikant tarafından önerilen bu yaklaşım, Apriori ilkesini sıralı verilere uygular ve belirli bir minimum destek eşiğini aşan örüntüleri sistematik olarak tanımlar. Dizi madenciliğinde temel kavramlar şöyle özetlenebilir: Bir sıra (sequence), zaman damgalı olay listelerinden oluşur; örneğin bir kullanıcının web sitesindeki sayfa ziyaret sırası ya da bir hastanın tedavi basamakları. Alt dizi (subsequence) ise göreceli sırasını koruyarak bu listeden türetilir. Apriori prensibi, sık olan bir alt dizinin tüm alt kümelerinin de sık olduğunu garanti eder; bu özellik arama uzayını etkili biçimde budamaya yarar. Teknik açıdan üç nesil algoritma öne çıkar. İlk nesil GSP (1995) birden fazla veritabanı taraması gerektirirken, ikinci nesil SPADE (2001) dikey veri formatıyla tarama sayısını üçe indirir. Üçüncü nesil PrefixSpan (2001) önek büyütme yöntemiyle tek veritabanı taramasında çalışır ve günümüz uygulamalarında standart haline gelmiştir. Büyük veri senaryolarında SPAM, bit vektörü gösterimi ile bellek verimliliği açısından avantaj kazanır. Dizi madenciliği, birliktelik kural madenciliğinden (association rule mining) sıra bilgisini hesaba katmasıyla ayrılır: "A'dan sonra B, ardından C" gibi nedenselliğe yakın ilişkileri ortaya koyabilir. Bu özellik; e-ticaret öneri sistemlerinde müşteri yolculuklarını modellemek, genomik araştırmalarda DNA ve protein motiflerini keşfetmek, klinik bilişimde hastalık süreçlerini örüntülemek ve siber güvenlikte anormal davranış dizilerini tespit etmek gibi alanlarda vazgeçilmez kılar. Öte yandan yüksek boyutlu ve seyrek verilerle çalışırken hesaplama karmaşıklığı artabilir; gürültülü zaman serileri ve eksik gözlemler örüntü kalitesini olumsuz etkiler. Modern uygulamalarda PrefixSpan Python paketi ve Spark MLlib üzerinde dağıtık dizi analizi yaygın çözümler olarak benimsenmektedir.

arrow_forward
link

Entity Resolution (Varlık Çözümleme)

Varlık çözümleme (entity resolution), farklı veri kaynaklarındaki kayıtların aynı gerçek dünya varlığına ait olup olmadığını belirleme sürecidir. Bu süreç kayıt bağlama (record linkage), varlık eşleştirme (entity matching) veya çoğaltma tespiti (deduplication) olarak da adlandırılır. Temel zorluk, aynı varlığı temsil eden kayıtların yazım hatası, kısaltma, format farklılığı ya da eksik alan nedeniyle tam eşleşmemesidir: 'Ali Demir', 'A. Demir' ve 'Ahmet Ali Demir' aynı kişiyi tanımlıyor olabilir. Geleneksel varlık çözümleme süreci üç aşamadan oluşur. Önce engelleme (blocking) aşamasında, karşılaştırma uzayını yönetilebilir boyuta indirmek amacıyla yalnızca potansiyel eşleşme adayları bir araya getirilir; phonetic blocking (Soundex, Metaphone), LSH (Locality-Sensitive Hashing) ve token tabanlı engelleme bu amaçla kullanılan başlıca tekniklerdir. Ardından benzerlik puanlama aşamasında her aday çift için Jaro-Winkler mesafesi, TF-IDF kosinüs benzerliği ve alan bazlı ağırlıklandırma gibi yöntemlerle bir eşleşme skoru hesaplanır. Son olarak karar verme aşamasında bu skor bir eşik değeriyle karşılaştırılır ya da sınıflandırıcı modelden geçirilir. Derin öğrenme yaklaşımları varlık çözümlemeyi kökten dönüştürmüştür. BERT tabanlı modeller her kaydı bağlama duyarlı bir vektörle temsil eder; Ditto (2020) gibi modeller LLM'leri fine-tune ederek kural tabanlı sistemlerin ötesinde doğruluk elde etmektedir. Grafik tabanlı yaklaşımlarda ise kayıtlar düğüm, ilişkiler kenar olarak modellenir; topluluk tespiti algoritmaları kümeler içindeki tutarsızlıkları ortaya çıkarır. Uygulama alanları son derece geniştir: müşteri verisi platformlarında çift profil tespiti, sağlık kayıtlarında hasta kimliği birleştirme, e-ticarette ürün kataloğu tekilleştirme ve mali suç tespitinde şüpheli şirket bağlantıları bunların başında gelir. Varlık çözümleme, veri kalitesi yönetiminin temel bileşenidir ve ölçek büyüdükçe hesaplama maliyeti ile recall/precision dengesi temel mühendislik kısıtlarını oluşturur. Özellikle büyük ölçekli MDM (Master Data Management) projeleri ve bilgi grafı sistemleri, varlık çözümleme olmadan tutarlı bir veri altyapısı kuramaz.

arrow_forward
sync_alt

ETL (Extract, Transform, Load)

ETL (Extract, Transform, Load — Çıkar, Dönüştür, Yükle), farklı kaynak sistemlerden ham verinin toplanıp temizlenerek analitik bir hedefe aktarılmasını sağlayan veri entegrasyon sürecidir. Her veri mühendisliği ve veri ambarı projesinin omurgasını oluşturur; kaliteli veriye dayanmayan hiçbir makine öğrenimi modeli ya da iş zekası raporu başarılı olamaz. Extract (Çıkarma) aşamasında veri; ilişkisel veritabanları, REST API'ları, dosya sistemleri (CSV, JSON, XML, Parquet), akış platformları (Kafka, Kinesis) veya SaaS uygulamalarından ham biçimde çekilir. Artımlı çıkarma (CDC — Change Data Capture) yalnızca değişen kayıtları çekerek bant genişliğini ve işlem süresini önemli ölçüde azaltır. Transform (Dönüştürme) aşamasında bu ham veri; temizlenir (eksik ve tutarsız değerler giderilir), normalize edilir (farklı kaynaklardaki kodlamalar birleştirilir), zenginleştirilir (dış referans tablolarıyla birleştirilir) ve hedef şemaya dönüştürülür. Load (Yükleme) aşamasında işlenmiş veri; veri ambarı, veri gölü veya analitik veritabanına tam veya artımlı biçimde yazılır. Modern mimarilerde ETL'nin yerini giderek ELT (Extract, Load, Transform) alıyor: ham veri önce bulut veri ambarına yükleniyor (Amazon Redshift, Google BigQuery, Snowflake), ardından dönüşümler SQL veya dbt (data build tool) aracılığıyla doğrudan hedefteki güçlü işlem kapasitesiyle gerçekleştiriliyor. Reverse ETL ise bu akışı tersine çevirerek ambar verilerini operasyonel sistemlere (CRM, pazarlama araçları) geri göndermek için kullanılır. Makine öğrenimi hattında ETL, feature store'ları besleyen ve model eğitimi için veri setleri hazırlayan kritik bileşendir. Yaygın ETL araçları arasında Apache Airflow, dbt, Apache Spark, Fivetran, Talend ve AWS Glue sayılabilir. Büyük ölçekli sistemlerde mikro-toplu (micro-batch) ve akış (streaming) ETL da standart pratikler arasındadır. Veri kalitesi izleme, veri soyağacı (data lineage) takibi ve şema yönetimi modern ETL boru hatlarının ayrılmaz parçaları haline gelmiştir. Great Expectations ve dbt tests gibi araçlar ETL sürecine otomatik veri doğrulama katıyor; böylece hatalı verinin aşağı akış sistemlerine sızması engelleniyor. Doğru tasarlanmış bir ETL mimarisi, veri güvenilirliğini ve tekrarlanabilirliğini doğrudan belirleyen altyapısal temel taştır; kurumsal ölçekte analitik olgunluğun en önemli göstergelerinden biri olarak kabul edilmektedir.

arrow_forward
science

Feature Selection (Özellik Seçimi)

Ozellik secimi (feature selection), bir makine ogrenimi modelinin egitiminde kullanilacak en bilgilendirici ve gercek anlam tasiyan ozellik alt kumesini belirlemek amaciyla gereksiz, tekrarli veya alakasiz ozelliklerin elenme surecidir. Cok sayida ozellik her zaman daha iyi model anlamina gelmez; aksine fazla ozellik overfitting riskini arttirir, egitim suresini uzatir ve modelin yorumlanmasini guclestirir. Ozellik secimi uc ana kategoride incelenir. Filter yontemleri, model egitiminden bagimsiz olarak ozellikleri istatistiksel kriterlerle puanlar ve siralar. Chi-squared test, mutual information ve Pearson korelasyon katsayisi bu kategorinin temsil ornekleridir. Uygulamasi hizlidir ve overfitting riski tasimaz; ancak ozellikler arasindaki etkilesimi dikkate almaz. Wrapper yontemleri, secilen ozellik alt kumesini dogrudan bir model uzerinde dener ve performansa gore degerlendirme yapar. Recursive Feature Elimination (RFE), ozellik sayisini katlanarak azaltip her adimda modeli yeniden egiterek en kotu ozelligi eler; bu surec hedef ozellik sayisina ulasana kadar devam eder. Wrapper yontemleri genellikle filter yontemlerine kiyasla daha iyi ozellik alt kumesi bulur ancak hesaplama maliyeti cok yuksektir. Embedded yontemler ozellik secimini model egitim surecininin icine gommus sistemlerdir. LASSO (L1 duzenlemesi) bazi ozellik agirliklarini sifira indirerek otomatik secim saglar. Random Forest ve XGBoost gibi agac tabanli modeller egitim sirasinda her ozelligin onemi hesaplar; bu skorlar dusuk onemli ozellikleri elemede kullanilir. Boyutsallak laneti (curse of dimensionality), yuksek ozellikli uzaylarda orneklerin birbirinden uzaklasip mesafe bazli algoritmalarin anlamsizlasmasi olgusunu ifade eder. Ozellik secimi bu problemi dogrudan adreste. Ek olarak secimlerin yorumlanabilirligi saglar: hangi ozelliklerin modeli surdurup surdurmediginin anlasilmasi, hem ayiklama hem de alan uzmanlarindan geri bildirim alma acisindan kritik oneme sahiptir. **Sik Sorulan Sorular** **Ozellik secimi ile boyut indirgeme (PCA gibi) arasindaki fark nedir?** Ozellik secimi mevcut ozelliklerin bir alt kumesini tutar; orijinal ozellikler yorumlanabilirligini korur. PCA gibi boyut indirgeme yontemleri yeni, yapay ozellikler olusturur; yorumlanabilirlik kaybolur ama bazen daha iyi genelleme saglar. **Kac ozellik yeterlidir?** Genel kural yoktur; veri boyutuna, ornek sayisina ve modele bagimlidir. Cross-validation ile farkli ozellik sayilari denenerek elbow noktasi belirlenir. **Ozellik secimi her zaman gerekli midir?** Sinirli ornek sayisi veya yuksek boyutlu veri durumunda buyuk fayda saglar. Derin ogrenme modelleri ozellik muhendisligini buyuk olcude otomatiklestirebilir; bu durumda acik ozellik secimi daha az kritik olabilir. **Kategorik ozellikler icin hangi yontem kullanilir?** Chi-squared test veya mutual information filter yontemleri kategorik ozellikler icin uygundur. Tree-based modellerin onem skorlari ise kategorik ve sayisal ozelliklerin karisik oldugu veri kumelerinde pratik bir embedded yontemdir.

arrow_forward
code_blocks

Frequent Pattern Mining (Sık Kalıp Madenciliği)

Sık Kalıp Madenciliği (Frequent Pattern Mining), büyük veri kümelerinde birlikte sıklıkla ortaya çıkan öğe gruplarını, dizisel kalıpları veya yapısal örüntüleri belirlemeyi hedefleyen temel bir veri madenciliği tekniğidir. "Sık" (frequent) kavramı, bir kalıbın belirli bir minimum destek eşiğini (minimum support threshold) aşması anlamına gelir; yani o kalıbın, tüm işlemlerin (transaction) en az belirlenen yüzdesinde bulunması gerekir. En yaygın kullanım senaryosu birliktelik kuralı madenciliğidir (association rule mining). Süpermarket sepet analizinde "ekmek alan müşteri yüzde seksen olasılıkla tereyağı da alır" türünden kurallar bu yöntemle keşfedilir. Amazon ve Netflix'in öneri sistemleri, kredi kartı dolandırıcılık tespiti ve ağ güvenliği anomali analizi de sık kalıp madenciliğini yoğun biçimde kullanır. Alandaki ilk ve en yaygın algoritma, 1994'te Agrawal ve Srikant tarafından önerilen Apriori'dir. Aday öğe seti üretimi ve budama (candidate generation and pruning) prensibiyle çalışır; her adımda veritabanını yeniden tarar. Bu tarama maliyeti büyük veri setlerinde belirgin bir darboğaz oluşturduğundan, 2000 yılında Jiawei Han ve arkadaşları FP-Growth (Frequent Pattern Growth) algoritmasını geliştirdi. FP-Growth, veriyi kompakt bir FP-Tree yapısına sıkıştırır ve tekrarlı veritabanı taramasını ortadan kaldırarak Apriori'den genellikle 10 ila 100 kat daha hızlı çalışır. Kalıpların değerini belirleyen üç temel ölçüt vardır: destek (support), güven (confidence) ve lift. Destek, bir kalıbın tüm işlemler içindeki görülme oranıdır. Güven, A → B kuralında A'nın geçtiği işlemlerin ne kadarında B'nin de geçtiğini gösterir. Lift ise A ve B'nin bağımsız rastlantısına kıyasla birlikte görülme oranını ölçer; 1'den büyük lift pozitif ilişkiye işaret eder. Bu üçlü, anlamlı ve uygulanabilir kuralları önemsiz korelasyonlardan ayırt etmek için birlikte kullanılır. Günümüzde sık kalıp madenciliği yalnızca kural keşfiyle sınırlı değildir; özellik mühendisliğinde anlamlı özellik kombinasyonlarını bulmak için denetimsiz ön analiz adımı olarak da kullanılır. Python'da mlxtend kütüphanesi apriori() ve fpgrowth() fonksiyonlarıyla, Apache Spark'ta ise MLlib'in FPGrowth modülüyle ölçeklenebilir uygulamalar hayata geçirilebilir.

arrow_forward
🕸️

Graph Mining (Grafik Veri Madenciliği)

Graph Mining (Grafik Veri Madenciliği), düğümler (varlıklar) ve kenarlar (ilişkiler) ile temsil edilen graf yapısındaki gizli desenleri, toplulukları ve bilgileri keşfeden bir veri madenciliği alt dalıdır. Sosyal ağlar, biyolojik moleküler ağlar, bilgi grafları ve dolandırıcılık tespit sistemleri gibi birbirine bağlı veri kümelerinde yaygın biçimde uygulanır. Matematiksel temeli G = (V, E) formülüyle ifade edilir: V düğümler kümesi (kişiler, proteinler, web sayfaları), E ise bu varlıklar arasındaki ilişkiler kümesidir. Graflarda kenarlar yönlü (tek yönlü atıf, takip) veya yönsüz (karşılıklı arkadaşlık), ağırlıklı (etkileşim sıklığı) ya da ikili (var/yok) olabilir. Temel teknikler arasında sık geçen alt-graf madenciliği öne çıkar. gSpan (2002) algoritması, DFS kodlamasıyla sık tekrar eden yapıları verimli biçimde bulur ve kimyasal bileşik veri tabanlarında geniş uygulama alanı bulur. Topluluk tespitinde Louvain algoritması, modülarite değerini optimize ederek milyarlarca düğümlü ağlarda bile O(n log n) hızıyla çalışır. Bağlantı tahmini, mevcut graftan yeni olası kenarları öngörür; bu teknik öneri sistemleri ve ilaç-hedef etkileşim keşfinde kritik rol oynar. Modern Graph Mining, Graf Sinir Ağları (GNN) ile köklü bir dönüşüm geçirdi. GraphSAGE, Graph Attention Network (GAT) ve Graph Convolutional Network (GCN) gibi mimariler, komşu düğümlerden mesaj geçişi yoluyla bağlam-duyarlı gömmeler üretir. Bu yöntemler geleneksel istatistiksel yaklaşımları geride bırakarak siber güvenlik anomali tespiti, sahte haber yayılım modellemesi ve bilgi grafı tamamlama görevlerinde yeni performans standartları belirlemiştir. Uygulama alanları son derece geniştir: Facebook ve LinkedIn'de topluluk analizi, Google Knowledge Graph'ta varlık ilişki sorgulama, biyoinformatikte protein-protein etkileşim ağı analizi ve bankacılıkta işlem ağı tabanlı dolandırıcılık tespiti öne çıkan örneklerdir. Türkiye'de Kredi Kayıt Bürosu ve bankalar, olağandışı ödeme zincirlerini tespit etmek için graf tabanlı analiz yöntemlerinden yararlanmaktadır.

arrow_forward
🔍

Information Extraction (Bilgi Çıkarımı)

Bilgi Çıkarımı (Information Extraction — IE), ham ve yapılandırılmamış metin verilerinden otomatik olarak anlamlı, yapılandırılmış bilgilerin elde edilmesi sürecidir. Doğal dil işlemenin (NLP) temel alt alanlarından biri olan IE; kişi adları, yer isimleri, tarihler ve kurumlar gibi varlıkları tanımlamak, bu varlıklar arasındaki ilişkileri ortaya çıkarmak ve metinde geçen olayları tespit etmek için çeşitli makine öğrenmesi ve dil modeli tekniklerinden yararlanır. İnsan tarafından yazılan doğal dil metni, veritabanlarında sorgulanabilir ve algoritmalar tarafından işlenebilir formata dönüşür. IE sistemi tipik olarak birkaç ardışık aşamadan oluşur: Varlık İsmi Tanıma (Named Entity Recognition — NER) ile metindeki kişi, organizasyon, konum ve tarih gibi kavramlar etiketlenir; İlişki Çıkarımı (Relation Extraction) ile iki varlık arasındaki anlam bağı saptanır; Olay Çıkarımı (Event Extraction) ile belirli bir faaliyetin ne zaman, nerede ve kimler tarafından gerçekleştiğine dair bilgiler yapılandırılır. Modern sistemler bu görevleri gerçekleştirmek için BERT, GPT ve benzeri büyük dil modellerini (LLM) yoğun biçimde kullanmaktadır. Geleneksel kural tabanlı IE sistemleri; düzenli ifadeler (regex) ve el ile hazırlanmış dilbilgisi kurallarına dayanırken, makine öğrenmesi tabanlı yaklaşımlar eğitim verisi üzerinde destek vektör makineleri ve koşullu rastgele alanlar (CRF) gibi olasılıksal modeller kullandı. Günümüzde ön-eğitimli transformer modelleri bu iki yaklaşımı büyük ölçüde geride bırakmış; az örnekli (few-shot) ve sıfır-örnekli (zero-shot) çıkarım yetenekleri pratikte kullanım eşiğini önemli ölçüde düşürmüştür. Bilgi Çıkarımı; haber madenciliği, biyomedikal literatür analizi, finansal doküman işleme ve hukuki metin analizi gibi çok sayıda uygulama alanında kritik bir rol üstlenmektedir. Büyük hacimli metin verilerini insan müdahalesi olmadan işleyebilen IE sistemleri, hem araştırmacılara hem de işletmelere zaman ve maliyet açısından önemli kazanımlar sağlar; aynı zamanda bilgi grafları ve yapısal veritabanlarının zenginleştirilmesine doğrudan katkıda bulunur.

arrow_forward
code_blocks

Isolation Forest (İzolasyon Ormanı) (İzolasyon Ormanı)

Isolation Forest (İzolasyon Ormanı), aykırı değerleri (anomalileri) tespit etmek amacıyla geliştirilmiş, denetimsiz öğrenmeye dayalı bir makine öğrenimi algoritmasıdır. Fei Tony Liu, Kai Ming Ting ve Zhi-Hua Zhou tarafından 2008 yılında ICDM (IEEE Uluslararası Veri Madenciliği Konferansı) konferansında sunulan bu yöntem, geleneksel yaklaşımların aksine normal veri noktalarını modelleme yerine doğrudan aykırı değerleri izole etme ilkesine dayanır. Algoritmanın çalışma mantığı şudur: Aykırı değerler, veri dağılımının yoğun bölgelerinden uzak ve sayıca az olduğundan rastgele seçilen özellik ve bölme değerleriyle inşa edilen ikili karar ağaçlarında (izolasyon ağaçları) çok daha az bölmeyle izole edilir. Normal veri noktaları ise birbirinden ayrılmak için çok sayıda bölme gerektirdiğinden ağacın derinliklerinde kalır. Bir veri noktasının kökten yaprağa kadar olan ortalama yol uzunluğu, o noktanın anomali skoru olarak kullanılır; kısa yol uzunluğu yüksek aykırılığa işaret eder. Yüzlerce izolasyon ağacından oluşan orman oluşturulurken her ağaç, verinin rastgele bir alt örnekleminden bağımsız olarak eğitilir. Bu yaklaşım, O(n log n) zaman karmaşıklığıyla Yerel Aykırı Faktör (LOF) gibi mesafeye dayalı yöntemlerin O(n²) karmaşıklığına kıyasla çok daha verimlidir; özellikle yüksek boyutlu ve büyük veri setlerinde belirgin bir performans avantajı sunar. Başlıca hiperparametreler: n_estimators (izolasyon ağacı sayısı, varsayılan 100), max_samples (her ağaç için örneklenen veri sayısı) ve contamination (beklenen anomali oranı, 0.0-0.5 arası). Python scikit-learn kütüphanesinde sklearn.ensemble.IsolationForest sınıfı olarak kullanılabilir; fit_predict() yöntemi normal veri noktaları için +1, aykırı değerler için −1 döndürür. Uygulama alanları arasında kredi kartı dolandırıcılığı tespiti, ağ saldırısı izleme, üretim hattı kalite kontrolü, IoT sensör anormalliklerinin belirlenmesi ve tıbbi teşhiste anormal bulgu tespiti sayılabilir. 2019 yılında Hariri ve ekibinin geliştirdiği Extended Isolation Forest ise eksen-paralel bölme kısıtını kaldırarak karmaşık veri dağılımlarındaki anomali algılama doğruluğunu iyileştirmiştir. Düşük bellek tüketimi, az sayıda hiperparametre ve yüksek ölçeklenebilirlik özellikleriyle büyük veri ortamlarında da tercih edilen bir anomali tespiti çözümüdür.

arrow_forward
pie_chart

Jaccard Index (Jaccard İndeksi / Benzerliği)

Jaccard Index (Jaccard Benzerlik Katsayısı), iki küme arasındaki benzerliği sayısal olarak ifade eden istatistiksel bir metriktir. 1901 yılında İsviçreli botanikçi Paul Jaccard tarafından farklı dağ habitatlarındaki bitki örtüsü benzerliğini ölçmek amacıyla önerilmiş; on yıllar sonra bilgisayar bilimi, bilgi getirme ve yapay zeka alanlarına taşınmıştır. Temel formül şudur: J(A, B) = |A ∩ B| / |A ∪ B| — yani iki kümenin kesişiminin boyutu, birleşiminin boyutuna bölünür. Sonuç 0 ile 1 arasında değişir: 0 iki kümenin hiçbir ortak elemanı olmadığını, 1 ise kümelerin birebir aynı olduğunu gösterir. Tamamlayıcısı olan Jaccard Uzaklığı (1 − J) farklılık ölçümü için kullanılır. Yapay zekada en yaygın biçimi nesne tespiti modellerini değerlendirirken kullanılan Intersection over Union (IoU)'dur. Modelin tahmin ettiği sınırlayıcı kutu ile etiketlenmiş gerçek kutu birer küme olarak ele alınır; IoU kesişim alanının birleşim alanına oranıdır. COCO ve PASCAL VOC kıyaslama protokolleri, bir tahmini "doğru" saymak için IoU ≥ 0,5 eşiğini kullanır. Semantik segmentasyonda her sınıf için hesaplanan Jaccard değerlerinin ortalaması olan mIoU (Mean Intersection over Union), yöntemleri karşılaştırmada standart metrik hâline gelmiştir. Metin ve veri uygulamalarında belgeler kelime kümelerine dönüştürüldüğünde Jaccard basit biçimde benzerlik ölçer; çoğaltım tespiti ve soru-yanıt eşleştirmede kullanılır. Öneri sistemlerinde kullanıcıların ortak etkileşimde bulunduğu öğeler küme olarak temsil edilir. Büyük ölçekli uygulamalarda MinHash algoritması Jaccard'ı yaklaşık olarak hesaplamak için küçük imzalar üretir; LSH (Locality-Sensitive Hashing) ile birleştirilince milyarlarca belge çiftinde verimli tekilleştirme mümkün hâle gelir. Diğer metriklerle karşılaştırıldığında Sørensen-Dice katsayısı (2|A∩B|/(|A|+|B|)) Jaccard'dan türetilebilir ve küçük segmentlere daha duyarlı olduğu için tıbbi görüntü analizinde tercih edilir. Kosinüs benzerliği vektör yönünü ölçerken frekans bilgisini korur; sürekli ve yüksek boyutlu temsillerde Jaccard'dan üstündür. Ağırlıklı Jaccard ise eleman frekansını hesaba katan çok-küme varyantıdır.

arrow_forward
code_blocks

Korelasyon Analizi (Korelasyon Analizi)

Korelasyon analizi, iki ya da daha fazla değişken arasındaki ilişkinin yönünü ve şiddetini istatistiksel olarak ölçen temel bir veri madenciliği ve analitik yöntemidir. Sonuç olarak elde edilen korelasyon katsayısı, -1 ile +1 arasında bir değer alır: +1 mükemmel pozitif ilişkiyi (bir değişken artarken diğeri de artar), -1 mükemmel negatif ilişkiyi (bir değişken artarken diğeri azalır) ve 0 ise değişkenler arasında doğrusal bir bağ olmadığını gösterir. **Temel Yöntemler** - **Pearson Korelasyonu:** Sürekli, normal dağılımlı veriler için uygundur. Değişkenler arasındaki doğrusal ilişkiyi ölçer. Korelasyon katsayısının mutlak değeri 0.7'nin üzerindeyse güçlü, 0.3–0.7 arasındaysa orta, 0.3'ün altındaysa zayıf ilişki olarak yorumlanır. - **Spearman Sıra Korelasyonu:** Sıralı (ordinal) veriler veya normal dağılım varsayımlarının karşılanamadığı sürekli veriler için tercih edilir. Değişkenlerin sıralı pozisyonlarına bakarak ilişkiyi ölçer; bu sayede aykırı değerlere karşı Pearson'a göre çok daha dayanıklıdır. - **Kendall Tau:** Küçük örneklem boyutlarında ve çok sayıda sıra eşitliği olan durumlarda Spearman'a alternatif olarak kullanılır. **Makine Öğrenmesinde Kullanım Alanları** Korelasyon analizi, makine öğrenmesi pipeline'larının ön işleme aşamasında kritik bir rol oynar: 1. **Özellik Seçimi (Feature Selection):** Birbirleriyle yüksek korelasyona sahip özellikler (çoklu doğrusallık / multicollinearity) tespit edilir ve fazlalık olanlar elenerek modelin aşırı öğrenmesi (overfitting) önlenir. 2. **Keşifsel Veri Analizi (EDA):** Korelasyon matrisi görselleştirmeleri (ısı haritaları), değişkenler arasındaki karmaşık ilişki ağını hızla anlamayı kolaylaştırır. 3. **Öneri Sistemleri:** Collaborative filtering algoritmalarında kullanıcı-öğe benzerliklerini hesaplamak için korelasyon ölçütleri kullanılır. 4. **Zaman Serisi Analizi:** Farklı zaman gecikmelerindeki değişkenler arasındaki ilişkiyi ortaya koymak için otokorelasyon ve çapraz korelasyon analizleri uygulanır. **Korelasyon ≠ Nedensellik** En sık yapılan hatalardan biri, korelasyonu nedensellikle karıştırmaktır. İki değişken arasında güçlü bir korelasyon gözlemlenmesi, birinin diğerine sebep olduğunu kanıtlamaz; her ikisini de etkileyen gizli bir üçüncü değişken (confounding factor) söz konusu olabilir. Bu nedenle korelasyon analizi bulguları, her zaman nedensellik çıkarımı (causal inference) yöntemleriyle desteklenmelidir.

arrow_forward
code_blocks

LDA (Latent Dirichlet Allocation) (Gizli Dirichlet Dağılımı)

Latent Dirichlet Allocation (LDA), David Blei, Andrew Ng ve Michael Jordan tarafından 2003 yılında Journal of Machine Learning Research'te yayımlanan, büyük metin koleksiyonlarındaki gizli konu yapılarını ortaya çıkarmaya yarayan üretici olasılıksal bir modeldir. İsmindeki "gizli" (latent) kelimesi, belgelerde açıkça belirtilmemiş ancak matematiksel olarak çıkarılabilen konu yapılarına atıfta bulunur. LDA iki temel varsayım üzerine kuruludur: her belge, birden fazla konunun olasılıksal bir karışımından oluşur; her konu ise belirli kelimelerin olasılık dağılımıyla tanımlanır. Örneğin bir haber makalesi yüzde altmış ekonomi, yüzde otuz siyaset ve yüzde on spor konusundan oluşuyor olabilir; LDA bu gizli dağılımları otomatik keşfeder. Algoritma, Dirichlet dağılımını iki seviyede uygular: belge-konu dağılımı için alfa parametresi (belgeler içindeki konu yoğunluğunu kontrol eder), konu-kelime dağılımı için beta parametresi. Modeli eğitmek için Gibbs örnekleme ya da değişimsel Bayes (variational Bayes) kullanılır. Konu sayısı (K), kullanıcı tarafından önceden belirlenmesi gereken en kritik hiperparametredir; bu değerin hatalı seçimi modelin başarısını doğrudan etkiler. Pratik kullanım alanları son derece geniştir: haber arşivi ve akademik makale kümeleme, müşteri yorumu analizi, sosyal medya trend tespiti, patent arama sistemleri ve biyomedikal literatür taraması bunların başında gelir. Python ekosisteminde Gensim ve scikit-learn kütüphaneleri aracılığıyla Türkçe metin külliyatlarında da başarıyla kullanılmaktadır. LDA'nın üç temel sınırlılığı vardır: konu sayısının önceden bilinmesi zorunluluğu, kelimelerin sıralamasını yok sayan torba modeli (bag-of-words) yaklaşımı ve çok büyük veri kümelerinde ölçeklenme güçlüğü. 2020'lerden itibaren BERT tabanlı BERTopic modeli ve büyük dil modelleriyle (LLM) gerçekleştirilen konu çıkarımı, daha yüksek semantik tutarlılık sunarak LDA'nın bir bölüm kullanım alanını devralmıştır. Buna karşın LDA; yorumlanabilirliği, istatistiksel tutarlılığı ve düşük hesaplama maliyeti nedeniyle akademik ve endüstriyel uygulamalarda yerini korumaktadır. Özellikle etiketli eğitim verisi bulunmayan denetimsiz senaryolarda vazgeçilmez olmaya devam etmektedir.

arrow_forward
code_blocks

Link Prediction (Bağlantı Tahmini)

Bağlantı tahmini (İng. link prediction), graflar ve ağ yapılarındaki mevcut olmayan ya da gelecekte kurulacak kenarları öngörmeye yönelik bir makine öğrenimi ve veri madenciliği görevidir. Temel soru şudur: "Bu iki düğüm arasında bir bağlantı oluşacak mı?" Sosyal ağlarda arkadaş önerisi, bilgi graflarında eksik ilişkilerin tamamlanması, biyomedikal ağlarda protein-protein etkileşimlerinin keşfi, öneri sistemlerinde ürün birlikteliği analizi ve siber güvenlikte şüpheli bağlantı örüntülerinin tespiti bu görevin başlıca uygulama alanlarıdır. Geleneksel yaklaşımlar yerel komşuluk benzerliğine dayanır. Ortak Komşu (Common Neighbors) yöntemi, iki düğümün paylaşılan komşu sayısını bağlantı skoru olarak kullanır. Jaccard katsayısı bu değeri komşu kümelerinin birleşimine bölerek normalize eder. Adamic-Adar skoru ise az dereceye sahip ortak komşulara daha yüksek ağırlık atayarak bilgi-teorik bir perspektif ekler. Katz Index, iki düğüm arasındaki tüm yolları üstel sönerek ağın küresel yapısını yakalar ve yerel yöntemlere kıyasla daha kapsamlı bir bağlantı skoru üretir. Bu yöntemler yorumlanabilir olmakla birlikte kenar semantiğini doğrudan yakalayamaz. Gömme tabanlı yöntemler bu açığı kapatır. Node2Vec, BFS ve DFS stratejilerini harmanlayan rastgele yürüyüşlerle düğümleri düşük boyutlu latent uzaya yerleştirir. Bilgi grafları için TransE, RelE ve RotatE gibi ilişki gömme modelleri eksik üçüzleri (özne, ilişki, nesne) tamamlamada kullanılır ve kenar semantiğini doğrudan öğrenir. Bu modeller, büyük bilgi tabanlarındaki yüz milyonlarca üçüzü kompakt vektörlerle temsil ederek hızlı çıkarım yapar. Graf Sinir Ağları (GNN), bağlantı tahminini uçtan uca öğrenilebilir bir göreve dönüştürmüştür. GraphSAGE rastgele komşuluk örneklemesiyle bellek verimliliği sağlar; GAT (Graph Attention Network) dikkat mekanizmasıyla komşulara diferansiyel ağırlık atar; SEAL çerçevesi ise yerel alt grafları doğrudan kenar sınıflandırması için eğitir. Başarım değerlendirmesinde AUC-ROC, Hits@K ve MRR (Ortalama Karşılıklı Sıra) metrikleri standart olarak kullanılır. Büyük dil modelleri de bilgi grafı tamamlama görevlerinde bağlantı tahmininden yararlanarak yapısal bilgiyi nöral akıl yürütmeyle birleştirmektedir. PyTorch Geometric ve Deep Graph Library, bu modellerin hızla prototiplenmesini mümkün kılan açık kaynak araç takımlarıdır.

arrow_forward
shopping_basket

Market Basket Analysis (Pazar Sepeti Analizi)

Pazar Sepeti Analizi (Market Basket Analysis), bir veri kümesindeki işlemler içinde birlikte ortaya çıkan nesne veya öğe gruplarını keşfetmek amacıyla kullanılan temel bir veri madenciliği tekniğidir. Adını, müşterilerin alışveriş sepetlerinde hangi ürünleri birlikte satın aldığını analiz eden perakende uygulamasından alır; ancak günümüzde e-ticaret öneri sistemlerinden sağlık bilişimine kadar geniş bir kullanım alanına kavuşmuştur. Teknik, birliktelik kuralı madenciliği (association rule mining) üzerine kurulmuştur ve üç temel metriği baz alır. Destek (support), bir öğe kümesinin tüm işlemler içindeki görülme sıklığını ölçer; ender görülen birliktelikleri analiz dışı bırakmaya yarar. Güven (confidence), belirli bir öncül öğe alındığında ardıl öğenin de alınma olasılığını ifade eder. Kaldıraç (lift), bu birlikteliğin bağımsız oluşumdan ne kadar güçlü olduğunu gösterir; Lift > 1 değeri gerçek bir ilişkiye, Lift < 1 ise negatif bir ilişkiye işaret eder. Analizde en yaygın kullanılan algoritmalar Apriori ve FP-Growth'tur. Apriori, sık geçen öğe kümelerini adım adım genişleterek bulur; ancak büyük veri setlerinde aday öğe sayısının hızla artması nedeniyle hesaplama maliyeti yüksek olabilir. FP-Growth ise veriyi sıkıştırılmış bir ağaç yapısı olan FP-Tree'de saklar; aday üretme adımını atlayarak çok daha verimli çalışır ve büyük ölçekli veri setleri için tercih edilen yöntem hâline gelmiştir. Pazar Sepeti Analizi; e-ticaret platformlarında "Bu ürünü alanlar bunu da aldı" türü öneri motorlarının temelini oluşturur. Mağaza rafı düzenlemesi, ürün paketleme (bundle) stratejileri, çapraz satış (cross-sell) ve yukarı satış (up-sell) kampanyaları için somut verilere dayalı kararlar almayı mümkün kılar. Sağlık sektöründe eş zamanlı reçete edilen ilaçların tespiti, bankacılıkta dolandırıcılık örüntüleri ve web analitiğinde birlikte ziyaret edilen sayfa kümeleri de aynı yöntemle araştırılır. Python ekosisteminde mlxtend kütüphanesi Apriori ve FP-Growth algoritmalarını; PySpark ise büyük ölçekli dağıtık ortamlar için birliktelik kuralı madenciliğini destekler. Verinin doğru ön işlenmesi — özellikle işlem matrisinin (transaction matrix) ikili formata dönüştürülmesi ve minimum destek eşiğinin belirlenmesi — analizin kalitesini doğrudan etkiler.

arrow_forward
code_blocks

Named Entity Recognition (Adlandırılmış Varlık Tanıma)

Named Entity Recognition (NER), kısaca Adlandırılmış Varlık Tanıma, bir metindeki önceden tanımlanmış kategorilere ait varlık ifadelerini otomatik olarak tespit eden ve sınıflandıran temel bir Doğal Dil İşleme görevidir. NER, kişi adlarını (PER), coğrafi konumları (LOC), kuruluş isimlerini (ORG), tarih ve zaman ifadelerini (DATE/TIME) ile para birimlerini (MONEY) ham metin içinden çıkarır. Bu teknoloji, büyük hacimli yapılandırılmamış metni anlamlı ve işlenebilir yapıya dönüştürmek için kritik bir adım işlevi görür. NER'in tarihsel gelişimine bakıldığında ilk sistemlerin 1996 MUC-6 konferansında tanımlanan kurallara dayalı yaklaşımları benimsediği görülür. Bu erken sistemler elle yazılmış düzenli ifadeler ve sözcük listeleri kullanıyordu; İngilizce için kabul edilebilir sonuçlar verse de yeni alanlara uyarlamak son derece maliyetliydi. 2000'lerin başında Koşullu Rastgele Alanlar (CRF) ve Maksimum Entropi gibi istatistiksel modeller kurallı sistemlerin yerini almaya başladı; bu modeller etiketlenmiş eğitim verisinden bağlamsal örüntüler öğreniyor ve genelleme yapabiliyordu. BERT'in 2018'de yayımlanmasıyla NER alanında çığır açıldı. BERT ve sonraki dil modelleri, hem sol hem de sağ bağlamı aynı anda işleyen çift yönlü dikkat mekanizmaları aracılığıyla varlık sınırlarını çok daha doğru tespit edebildi. Günümüzde CoNLL-2003 gibi standart kıyaslama veri kümelerinde F1 puanları yüzde doksan beşi aşmaktadır. BIO etiketleme şeması, varlık sınırlarını açık biçimde kodlaması sayesinde model eğitiminde en yaygın kullanılan standarttır. Türkçe NER için BERTurk ve mBERT modellerini temel alan sistemler geliştirilmiş; tıp, hukuk ve finans gibi alana özel veri kümeleri oluşturulmuştur. Türkçe'nin çekimli ve bitişken yapısı, varlık sınırlarının belirlenmesini İngilizce'ye kıyasla daha güç kılar; bu nedenle alt sözcük tokenizasyon stratejileri kritik önem taşır. NER, bilgi grafiği oluşturma, soru yanıtlama, metin özetleme ve duygu analizi gibi ileri düzey NLP görevlerinin vazgeçilmez bir ön adımıdır.

arrow_forward
code_blocks

Online Learning (Çevrimiçi Öğrenme)

Çevrimiçi öğrenme (online learning), makine öğrenimi modellerinin veriyi tüm veri kümesini bir anda işlemek yerine, veriler geldikçe artan biçimde güncellemesini sağlayan eğitim paradigmasıdır. Bu yaklaşımda model, her yeni gözlem veya küçük veri grubu (mini-batch) geldiğinde ağırlıklarını hemen günceller; böylece hem büyük veri kümelerini bellekte tutma zorunluluğu ortadan kalkar hem de değişen veri dağılımlarına hızlı uyum sağlanır. "Artımlı öğrenme" (incremental learning) veya "akış tabanlı öğrenme" (stream learning) olarak da adlandırılır. Geleneksel toplu öğrenme (batch learning) modeli bir kez eğitip sonuçlarını sabit tutar; yeni verilerle güncelleme için tüm model sıfırdan yeniden eğitilir. Çevrimiçi öğrenmede ise model sürekli evrilir: her gözlemde ağırlıklar küçük adımlarla güncellenir ve eski veriyi saklamaya gerek kalmaz. Bellek gereksinimi sabit kalır; veri büyüdükçe model boyutu artmaz. Temel algoritmalar arasında Stokastik Gradyan İnişi (SGD), Perceptron ve Passive-Aggressive (PA) algoritması yer alır. Derin öğrenme modellerinde SGD, çevrimiçi öğrenmenin standart motorudur. Daha karmaşık senaryolarda LSTM gibi yinelemeli sinir ağları ya da pekiştirmeli öğrenme yöntemleri de çevrimiçi modda çalışabilir. Kullanım alanları gerçek zamanlı karar alma gerektiren sistemleri kapsar: e-ticaret tavsiye sistemleri kullanıcı davranışını anında modele yansıtır; finansal piyasalarda dolandırıcılık tespiti ve fiyat tahmini sürekli güncel modeller ister; ağ güvenliği ve IoT sensör sistemlerinde anomali tespiti anlık adaptasyon gerektirir. Başlıca zorluk, gürültülü ya da aykırı gözlemlere karşı yüksek hassasiyettir; öğrenme hızı zamanlaması ve pencereli güncelleme stratejileriyle bu risk azaltılır. Kavram kayması (concept drift) ise veri dağılımının zaman içinde değişmesidir; ADWIN ve Page-Hinkley gibi algılama mekanizmaları erken uyarı sağlar. Apache Kafka ve River kütüphanesiyle entegrasyon, çevrimiçi öğrenmeyi üretim ortamlarına taşımanın standart yolunu oluşturur.

arrow_forward
sentiment_satisfied_alt

Opinion Mining (Görüş Madenciliği)

Opinion Mining (Görüş Madenciliği), metin içindeki öznel ifadeleri, tutumları ve değerlendirmeleri otomatik olarak çıkaran, yapılandıran ve analiz eden bir Doğal Dil İşleme (NLP) disiplinidir. Terim zaman zaman Duygu Analizi (Sentiment Analysis) ile birbirinin yerine kullanılsa da Opinion Mining daha geniş bir çerçevedir: yalnızca genel duygusal tonu değil, kimin neye ilişkin ne düşündüğünü, belirli bir özellik ya da boyut düzeyinde çıkarmayı hedefler. Klasik Sentiment Analysis bir cümleyi olumlu, olumsuz veya nötr olarak etiketler ve burada durur. Opinion Mining ise çok bileşenli görüş birimlerini ayrıştırır: kimin, neye yönelik, hangi özellik üzerinden, hangi polaritede görüş belirttiğini tespit eder. 'Kulaklığın ses kalitesi üst düzey, ancak mikrofon berbat ve Bluetooth bağlantısı sürekli kesiliyor' gibi bir cümlede genel ton yanıltıcı olabilir; Opinion Mining bu metni üç ayrı görüş birimine ayrıştırır. Bu granüler analiz, ürün geliştirme ekiplerinin hangi özelliğin iyileştirilmesi gerektiğini kesin biçimde belirlemesini mümkün kılar. Teknik açıdan Opinion Mining, Aspect-Based Sentiment Analysis (ABSA) alt görevlerini kapsar: Aspect Term Extraction, Opinion Term Extraction ve Aspect-Opinion Pair Extraction. Modern sistemler bu görevler için BERT, RoBERTa veya büyük dil modelleri (LLM) kullanır. Sıfır-örnekli (zero-shot) LLM yaklaşımları, etiketli eğitim verisi gerektirmeksizin örtük görüşleri bile yakalayabilmektedir. Yapısal çıktı biçimi olarak Opinion Quintuple — kanaat sahibi, hedef varlık, özellik, polarite ve zaman damgası — alanın standart gösterimi kabul görmektedir. Endüstriyel kullanım alanları geniş bir yelpazeye yayılmaktadır: e-ticaret platformları ürün özelliklerini müşteri yorumlarından otomatik değerlendirmekte, finans sektörü yatırımcı duyarlılığını haber ve forum metinlerinden ölçmekte, siyasi analistler seçmen tutumlarını sosyal medya verilerinden gerçek zamanlı izlemektedir. Türkçe dahil çok dilli destek XLM-RoBERTa gibi modeller aracılığıyla giderek güçlenmekte; bu da Opinion Mining'i küresel ölçekte uygulanabilir kılmaktadır.

arrow_forward
🔍

Örüntü Tanıma (Pattern Recognition) (Örüntü Tanıma)

Örüntü tanıma (Pattern Recognition), ham verilerdeki anlamlı yapıları, tekrarlayan kalıpları ve ilişkileri otomatik olarak tespit edip sınıflandırmayı amaçlayan yapay zeka ve makine öğrenmesi disiplinidir. Görüntü, ses, metin ve zaman serileri gibi çeşitli veri tiplerinde çalışabilir; veri madenciliğinden bilgisayarlı görüşe, doğal dil işlemeden biyometriye kadar geniş bir uygulama yelpazesi sunar. Disiplinin kökleri 1957'ye uzanır: Frank Rosenblatt'ın geliştirdiği Perceptron, biyolojik sinir hücrelerinden ilham alan ilk öğrenebilir örüntü tanıma sistemiydi. İlk dönemde istatistiksel yöntemler (Bayes sınıflandırıcıları, doğrusal diskriminant analizi) ve yapısal yaklaşımlar hâkimdi. 1980-2000 yılları arasında destek vektör makineleri (SVM) ve gizli Markov modelleri (HMM) öne çıktı; bu yöntemler konuşma tanıma ve el yazısı okumada önemli ilerleme kaydetti ve ticari ürünlere girdi. 2012 yılında AlexNet'in ImageNet yarışmasında hata oranını %26'dan %15'e düşürmesi, derin öğrenme tabanlı örüntü tanımanın dönüm noktası oldu. Evrişimli sinir ağları (CNN), görüntüdeki pikselleri doğrudan işleyerek hiyerarşik özellikleri katman katman otomatik keşfeder; elle öznitelik mühendisliği gerekmez. Transformer mimarileri ise metin, ses ve görüntüde aynı anda üstün performans sergileyerek örüntü tanımayı çok kipli (multimodal) bir alana taşıdı. Temel çalışma döngüsü beş adımdan oluşur: ham veri edinimi, ön işleme (gürültü giderme, normalizasyon), öznitelik çıkarımı, model eğitimi ve sınıflandırma/tahmin. Denetimsiz öğrenmede ise etiket kullanılmadan veri kümeleri bulunur; bu yöntem anomali tespiti ve müşteri segmentasyonunda özellikle değerlidir. Günümüzde örüntü tanıma; tıbbi görüntülemede kanser tespiti, otonom araçlarda nesne algılama, konuşma asistanlarında ses-metin dönüşümü, finansal sahtekârlık tespiti ve biyometrik kimlik doğrulama gibi kritik alanlarda rol üstlenmektedir. OpenCV, scikit-learn, TensorFlow ve PyTorch gibi açık kaynak kütüphaneler, bu tekniği araştırmacılardan endüstriyel mühendislere kadar geniş bir kitleye erişilebilir ve uygulanabilir kılmaktadır.

arrow_forward
stream

Stream Mining (Veri Akışı Madenciliği)

Stream mining (veri akışı madenciliği), sınırsız, sürekli ve yüksek hızla akan veri üzerinde gerçek zamanlı örüntü, anomali ve bilgi keşfi yapan makine öğrenmesi ve veri madenciliği paradigmasıdır. Geleneksel veri madenciliği, tüm veriyi belleğe yükleyerek çok kez üzerinden geçebildiği statik veri kümelerine (batch) dayalıdır. Veri akışlarında ise bu yaklaşım işe yaramaz: sensörlerden, finansal işlem sistemlerinden, sosyal medya API'lerinden veya ağ trafiğinden saniyede milyonlarca kayıt akar; her gelen kayıt sınırlı süre içinde işlenmeli, bellekte tutulmadan öğrenmeye katkı sağlamalı ve ardından atılmalıdır. Stream mining algoritmalarının karşılamak zorunda olduğu üç temel kısıt vardır. Birincisi, her veri noktası yalnızca bir kez (veya sınırlı sayıda kez) işlenebilir. İkincisi, bellek ve hesaplama kullanımı akış hızına uyum sağlayacak biçimde sabit ya da en azından logaritmik kalmalıdır. Üçüncüsü ise kavram kayması (concept drift): veri akışının istatistiksel özellikleri zaman içinde değişebilir; model buna uyum sağlayabilmelidir. ADWIN (Adaptive Windowing) ve DDM (Drift Detection Method) gibi algoritmalar kavram kaymasını tespit edip modeli anında yeniden kalibre eder. Akış madenciliğinin temel algoritmaları arasında Hoeffding Trees (Very Fast Decision Trees) öne çıkar; bu karar ağacı türü, küçük örneklem boyutlarında bile istatistiksel güven sınırı hesaplayarak dal açmaya karar verir ve tam batch eğitimine çok yakın doğruluk sunar. Reservoir Sampling, boyutu bilinmeyen bir akıştan eşit olasılıklı temsili örneklem çekmeyi mümkün kılar. Count-Min Sketch gibi olasılıksal veri yapıları, büyük akışlarda sıklık sayımını sabit bellekle gerçekleştirir. Apache Kafka, Apache Flink ve Apache Spark Structured Streaming bu işlemleri ölçekli dağıtık ortamlarda yürüten başlıca platformlardır. Uygulama alanları kritik ve çeşitlidir: kredi kartı dolandırıcılığı tespiti, ağ saldırısı anomali izleme, endüstriyel IoT'da kestirimci bakım, gerçek zamanlı öneri sistemleri ve hava kalitesi ile trafik yoğunluğu tahmini bunların başında gelir.

arrow_forward
code_blocks

t-SNE (t-SNE (T-Dağılımlı Stokastik Komşu Gömme))

t-SNE (t-Distributed Stochastic Neighbor Embedding), yuksek boyutlu veriyi iki veya uc boyutlu bir uzaya gorselleştirme amaciyla indirgemek icin kullanilan dogrusal olmayan bir boyut indirgeme yontemidir. 2008 yilinda Laurens van der Maaten ve Geoffrey Hinton tarafindan tanitilan bu algoritma, ozellikle derin ogrenme modellerinin gizli katman temsillerini (embedding) insan gozuyle kavranabilir bicimde gorselleştirme konusunda standart arac haline gelmistir. Algoritmanin calisma prensibi iki temel asamaya dayanir. Birinci asamada yuksek boyutlu uzaydaki her nokta cifti arasindaki benzerlikler Gaussian dagilimi kullanilarak kosullu olasilik degerlerine donusturulur; yakin noktalar yuksek, uzak noktalar dusuk olasilik alir. Ikinci asamada bu dagilim dusuk boyutlu uzayda Student-t dagilimiyla yeniden modellenir. Algoritma, iki dagilim arasindaki Kullback-Leibler (KL) iraksamasini minimize ederek veriyi dusuk boyutlu uzaya gomer. Student-t dağiliminin kalin kuyrugu, uzak noktalarin dusuk boyutlu temsilde daha da ayrismasini saglar ve kalabalik problemi olarak bilinen yapisal bozulmayı buyuk olcude giderir. En kritik hiperparametre perplexity degeridir; bu parametre her nokta icin efektif komsu sayisini belirler ve tipik olarak 5 ile 50 arasinda ayarlanir. Dusuk degerler yerel yapiyi on plana cikarirken yuksek degerler kuresel yapiyi daha iyi yakalar. Cikti rastsal baslangica duyarli oldugundan tekrarlanabilirlik icin random_state parametresinin sabitlenmesi zorunludur. PCA ile karsilastirildiginda t-SNE dogrusal olmayan manifold yapilarini daha iyi ortaya cikarir; ancak eksen degerlerinin dogrudan yorumu yoktur ve yeni veri noktalari icin projeksiyon uretemez. Buyuk veri kumelerinde hesaplama maliyeti yuksek oldugunde Barnes-Hut t-SNE veya GPU hizlandirmali RAPIDS cuML gibi olceklenebilir alternatiflere basvurulur. MNIST rakam gorselleştirmesi, scRNA-seq hucre populasyonu analizi ve transformer gomu uzayi arastirmalari en yaygin uygulama alanlaridir. Scikit-learn uzerinden TSNE sinifi ile hizla uygulanabilir; buyuk ol cekler icin openTSNE veya UMAP alternatif olarak degerlendirilebilir.

arrow_forward
code_blocks

Text Classification (Metin Sınıflandırma)

Text classification (metin sınıflandırma), bir metin parçasının önceden tanımlanmış kategorilerden birine veya birkaçına otomatik olarak atanması görevidir. Doğal Dil İşleme'nin (NLP) temel taşlarından biri olan bu teknik; e-posta spam filtrelerinden duygu analizine, haber kategorizasyonundan müşteri hizmetleri otomasyonuna kadar geniş bir uygulama yelpazesine sahiptir. Makine öğrenimi tabanlı yaklaşımlarda metin önce sayısal temsillere dönüştürülür: TF-IDF vektörleri, Word2Vec embeddingler veya BERT gibi transformer tabanlı temsiller. Bu vektörler ardından Naive Bayes, Destek Vektör Makineleri (SVM) veya derin sinir ağları gibi sınıflandırıcılara beslenir. Modern uygulamalarda BERT, RoBERTa ve GPT gibi büyük dil modelleri ince ayar yapılarak (fine-tuning) olağanüstü doğruluk oranları elde edilmektedir. Üç temel türü vardır: ikili sınıflandırma (binary: spam/değil), çok sınıflı sınıflandırma (multi-class: spor/siyaset/ekonomi haber kategorizasyonu) ve çok etiketli sınıflandırma (multi-label: tek metne birden fazla kategori atama). Değerlendirme için salt doğruluk (accuracy) yetersiz kalabilir; sınıf dengesizliği durumlarında precision, recall ve F1 skoru daha güvenilir metriklerdir. Eşik bağımsız ölçüm için ROC-AUC kullanılır; kalibrasyon testi ise model güvenirliğini doğrular. Gerçek dünya uygulamalarının en yaygın zorluğu veri dengesizliğidir: örneğin yüzde bir spam, yüzde doksan dokuz normal e-posta dağılımı. Bu sorun SMOTE örnekleme, class-weight ayarlaması veya threshold kalibrasyonu ile giderilir. Sağlık alanında klinik not kategorizasyonu, hukuk sektöründe belge sınıflandırması ve içerik moderasyonunda zararlı içerik tespiti kritik kullanım alanlarıdır. SetFit gibi few-shot öğrenme çerçeveleri, contrastive learning ile yalnızca 8–64 etiketli örnek kullanarak tam ince ayar düzeyinde performans elde eder. Zero-shot sınıflandırmada GPT-4o veya Claude gibi büyük dil modelleri ek eğitim verisi olmaksızın kategori açıklamalarıyla doğru etiket ataması yapabilir. Türkçe için BERTurk, bert-base-turkish-cased ve XLM-R modelleri güçlü kıyaslama noktaları oluşturmaktadır.

arrow_forward
📝

Text Mining (Metin Madenciliği)

Text mining (metin madenciliği), büyük ve yapılandırılmamış metin veri kümelerinden örüntüler, ilişkiler ve anlamlı içgörüler çıkarmayı amaçlayan multidisipliner bir veri analizi alanıdır. Doğal dil işleme (NLP), istatistik ve makine öğrenimi yöntemlerini bir araya getiren text mining, günümüzde üretilen verinin tahminen yüzde seksenini oluşturan yapılandırılmamış metni işlenebilir bilgiye dönüştürür. KDD (Knowledge Discovery in Databases) sürecinin metin odaklı uzantısı olarak tanımlanan bu alan, 1990'larda üniversite araştırma laboratuvarlarında filizlenmiş ve sosyal medyanın patlamasıyla birlikte endüstriyel ölçeğe ulaşmıştır. Text mining pipeline'ı dört temel aşamadan oluşur: (1) Ön işleme — tokenizasyon, durak sözcük temizleme ve lemmatizasyon; (2) Özellik çıkarımı — TF-IDF, n-gram veya BERT gibi bağlam duyarlı vektörler; (3) Model uygulama — sınıflandırma, kümeleme, konu modelleme veya bilgi çıkarımı; (4) Yorumlama — çıktıların iş kararlarına veya araştırma bulgularına aktarılması. Bu dört adımlı süreç, ham bir tweet koleksiyonundan yöneticilere sunulacak marka algısı raporuna uzanan tüm iş akışlarını kapsar. Tarihsel olarak text mining, 1990'larda Naive Bayes ve TF-IDF tabanlı yöntemlerle gelişti; 2000'lerin ortasında SVM ile güçlendi. 2018'de Google'ın BERT modelini yayımlaması alanda köklü bir dönüşüm başlattı: bağlamı dikkate alan transformer mimarileri, belirsizlik giderme ve çok anlamlılık çözümlemesinde geleneksel yöntemleri geride bıraktı. Günümüzde GPT-4o gibi büyük dil modelleri sıfır atışlı metin sınıflandırması için kullanılırken, üretim iş yüklerinde ince ayarlı küçük modeller genellikle tercih edilmektedir. Türkçe gibi eklemeli dillerde tokenizasyon özellikle güçtür; tek bir köke eklenen onlarca ek aynı kelimenin onlarca farklı biçim almasına yol açar. BERTurk ve XLM-R, Türkçe metin madenciliği projelerinde önerilen temel modellerdir. Uygulama alanları son derece geniştir: sağlıkta elektronik kayıtlardan tanı ipuçları çıkarılması, finansta haber duyarlılığı sinyali üretilmesi, hukukta sözleşme analizi ve akademik literatürde bibliyometrik eğilim tespiti bunların başında gelir.

arrow_forward
code_blocks

TF-IDF (TF-IDF (Terim Frekansı-Ters Belge Frekansı))

TF-IDF (Term Frequency-Inverse Document Frequency — Terim Frekansı-Ters Belge Frekansı), metin madenciliği ve bilgi erişiminde bir kelimenin bir belge koleksiyonuna göre o belgede ne kadar önemli olduğunu sayısal olarak temsil eden temel bir yöntemdir. İki bileşenin çarpımından oluşur. TF (Terim Frekansı), hedef kelimenin incelenen belgede kaç kez geçtiğini gösterir. Genellikle toplam kelime sayısına bölünerek normalleştirilir; böylece uzun belgeler haksız avantaj elde etmez. IDF (Ters Belge Frekansı), kelimenin belge koleksiyonunda ne kadar nadir olduğunu ölçer. Koleksiyondaki toplam belge sayısının kelimenin geçtiği belge sayısına oranının logaritması alınarak hesaplanır. Bu sayede "ve", "ile", "bu" gibi anlam taşımayan yaygın kelimeler çok düşük ağırlık alırken belgeye özgü teknik terimler ön plana çıkar. 1972'de Karen Spärck Jones tarafından geliştirilen bu yöntem, onlarca yıldır arama motorlarında belge sıralama, metin sınıflandırma, anahtar kelime çıkarma, belge özeti ve benzerlik hesaplama gibi görevlerde kullanılmaktadır. Elasticsearch ve Apache Solr, arama skorlamasında TF-IDF türevli BM25 algoritmasına dayanır. Python ekosisteminde scikit-learn'ün TfidfVectorizer sınıfı, ham metin koleksiyonunu seyrek TF-IDF matrisine dönüştürür; bu matris makine öğrenmesi modellerine doğrudan girdi olarak verilir. Modern büyük dil modelleri (LLM) ve semantik gömme (embedding) yöntemlerinin yaygınlaşmasıyla birlikte TF-IDF'nin önemi sorgulanmış olsa da, yorumlanabilirlik, düşük bellek ayak izi ve hesaplama verimliliği bu yöntemi uygulamada hâlâ geçerli kılmaktadır. Özellikle BM25 ile hibrit arama sistemleri ve RAG (Retrieval-Augmented Generation) ardışık düzenlerinde TF-IDF temelli geri çağırma katmanı yaygın biçimde kullanılmaktadır. Türkçe doğal dil işleme çalışmalarında TF-IDF, haber sınıflandırma, ürün yorumu analizi ve arama ön işleme katmanlarında kullanılmaktadır. Türkçe'nin zengin çekimli yapısı nedeniyle zemberek veya snowball stemmer ile ön işleme yapılması önerilir. Büyük dil modelleri embedding katmanında TF-IDF'yi geçmiş olsa da, hızlı prototipleme ve küçük veri kümelerinde hâlâ tercih edilmektedir.

arrow_forward
code_blocks

Time Series (Zaman Serisi)

Zaman serisi (time series), belirli aralıklarla ve kronolojik sırayla toplanan veri noktalarının dizisidir. Hava durumu ölçümleri, hisse senedi fiyatları, enerji tüketimi, hasta kalp ritmi ve web sitesi trafik verileri birer zaman serisi örneğidir. Veri noktaları arasındaki zaman aralığı dakika, saat, gün veya ay olabilir; önemli olan sıranın korunması ve her gözlemin bir zaman damgasıyla eşleştirilmesidir. Her zaman serisi dört temel yapısal bileşenden oluşur: uzun vadeli yönelimi gösteren trend; belirli periyotlarda tekrarlayan mevsimsellik (seasonality); ekonomik büyüme ve daralma döngüleri gibi daha uzun vadeli dalgalanmaları kapsayan döngüsellik (cyclicality); ve hiçbir kalıpla açıklanamayan rastgele sapmaları içeren gürültü. Başarılı bir analiz bu bileşenleri ayrıştırmakla başlar. Klasik istatistik yöntemleri arasında ARIMA (Autoregressive Integrated Moving Average), durağanlaştırılmış serilerde kısa vadeli tahmin için standart yaklaşımdır. Mevsimsel bileşen içeren serilerde SARIMA tercih edilir; Holt-Winters üstel düzleştirme yöntemi trend ve mevsimselliği ayrı parametrelerle modeller. Çok değişkenli durumlarda ise VAR (Vector Autoregression) birden fazla serinin karşılıklı etkileşimini hesaba katar. Derin öğrenme bu alanı köklü biçimde dönüştürmüştür. LSTM (Long Short-Term Memory) ve GRU (Gated Recurrent Unit) ağları kapı mekanizmaları aracılığıyla uzun dönem bağımlılıklarını öğrenebilmektedir. Transformer mimarisinin zaman serilerine uyarlanmasıyla TFT (Temporal Fusion Transformer) ve N-BEATS modelleri geliştirilmiştir. 2023 sonrasında TimesFM (Google), Chronos (Amazon) ve Lag-Llama gibi foundation modeller büyük ölçekli ön eğitimle sıfır-atış (zero-shot) tahmin kapasitesi kazanmıştır. Zaman serisi analizi finans, üretim, sağlık ve enerji gibi pek çok kritik sektörde kullanılmaktadır. Anormallik (anomali) tespiti, tahminlenen değerden sapan noktaları otomatik olarak işaretleyerek operasyonel riskleri erkenden ortaya koyar. Durağanlık (stationarity) varsayımı zaman serisi analizinin merkezinde yer alır: ortalama ve varyansın zaman içinde sabit kalması, çoğu klasik modelin ön koşuludur. Mevsimsel ayrıştırma ve differencing bu koşulu sağlamak için standart ön işleme adımları arasındadır.

arrow_forward
code_blocks

Veri Tekilleştirme (Data Deduplication) (Veri Tekilleştirme)

Veri tekilleştirme (data deduplication), bir veri kümesindeki yinelenen ya da tekrarlayan kayıtları tanımlayıp kaldıran veri madenciliği sürecidir. Aynı varlığı temsil eden birden fazla kayıt; farklı yazım biçimleri, eksik alanlar veya biçim tutarsızlıkları nedeniyle ortaya çıkabilir. Bu yinelemeler analiz kalitesini düşürür, makine öğrenmesi modellerini yanıltır ve depolama maliyetlerini artırır. Tam eşleşme tespiti (exact match) basit hashing yöntemleriyle yapılır; MinHash ve SimHash algoritmaları ise yakın-yineleme (near-duplicate) tespitinde büyük veri kümelerinde verimli çalışır. Kayıt bağlama (record linkage) tekniği, farklı kaynaklardaki kayıtları blok yöntemi veya sıralı komşuluk algoritması ile karşılaştırarak ikinci dereceden karmaşıklığı azaltır. Makine öğrenmesi tabanlı yaklaşımlar — SVM, Karar Ağacı, Random Forest ve derin öğrenme modelleri — klasik yöntemleri geride bırakmaktadır. Denetimli algoritmalar etiketli eğitim verisiyle yüksek hassasiyette yineleme tespiti yaparken, derin öğrenme Siamese Network mimarileri metin, görsel ve yapısal veriler üzerinde anlam düzeyinde benzerlik ölçümü yaparak karmaşık yinelemeleri de yakalayabilir. LLM eğitim verilerinin hazırlanmasında veri tekilleştirme kritik bir adım haline gelmiştir: yinelenen belgeler modeli ezberlemeye yönlendirir ve genelleme yeteneğini azaltır. C4, The Pile ve FineWeb gibi büyük veri kümelerinde MinHash tabanlı tekilleştirme standart bir ön işleme adımı olarak uygulanmaktadır. Bir tekilleştirme sisteminin kalitesi; kesinlik (precision), duyarlılık (recall) ve her ikisini dengeleyen F1-skoru ile ölçülür. Milyarlarca kayıt içeren sistemlerde aday uzayını daraltmak için önce blocking (benzer kayıtları gruplandırma), ardından ayrıntılı sınıflandırma adımı uygulanır; bu iki aşamalı yapı hesaplama maliyetini köklü biçimde düşürür. Kişisel sağlık ve finans verileriyle çalışan kurumlarda ham kayıtları açık etmeden tekilleştirme yapan gizlilik koruyucu kayıt bağlama (privacy-preserving record linkage) protokolleri tercih edilmektedir; bu protokoller GDPR ve KVKK uyumu açısından da kritik önem taşımaktadır.

arrow_forward
content_cut

Web Scraping (Veri Kazıma (Web Kazıma))

Web kazıma (web scraping), bir web sitesinin HTML içeriğini programatik olarak indirip anlamlı verileri çıkarma sürecidir. Manuel kopyala-yapıştırmanın aksine, web kazıma belirli bir hedef yapıya sahip veriler için — fiyat takibi, araştırma verisi toplama, pazar analizi — büyük ölçekte otomasyon imkânı tanır. Temel web kazıma süreci üç adımdan oluşur: istek gönderme (HTTP GET/POST), HTML ayrıştırma (parsing) ve veri çıkarma. Python'da Requests kütüphanesi HTTP isteklerini yönetirken BeautifulSoup veya lxml, CSS seçiciler ve XPath ifadeleriyle istenen elemanları ayıklar. Scrapy ise asenkron mimarisiyle binlerce sayfayı verimli biçimde gezebilen tam donanımlı bir web kazıma çerçevesidir. Dinamik web siteleri, JavaScript ile içeriklerini tarayıcıda oluşturduğundan geleneksel HTTP tabanlı kazıma yetersiz kalır. Bu durumda Playwright veya Selenium gibi tarayıcı otomasyon araçları, gerçek bir tarayıcı ortamında sayfayı render ederek dinamik içeriğe erişimi mümkün kılar. Playwright, Chrome, Firefox ve WebKit desteği ile asenkron mimarisiyle modern kazıma projelerinde tercih edilen araç hâline gelmiştir. Web kazımada etik ve hukuki boyutlar büyük önem taşır. robots.txt dosyası, site sahiplerinin hangi yolların kazınmasını istemediğini belirtir; bu dosyaya uymak etik bir zorunluluktur. Hizmet şartları (Terms of Service), bazı siteler için kazıma işlemini yasal zeminde sınırlandırabilir. Kişisel veri içeren içerik GDPR ve KVKK kapsamında ek duyarlılık gerektirir. Sunuculara aşırı istek göndermek hedef siteyi yavaşlatabilir veya yasal sorumluluk doğurabilir; bu nedenle istekler arasında makul gecikmeler bırakmak standart uygulamadır. Anti-kazıma teknolojileri de gelişmiştir: CAPTCHA, IP engelleme, istek parmak izi analizi ve JavaScript zorunluluğu bunlar arasındadır. Bu engelleri aşmak için proxy rotasyonu, kullanıcı-ajanı (user-agent) değiştirme ve ScrapingBee, Apify, Bright Data gibi yönetimli web kazıma API hizmetleri yaygın biçimde kullanılmaktadır. Büyük ölçekli projelerde veri depolama, temizleme ve doğrulama süreçleri de kazıma pipeline'ının ayrılmaz parçalarıdır.

arrow_forward