Data Mining (Veri Madenciliği)
Buyuk veri kumelerinde gizli kalip ve anlamlı iliskileri otomatik olarak kesfetme sureci.
Veri madenciligi (data mining), buyuk veri kumelerinde gizli kalıpları, anlamlı ilişkileri ve bilgiyi outomatic olarak kesfetme sureci. Istatistik, makine ogrenmesi ve veritabani yonetiminin kesisiminde yer alan bu alan; ham verinin islenmesiyle anlamlı is kararlarına yol acan bilgiye donusturulmesi hedefler. Veri madenciligi sureci tipik olarak CRISP-DM (Cross-Industry Standard Process for Data Mining) metodolojisiyle yurutulur: is anlayisi, veri anlayisi, veri hazirlama, modelleme, degerlendirme ve deployment asamalarindan olusur. Bu cerceve, veri bilimiyle buyuk olcude ortusmektedir. Temel veri madenciligi teknikleri sunlardir: siniflandirma (classification) — yeni ornekleri bilinen kategorilere atama; kumeleme (clustering) — etiket olmaksizin benzer ornekleri gruplama; birliktelik kurali ogrenme (association rule learning) — birlikte gozuklenen ogeleri kesfetme; anomali tespiti (anomaly detection) — aykiri degerleri bulma; regresyon — sayisal degerleri tahmin etme. Birliktelik kurali ogrenme, sepet analizi (market basket analysis) olarak bilinen uygulamada kucuk bir ornek olarak Apriori ve FP-Growth algoritmalari kullanilir. 'Bira alan musteri bez de satin alır' gibi iliskiler bu teknikle kesfedilmistir. Bu oneri motorlarinın, cross-selling stratejilerinin ve icerik onerisinin temelini olusturur. Veri madenciligi; perakende (urun onerisindeki), finans (kredi riski, sahtekarlık tespiti), saglik (tani destegi, hasta gruplama) ve telekomunikasyon (musteri kaybı tahmini — churn) gibi alanlarda yaygin kullanim alanlarina sahiptir.