tag veri-hazırlama
Feature Engineering (Öznitelik / Özellik Mühendisliği)
Bu sayfada veri-hazırlama (Feature Engineering (Öznitelik / Özellik Mühendisliği)) etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.
Özellik mühendisliği (feature engineering), ham veriden makine öğrenmesi modellerinin daha iyi öğrenebileceği bilgilendirici özellikler türetme sürecidir. Algoritmalar veriyi olduğu gibi değil, sunulan özellikler aracılığıyla öğrenir; bu nedenle hangi özelliğin nasıl temsil edildiği model performansını doğrudan belirler. Özellik mühendisliği birçok alt görevden oluşur. Özellik oluşturma, mevcut sütunları birleştirerek veya dönüştürerek yeni değişkenler üretir: bir e-ticaret veri setinde kullanıcının gün içi sipariş yoğunluğu 'sabah', 'öğleden sonra', 'gece' gibi zaman dilimi etiketlerine dönüştürülebilir. Özellik seçimi ise gürültülü veya gereksiz değişkenleri elemek için korelasyon analizi, karşılıklı bilgi skoru veya özellik önem skorlarını kullanır. Kategorik değişkenlerin sayısal temsillere dönüştürülmesi temel mühendislik adımlarından biridir. One-hot encoding ikili sütunlar üretirken, hedef kodlama (target encoding) kategorileri hedef değişkenin ortalamasıyla temsil eder. Yüksek kardinaliteli sütunlarda embedding tabanlı yaklaşımlar bilgiyi daha kompakt biçimde saklar. Sayısal özellikler için normalizasyon (min-max ölçekleme) ve standardizasyon (z-skoru dönüşümü) kritik ön işleme adımlarıdır. Mesafe tabanlı algoritmalar (k-NN, SVM) bu ölçeklemeye duyarlıdır; ölçekleme yapılmadan büyük değer aralıklı özellikler küçük aralıklıları gölgede bırakır. Zaman serisi verisinde gecikme özellikleri (lag features), hareketli ortalama ve mevsimsel bileşenler gibi mühendislik dönüşümleri modellerin zamansal örüntüleri kavramasını sağlar. Metin verisinde TF-IDF ve n-gram özellikleri, görüntü verisinde ise histogram eşitleme ve kenar çıkarımı klasik özellik mühendisliği adımlarıdır. Derin öğrenme bu adımların bir kısmını otomasyona taşımış olsa da yapısal ve tablolu veri içeren birçok endüstriyel görevde manuel özellik mühendisliği, model performansını belirleyici biçimde etkileyen kritik ayrımcı etken olmayı sürdürmektedir. Kaggle gibi rekabetçi veri bilimi platformlarında üst sıralardaki çözümlerin ortak özelliği, algoritma seçiminden çok üretken ve yenilikçi özellik mühendisliği stratejisine dayanmalarıdır. Featuretools gibi otomatik mühendislik kütüphaneleri süreci hızlandırırken, alan uzmanlığı en değerli özellik kaynaklarını belirleme konusunda belirleyici rolünü korur.
Feature Engineering (Öznitelik / Özellik Mühendisliği)
Özellik mühendisliği (feature engineering), ham veriden makine öğrenmesi modellerinin daha iyi öğrenebileceği bilgilendirici özellikler türetme sürecidir. Algoritmalar veriyi olduğu gibi değil, sunulan özellikler aracılığıyla öğrenir; bu nedenle hangi özelliğin nasıl temsil edildiği model performansını doğrudan belirler. Özellik mühendisliği birçok alt görevden oluşur. Özellik oluşturma, mevcut sütunları birleştirerek veya dönüştürerek yeni değişkenler üretir: bir e-ticaret veri setinde kullanıcının gün içi sipariş yoğunluğu 'sabah', 'öğleden sonra', 'gece' gibi zaman dilimi etiketlerine dönüştürülebilir. Özellik seçimi ise gürültülü veya gereksiz değişkenleri elemek için korelasyon analizi, karşılıklı bilgi skoru veya özellik önem skorlarını kullanır. Kategorik değişkenlerin sayısal temsillere dönüştürülmesi temel mühendislik adımlarından biridir. One-hot encoding ikili sütunlar üretirken, hedef kodlama (target encoding) kategorileri hedef değişkenin ortalamasıyla temsil eder. Yüksek kardinaliteli sütunlarda embedding tabanlı yaklaşımlar bilgiyi daha kompakt biçimde saklar. Sayısal özellikler için normalizasyon (min-max ölçekleme) ve standardizasyon (z-skoru dönüşümü) kritik ön işleme adımlarıdır. Mesafe tabanlı algoritmalar (k-NN, SVM) bu ölçeklemeye duyarlıdır; ölçekleme yapılmadan büyük değer aralıklı özellikler küçük aralıklıları gölgede bırakır. Zaman serisi verisinde gecikme özellikleri (lag features), hareketli ortalama ve mevsimsel bileşenler gibi mühendislik dönüşümleri modellerin zamansal örüntüleri kavramasını sağlar. Metin verisinde TF-IDF ve n-gram özellikleri, görüntü verisinde ise histogram eşitleme ve kenar çıkarımı klasik özellik mühendisliği adımlarıdır. Derin öğrenme bu adımların bir kısmını otomasyona taşımış olsa da yapısal ve tablolu veri içeren birçok endüstriyel görevde manuel özellik mühendisliği, model performansını belirleyici biçimde etkileyen kritik ayrımcı etken olmayı sürdürmektedir. Kaggle gibi rekabetçi veri bilimi platformlarında üst sıralardaki çözümlerin ortak özelliği, algoritma seçiminden çok üretken ve yenilikçi özellik mühendisliği stratejisine dayanmalarıdır. Featuretools gibi otomatik mühendislik kütüphaneleri süreci hızlandırırken, alan uzmanlığı en değerli özellik kaynaklarını belirleme konusunda belirleyici rolünü korur.
Data Wrangling (Veri Düzenleme)
Data wrangling (veri düzenleme ya da veri mücadelesi olarak da bilinir), ham ve dağınık veri kümelerini analiz ve makine öğrenimi modellerine uygun biçimde kullanılabilir hale getirmek amacıyla uygulanan temizleme, dönüştürme ve birleştirme sürecini ifade eder. Gerçek dünya verilerinin büyük çoğunluğu eksik değerler, yanlış biçimler, tutarsız kodlamalar ve aykırı gözlemler içerdiğinden bu süreç, başarılı bir veri bilimi projesinin temel taşını oluşturur. Data wrangling süreci tipik olarak birkaç kritik adımı kapsar. İlk adımda veriler farklı kaynaklardan (CSV dosyaları, API yanıtları, veritabanı sorguları, web scraping çıktıları) bir araya getirilir. Keşif aşamasında verinin genel yapısı, sütun türleri ve özet istatistikler incelenir; sorunlu alanlar tespit edilir. Temizleme adımında eksik değerler imputation yöntemleriyle doldurulur ya da ilgili satırlar çıkarılır, yinelenen kayıtlar kaldırılır, hatalı biçimler düzeltilir ve uç değerler ayıklanır. Dönüştürme aşamasında tarih-saat formatları standartlaştırılır, kategorik değişkenler one-hot encoding veya label encoding ile sayısallaştırılır ve sayısal sütunlar normalizasyon ya da standardizasyon ile ölçeklenir. Son olarak birden fazla tablo ya da kaynak JOIN/merge işlemleriyle birleştirilerek nihai analiz veri kümesi oluşturulur. Araştırmalar, veri bilimcilerin zamanının yaklaşık yüzde altmış ile seksen arasını modelleme ve görselleştirme yerine veri hazırlama adımlarına harcadığını ortaya koymaktadır. Python ekosisteminde Pandas ve Polars en yaygın kullanılan kütüphanelerdir. Büyük ölçekli projelerde Apache Spark veya dbt gibi araçlar tercih edilirken düşük kod araçları (OpenRefine, Alteryx, Trifacta) teknik geçmişi olmayan kullanıcılara da wrangling imkânı sunar. Makine öğrenimi bağlamında data wrangling, özellik mühendisliği (feature engineering) ile birlikte anılır; ancak ikisi farklı kavramlardır: wrangling ham veriyi temizleyip yapılandırır, feature engineering ise bu temiz veriden yeni anlamlı öznitelikler türetir. Temiz ve iyi yapılandırılmış veri olmadan hiçbir model istenen performansa ulaşamaz; bu nedenle data wrangling hem pratikte hem teoride yapay zeka projelerinin en kritik adımlarından biri olarak kabul edilir.
Data Labeling (Veri Etiketleme)
Veri etiketleme, ham veri örneklerine anlamlı etiket veya meta veri atamanın sürecidir. Makine öğrenimi modelleri yalnızca gördüğü örneklerden öğrenebilir; bu örneklerin hangi sınıfa, nesneye veya kavrama ait olduğunu belirtmek için etiketleme yapılır. Denetimli öğrenme paradigmasında etiketleme, modelin öğrenebileceği altın standardı (ground truth) tanımlar. Etiketleme yöntemleri üç ana grupta incelenir. Manuel etiketleme, insan uzmanlar veya kalabalık kaynak platformları (Amazon Mechanical Turk, Scale AI, Appen) tarafından gerçekleştirilir; yüksek doğruluk sağlar ancak maliyetli ve yavaştır. Yarı otomatik etiketlemede bir makine öğrenimi modeli ön tahmin üretir ve insan uzmanlar yalnızca belirsiz örnekleri düzeltir; maliyet ile hız arasında pratik bir denge sağlar. Otomatik etiketleme (weak supervision) ise kural tabanlı sistemler veya düşük maliyetli modellerin büyük veri kümelerini hızla etiketlemesine dayanır; Snorkel gibi çerçeveler bu yaklaşımı sistematize eder. Etiket kalitesi model performansını doğrudan etkiler. Gürültülü veya tutarsız etiketler, iyi tasarlanmış bir modelin başarısını dahi düşürebilir. Kaliteyi ölçmek için etiketçi anlaşma oranı (inter-annotator agreement) Cohen's Kappa katsayısıyla hesaplanır; düşük kappa değerleri yeniden etiketleme sürecini tetikler. Çift-kör etiketleme ve etiketçi kalibrasyonu en yaygın kalite güvence yöntemlerindendir. Büyük dil modellerinin yaygınlaşmasıyla etiketleme paradigması dönüşüm geçirmektedir. RLHF sürecinde insan değerlendiriciler modelin iki farklı yanıtından daha iyisini seçerek tercih verisi oluşturur. Bu etiket türü modelin yardımcılık ve zararsızlık yetkinliklerini şekillendirir. RLAIF yaklaşımında ise insan yerine gelişmiş bir model etiketleme görevini üstlenerek ölçeklenebilirliği artırır. Aktif öğrenme, sınırlı etiketleme bütçesiyle maksimum bilgi kazanmayı hedefler. Model, tahmininde en belirsiz olduğu örnekleri insanlara göndererek az etiketlenmiş veriyle yüksek performansa ulaşabilir. Bu yöntem özellikle tıbbi görüntüleme ve hukuki belge sınıflandırma gibi uzman emek gerektiren alanlarda kritik bir tasarruf aracıdır. Etiketleme sürecinde sık karşılaşılan sorunlar şunlardır: etiketçi önyargısı, sınıf tanım belirsizliği, ölçeklenebilirlik güçlükleri ve sınıf dengesizliği. Veri artırma teknikleri ve SMOTE, az örnekli sınıflar için sentetik etiketli veri üretiminde kullanılır.