tag Dataset
Data Augmentation (Veri Artırma / Çoğaltma)
Bu sayfada Dataset (Data Augmentation (Veri Artırma / Çoğaltma)) etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.
Veri artırma (data augmentation), makine öğrenmesi modellerini eğitirken mevcut veri setini yapay yöntemlerle genişletme tekniğidir. Özellikle etiketli veri toplamak pahalı veya zaman alıcı olduğunda eldeki örneklerden türetilen yeni varyantlar modelin genelleme kapasitesini önemli ölçüde artırır. Teknik; bilgisayarla görü, doğal dil işleme ve ses tanıma gibi pek çok alanda standart bir uygulama haline gelmiş ve modern derin öğrenme boru hatlarının vazgeçilmez bir temel bileşeni olmuştur. Görüntü verisinde yatay çevirme, döndürme, rastgele kırpma ve renk jitter gibi geometrik ve fotometrik dönüşümler yaygın olarak kullanılır. Daha gelişmiş yaklaşımlar arasında GridDistortion, ElasticTransform ve RandomErasing yer alır. Bu teknikler modelin nesnenin konumundan veya ışık koşullarından bağımsız özellikler öğrenmesini destekler. Metin verisinde geri çeviri en güçlü yöntemlerden biridir: bir cümle önce farklı bir dile çevrilir ardından kaynak dile döndürülür; anlam korunurken ifade tarzı değişir. Eş anlamlı kelime değiştirme ve cümle yeniden çerçeveleme de yaygın kullanılır. Ses verisi için zaman uzatma ve perde kaydırma konuşma tanıma ve müzik sınıflandırma modellerinin akustik dayanıklılığını artırır. Mixup iki eğitim örneğini ve etiketini doğrusal olarak harmanlayarak modelin daha yumuşak karar sınırları öğrenmesini destekler. CutMix bir görüntünün dikdörtgen bölgesini başka bir görüntünün bölgesiyle değiştirir; etiket de alan oranıyla orantılı güncellenir. AutoAugment ve RandAugment hangi dönüşümlerin hangi yoğunlukta uygulanacağını otomatik belirler ve göreve özgü artırma politikası öğrenir. Üretken modeller (GAN, diffusion) gerçekçi sentetik örnekler üreterek veri artırmanın kapasitesini daha da genişletir. Doğru yapılandırılmış veri artırma modelin aşırı öğrenmesini engelleyen kritik bir bileşendir. Test seti artırma işlemine tabi tutulmamalı; orijinal haliyle korunarak tarafsız değerlendirme zemini oluşturulmalı ve uygulamacılar doğrulama kaybını izleyerek artırma yoğunluğunu optimize etmelidir.
Data Augmentation (Veri Artırma / Çoğaltma)
Veri artırma (data augmentation), makine öğrenmesi modellerini eğitirken mevcut veri setini yapay yöntemlerle genişletme tekniğidir. Özellikle etiketli veri toplamak pahalı veya zaman alıcı olduğunda eldeki örneklerden türetilen yeni varyantlar modelin genelleme kapasitesini önemli ölçüde artırır. Teknik; bilgisayarla görü, doğal dil işleme ve ses tanıma gibi pek çok alanda standart bir uygulama haline gelmiş ve modern derin öğrenme boru hatlarının vazgeçilmez bir temel bileşeni olmuştur. Görüntü verisinde yatay çevirme, döndürme, rastgele kırpma ve renk jitter gibi geometrik ve fotometrik dönüşümler yaygın olarak kullanılır. Daha gelişmiş yaklaşımlar arasında GridDistortion, ElasticTransform ve RandomErasing yer alır. Bu teknikler modelin nesnenin konumundan veya ışık koşullarından bağımsız özellikler öğrenmesini destekler. Metin verisinde geri çeviri en güçlü yöntemlerden biridir: bir cümle önce farklı bir dile çevrilir ardından kaynak dile döndürülür; anlam korunurken ifade tarzı değişir. Eş anlamlı kelime değiştirme ve cümle yeniden çerçeveleme de yaygın kullanılır. Ses verisi için zaman uzatma ve perde kaydırma konuşma tanıma ve müzik sınıflandırma modellerinin akustik dayanıklılığını artırır. Mixup iki eğitim örneğini ve etiketini doğrusal olarak harmanlayarak modelin daha yumuşak karar sınırları öğrenmesini destekler. CutMix bir görüntünün dikdörtgen bölgesini başka bir görüntünün bölgesiyle değiştirir; etiket de alan oranıyla orantılı güncellenir. AutoAugment ve RandAugment hangi dönüşümlerin hangi yoğunlukta uygulanacağını otomatik belirler ve göreve özgü artırma politikası öğrenir. Üretken modeller (GAN, diffusion) gerçekçi sentetik örnekler üreterek veri artırmanın kapasitesini daha da genişletir. Doğru yapılandırılmış veri artırma modelin aşırı öğrenmesini engelleyen kritik bir bileşendir. Test seti artırma işlemine tabi tutulmamalı; orijinal haliyle korunarak tarafsız değerlendirme zemini oluşturulmalı ve uygulamacılar doğrulama kaybını izleyerek artırma yoğunluğunu optimize etmelidir.
Synthetic Data (Sentetik Veri)
Sentetik veri (synthetic data), gerçek dünya olaylarını gözlemleyerek değil, algoritmalar, istatistiksel modeller veya üretken yapay zeka aracılığıyla yapay olarak üretilen veridir. Gerçek verinin sahip olduğu gizlilik risklerini taşımaksızın makine öğrenmesi modellerini eğitmek, test etmek ve doğrulamak için kullanılır. Sentetik veri üretiminin temel yöntemleri arasında istatistiksel simülasyon, kural tabanlı üretim ve üretken modeller yer alır. GAN (Generative Adversarial Network) tabanlı yaklaşımlar, ayırt edici bir ağın denetiminde üretici ağ gerçekçi sentetik örnekler oluştururken özellikle görüntü verisi üretiminde yüksek kaliteye ulaşmaktadır. Difüzyon modelleri ise gürültüden aşamalı geri dönüşümle yüksek çeşitlilikte sentetik örnekler üretir; bu yöntem 2023 sonrasında görüntü ve metin alanında GAN'ın yerini almaya başlamıştır. Tablolar ve yapılandırılmış veri için CTGAN (Conditional Tabular GAN) ve SDV (Synthetic Data Vault) kütüphaneleri geniş çapta kullanılmaktadır. Bu araçlar, orijinal verinin sütunlar arası korelasyonlarını, kategorik değer dağılımlarını ve istatistiksel özelliklerini öğrenerek yeni satırlar üretir; böylece gerçeğe yakın ama gerçek olmayan kayıtlar oluşturulur. Sentetik verinin en kritik kullanım alanı gizlilik korumasıdır. Tıbbi kayıtlar veya finansal işlemler gibi hassas veri içeren yapay zeka projelerinde GDPR ve HIPAA gibi düzenlemeler gerçek veri paylaşımını kısıtlar; sentetik veri bu kısıtları aşarken modelin öğreneceği temsili örnekler sunar. Az temsil edilen sınıfları dengelemek için de kullanılır. Dengesiz veri setlerinde nadir sınıf örnekleri sentetik yollarla çoğaltılarak model bu sınıfları daha iyi öğrenir. Otonom araç, robotik ve oyun yapay zekası gibi alanlarda gerçek dünya verisi toplamak tehlikeli veya pahalı olduğunda simülasyon ortamlarından üretilen sentetik veri birincil eğitim kaynağı olarak kullanılır. Microsoft'un Phi serisi ve Meta'nın bazı küçük modelleri, büyük ölçüde sentetik veriyle eğitilerek gerçek veriye olan bağımlılığı azaltmanın mümkün olduğunu kanıtlamıştır.
Web Scraping (Veri Kazıma (Web Kazıma))
Web kazıma (web scraping), bir web sitesinin HTML içeriğini programatik olarak indirip anlamlı verileri çıkarma sürecidir. Manuel kopyala-yapıştırmanın aksine, web kazıma belirli bir hedef yapıya sahip veriler için — fiyat takibi, araştırma verisi toplama, pazar analizi — büyük ölçekte otomasyon imkânı tanır. Temel web kazıma süreci üç adımdan oluşur: istek gönderme (HTTP GET/POST), HTML ayrıştırma (parsing) ve veri çıkarma. Python'da Requests kütüphanesi HTTP isteklerini yönetirken BeautifulSoup veya lxml, CSS seçiciler ve XPath ifadeleriyle istenen elemanları ayıklar. Scrapy ise asenkron mimarisiyle binlerce sayfayı verimli biçimde gezebilen tam donanımlı bir web kazıma çerçevesidir. Dinamik web siteleri, JavaScript ile içeriklerini tarayıcıda oluşturduğundan geleneksel HTTP tabanlı kazıma yetersiz kalır. Bu durumda Playwright veya Selenium gibi tarayıcı otomasyon araçları, gerçek bir tarayıcı ortamında sayfayı render ederek dinamik içeriğe erişimi mümkün kılar. Playwright, Chrome, Firefox ve WebKit desteği ile asenkron mimarisiyle modern kazıma projelerinde tercih edilen araç hâline gelmiştir. Web kazımada etik ve hukuki boyutlar büyük önem taşır. robots.txt dosyası, site sahiplerinin hangi yolların kazınmasını istemediğini belirtir; bu dosyaya uymak etik bir zorunluluktur. Hizmet şartları (Terms of Service), bazı siteler için kazıma işlemini yasal zeminde sınırlandırabilir. Kişisel veri içeren içerik GDPR ve KVKK kapsamında ek duyarlılık gerektirir. Sunuculara aşırı istek göndermek hedef siteyi yavaşlatabilir veya yasal sorumluluk doğurabilir; bu nedenle istekler arasında makul gecikmeler bırakmak standart uygulamadır. Anti-kazıma teknolojileri de gelişmiştir: CAPTCHA, IP engelleme, istek parmak izi analizi ve JavaScript zorunluluğu bunlar arasındadır. Bu engelleri aşmak için proxy rotasyonu, kullanıcı-ajanı (user-agent) değiştirme ve ScrapingBee, Apify, Bright Data gibi yönetimli web kazıma API hizmetleri yaygın biçimde kullanılmaktadır. Büyük ölçekli projelerde veri depolama, temizleme ve doğrulama süreçleri de kazıma pipeline'ının ayrılmaz parçalarıdır.