Data Augmentation (Veri Artırma / Çoğaltma)

Mevcut eğitim verilerinden dönüşümler ve sentetik yöntemlerle yeni örnekler üreterek model genellemesini güçlendirme tekniği.

Veri artırma (data augmentation), makine öğrenmesi modellerini eğitirken mevcut veri setini yapay yöntemlerle genişletme tekniğidir. Özellikle etiketli veri toplamak pahalı veya zaman alıcı olduğunda eldeki örneklerden türetilen yeni varyantlar modelin genelleme kapasitesini önemli ölçüde artırır. Teknik; bilgisayarla görü, doğal dil işleme ve ses tanıma gibi pek çok alanda standart bir uygulama haline gelmiş ve modern derin öğrenme boru hatlarının vazgeçilmez bir temel bileşeni olmuştur. Görüntü verisinde yatay çevirme, döndürme, rastgele kırpma ve renk jitter gibi geometrik ve fotometrik dönüşümler yaygın olarak kullanılır. Daha gelişmiş yaklaşımlar arasında GridDistortion, ElasticTransform ve RandomErasing yer alır. Bu teknikler modelin nesnenin konumundan veya ışık koşullarından bağımsız özellikler öğrenmesini destekler. Metin verisinde geri çeviri en güçlü yöntemlerden biridir: bir cümle önce farklı bir dile çevrilir ardından kaynak dile döndürülür; anlam korunurken ifade tarzı değişir. Eş anlamlı kelime değiştirme ve cümle yeniden çerçeveleme de yaygın kullanılır. Ses verisi için zaman uzatma ve perde kaydırma konuşma tanıma ve müzik sınıflandırma modellerinin akustik dayanıklılığını artırır. Mixup iki eğitim örneğini ve etiketini doğrusal olarak harmanlayarak modelin daha yumuşak karar sınırları öğrenmesini destekler. CutMix bir görüntünün dikdörtgen bölgesini başka bir görüntünün bölgesiyle değiştirir; etiket de alan oranıyla orantılı güncellenir. AutoAugment ve RandAugment hangi dönüşümlerin hangi yoğunlukta uygulanacağını otomatik belirler ve göreve özgü artırma politikası öğrenir. Üretken modeller (GAN, diffusion) gerçekçi sentetik örnekler üreterek veri artırmanın kapasitesini daha da genişletir. Doğru yapılandırılmış veri artırma modelin aşırı öğrenmesini engelleyen kritik bir bileşendir. Test seti artırma işlemine tabi tutulmamalı; orijinal haliyle korunarak tarafsız değerlendirme zemini oluşturulmalı ve uygulamacılar doğrulama kaybını izleyerek artırma yoğunluğunu optimize etmelidir.

Neden Veri Artırma Gereklidir?

Derin öğrenme modelleri, yüksek performans için büyük miktarda etiketli veriye ihtiyaç duyar. Tıbbi görüntüleme, nadir dil kaynakları veya özel endüstriyel uygulamalar gibi alanlarda bu veriyi toplamak hem pahalı hem de zaman alıcıdır. Veri artırma, eldeki veri setinden yapay varyantlar üreterek bu açığı kapatır ve modelin aşırı öğrenmesini (overfitting) engeller; model, gördüğü örnekler yerine altta yatan örüntüleri öğrenir.

Görüntü Artırma Teknikleri

Bilgisayarla görme görevlerinde yatay çevirme, rastgele kırpma, döndürme ve renk jitter gibi temel dönüşümler standarttır. Daha gelişmiş yaklaşımlar arasında GridDistortion, ElasticTransform ve RandomErasing yer alır. Bu teknikler, nesnenin konumu veya ışık koşullarından bağımsız özellikler öğrenmesini destekleyerek modelin farklı çekim açıları ve ortamlarda güvenilir çalışmasını pekiştirir.

Metin ve Ses için Artırma

Doğal dil işlemede geri çeviri en güçlü yöntemlerden biridir: bir cümle önce İngilizce veya Fransızcaya çevrilir, ardından Türkçeye geri döndürülür; anlam korunurken ifade tarzı değişir. Eş anlamlı kelime değiştirme ve yeniden çerçeveleme de sık kullanılır. Ses verilerinde ise zaman uzatma ve perde kaydırma, konuşma tanıma ve müzik sınıflandırma modellerinin dayanıklılığını artırır.

Mixup, CutMix ve Politika Tabanlı Yöntemler

Mixup iki eğitim örneğini ve etiketini doğrusal olarak karıştırır; model daha yumuşak olasılık dağılımları öğrenir. CutMix ise bir görüntünün dikdörtgen bölgesini başka bir görüntünün bölgesiyle değiştirir; etiket de alanla orantılı olarak güncellenir. AutoAugment ve RandAugment, hangi dönüşümlerin hangi sırayla ve yoğunlukla uygulanacağını arama algoritmaları veya rastlantısal örnekleme ile belirler.

İleri Veri Artırma Yöntemleri

Mixup

İki örneği lineer interpolasyonla karıştırır; hem girdi hem etiket karıştırılır, sınır kararı pürüzsüzleştirir ve düzenlileştirme sağlar.

CutMix

Bir görüntüden dikdörtgen bölge keserek diğerine yapıştırır; piksel ve etiket oranı korunur, nesne tespitinde bağlamsal öğrenmeyi güçlendirir.

AugMix

Birden fazla artırma zinciri rastgele oluşturur ve karıştırır; CIFAR-10-C gibi bozunma dayanıklılığı kıyaslamalarında lider.

Sentetik Veri (GenAI)

Stable Diffusion veya GPT ile yapay görüntü/metin üretimi; gerçek dünya etiket maliyeti olmadan uzun kuyruk sınıflarını dengelemek için kullanılır.

Sıkça Sorulan Sorular

  • check_circle Veri artırma her göreve uygun mudur? Çoğu göreve uygun olsa da dönüşümlerin göreve anlamsız gelmemesi gerekir. Tıbbi görüntüde dikey çevirme uygunken, el yazısı tanımada bazen anlam değiştirir.
  • check_circle Ne kadar artırma yeterlidir? Veri seti boyutu, model kapasitesi ve dönüşüm yoğunluğuna bağlıdır. Doğrulama kaybı izlenerek erken durdurma ile optimum nokta belirlenir.
  • check_circle GAN tabanlı artırma ne zaman tercih edilir? Gerçekçi sentetik görüntüler gerektiğinde, örneğin nadir hastalık görüntüleri üretiminde. Ancak GAN eğitimi karmaşık ve kaynak yoğundur.
  • check_circle Veri artırma test setine de uygulanmalı mıdır? Hayır; test seti model performansını tarafsız ölçmek için orijinal haliyle kullanılır. Test zamanı artırması (TTA) ise birden fazla artırılmış versiyonu birleştirerek tahmin güvenilirliğini artırır.