Synthetic Data (Sentetik Veri)

Gerçek gözlemler yerine algoritmalar veya üretken modeller aracılığıyla üretilen yapay veri; gizlilik koruması, veri dengeleme ve simülasyon eğitimi için kullanılır.

Sentetik veri (synthetic data), gerçek dünya olaylarını gözlemleyerek değil, algoritmalar, istatistiksel modeller veya üretken yapay zeka aracılığıyla yapay olarak üretilen veridir. Gerçek verinin sahip olduğu gizlilik risklerini taşımaksızın makine öğrenmesi modellerini eğitmek, test etmek ve doğrulamak için kullanılır. Sentetik veri üretiminin temel yöntemleri arasında istatistiksel simülasyon, kural tabanlı üretim ve üretken modeller yer alır. GAN (Generative Adversarial Network) tabanlı yaklaşımlar, ayırt edici bir ağın denetiminde üretici ağ gerçekçi sentetik örnekler oluştururken özellikle görüntü verisi üretiminde yüksek kaliteye ulaşmaktadır. Difüzyon modelleri ise gürültüden aşamalı geri dönüşümle yüksek çeşitlilikte sentetik örnekler üretir; bu yöntem 2023 sonrasında görüntü ve metin alanında GAN'ın yerini almaya başlamıştır. Tablolar ve yapılandırılmış veri için CTGAN (Conditional Tabular GAN) ve SDV (Synthetic Data Vault) kütüphaneleri geniş çapta kullanılmaktadır. Bu araçlar, orijinal verinin sütunlar arası korelasyonlarını, kategorik değer dağılımlarını ve istatistiksel özelliklerini öğrenerek yeni satırlar üretir; böylece gerçeğe yakın ama gerçek olmayan kayıtlar oluşturulur. Sentetik verinin en kritik kullanım alanı gizlilik korumasıdır. Tıbbi kayıtlar veya finansal işlemler gibi hassas veri içeren yapay zeka projelerinde GDPR ve HIPAA gibi düzenlemeler gerçek veri paylaşımını kısıtlar; sentetik veri bu kısıtları aşarken modelin öğreneceği temsili örnekler sunar. Az temsil edilen sınıfları dengelemek için de kullanılır. Dengesiz veri setlerinde nadir sınıf örnekleri sentetik yollarla çoğaltılarak model bu sınıfları daha iyi öğrenir. Otonom araç, robotik ve oyun yapay zekası gibi alanlarda gerçek dünya verisi toplamak tehlikeli veya pahalı olduğunda simülasyon ortamlarından üretilen sentetik veri birincil eğitim kaynağı olarak kullanılır. Microsoft'un Phi serisi ve Meta'nın bazı küçük modelleri, büyük ölçüde sentetik veriyle eğitilerek gerçek veriye olan bağımlılığı azaltmanın mümkün olduğunu kanıtlamıştır.

Neden Sentetik Veriye İhtiyaç Var?

Gerçek veri toplamak zaman alıcı, pahalı ve çoğu zaman yasal kısıtlamalarla sınırlıdır. Bir banka müşteri işlem verisini üçüncü taraflarla paylaşamaz; bir hastane görüntüleme kayıtlarını model eğitimi için açık erişime sunamaz. Sentetik veri bu sorunu çözer: orijinal verinin istatistiksel özelliklerini taşıyan ama gerçek bireylere ait olmayan örnekler üretilir. Bu yöntemle modeller hassas veri gerektirmeksizin gerçekçi koşullarda eğitilir.

GAN ile Gerçekçi Veri Üretimi

Generative Adversarial Network mimarisi, üretici ve ayırt edici olmak üzere iki ağı birbirine karşı eğitir. Üretici gerçekçi görünen veri üretmeye çalışırken, ayırt edici gerçek ile sentetik arasında ayrım yapmayı öğrenir. Bu rekabetçi süreç giderek daha gerçekçi sentetik örnekler üretir. Yüz görüntüleri, tıbbi taramalar ve belge görselleri için GAN tabanlı üretim son yıllarda olgunlaştı.

Tablo Verisi için CTGAN ve SDV

Yapılandırılmış tablo verisi görüntüden farklı zorluklara sahiptir: kategorik değişkenler, korelasyonlar ve eksik değer örüntüleri öğrenilmesi gereken yapılardır. CTGAN bu veri tipi için özel olarak tasarlanmış koşullu bir GAN yaklaşımıdır. SDV kütüphanesi ise tek tablo, ilişkisel veri tabanı ve zaman serisi için farklı sentetik veri modelleri sunar. Gretel AI ve Mostly AI gibi ticari platformlar bu araçları yönetimli bir servis olarak sunar.

Simülasyon Ortamları ve Robotik

Otonom araç, insansız hava aracı ve robotik sistemlerde gerçek dünya deneyimi hem tehlikeli hem de ölçeklenmesi güçtür. NVIDIA Isaac Sim, Gazebo ve Unity gibi simülasyon ortamları fizik tabanlı sentetik veri üretir: farklı ışık koşulları, hava durumu, nesne konumları ve sensör gürültüsü kontrollü biçimde değiştirilerek geniş eğitim varyasyonu elde edilir. Bu yaklaşım sim-to-real transfer öğrenmesiyle gerçek donanıma aktarılır.

Sentetik Veri Üretim Yöntemleri

GAN Tabanlı Üretim

Üretici ağ gerçekçi veri örnekleri üretir; görüntü ve tablo veri artırma için yaygın.

LLM ile Metin Üretimi

GPT-4 gibi modeller az örnekten çok sayıda çeşitli eğitim örneği üretir; NLP görevleri için.

Fizik Simülasyonu

Otonom araç ve robot eğitiminde gerçekçi sahne simülasyonları gerçek veri toplamayı ikame eder.

Diferansiyel Gizli Sentez

Gizlilik garantili sentetik tablo verisi; gerçek dağılımı korurken kişisel veriyi gizler.

Sıkça Sorulan Sorular

  • check_circle Sentetik veri gerçek verinin yerini tamamen alabilir mi? Genellikle kısmen alabilir. Sentetik veri, gerçek verinin istatistiksel özelliklerini taklit eder; ancak nadir olayları ve dağılım kenarlarını kaçırabilir. En iyi yaklaşım gerçek ve sentetik veriyi birleştirmektir.
  • check_circle Sentetik veri GDPR uyumlu mudur? Sentetik veri, bireysel kayıtlara geri izlenebilir bilgi içermediğinde kişisel veri sayılmaz ve GDPR kısıtlamalarına tabi olmaz. Ancak yeniden tanımlama riskini değerlendirmek için sızdırmazlık testleri yapılmalıdır.
  • check_circle Sentetik veri kalitesi nasıl değerlendirilir? Fidelity (gerçek ile sentetik arasındaki istatistiksel benzerlik), utility (sentetik veriyle eğitilen modelin gerçek veriyle test performansı) ve privacy (bireysel kayıtlara saldırı direnci) üç temel değerlendirme boyutudur.
  • check_circle Dil modelleri için sentetik veri kullanılabilir mi? Evet ve giderek yaygınlaşıyor. GPT-4 gibi modellerle üretilen sentetik talimat verisi, daha küçük modellerin ince ayarında kullanılıyor. Microsoft'un Phi serisi büyük ölçüde sentetik veriyle eğitildi.