Variational Autoencoder (VAE) (Varyasyonel Oto-Kodlayıcı)

Gizli uzayda olasiliksal dagilim ogrenerek yeni veri ornekleri uretebilen uretken derin ogrenme modeli.

Variasyonel Otokodlayıcı (VAE — Variational Autoencoder), gizli uzayda (latent space) olasılıksal bir dağılım öğrenerek yeni veri örnekleri üretebilen üretken derin öğrenme modelidir. 2013 yılında Kingma ve Welling tarafından önerilen VAE, otokoderın gizli uzay temsilini deterministik bir noktadan ibaret olmak yerine olasılıksal bir dağılım (çoğunlukla Gaussian) olarak modellemektedir. VAE mimarisinin iki ana bileşeni vardır: kodlayıcı (encoder) ve kod çözücü (decoder). Encoder, girdi verisini gizli uzaydaki bir ortalama (mean) ve varyans vektörü olarak kodlar; gerçek gizli vektör bu Gaussian dağılımından örneklenir. Decoder, bu gizli vektörü orijinal veri uzayına geri dönüştürmeye çalışır. Eğitim sırasında iki kayıp terimi vardır: yeniden yapım kaybı (reconstruction loss — girdinin çıktıya ne kadar benzediği) ve KL sapma kaybı (KL divergence — gizli dağılımın standart normale ne kadar yakın olduğu). Bu iki terimin toplamı ELBO (Evidence Lower BOund) adını alır ve VAE'nin maksimize etmeye çalıştığı hedeftir. Reparametrizasyon hilesi (reparameterization trick) eğitimi mümkün kılan kritik adımdır: örnekleme operasyonu türevlenebilir değildir, bu nedenle z = mu + sigma * epsilon formülüyle epsilon ~ N(0,1) sabit rastgelelikten gelir. Böylece gradyan mu ve sigma üzerinden akar ve model geri yayılım ile eğitilir. GAN'larla (Generative Adversarial Network) karşılaştırıldığında VAE'nin eğitimi daha kararlıdır; ancak üretilen örnekler çoğu zaman daha bulanık görünür. GAN'lar çok daha keskin görseller üretse de eğitim kararsızlığı ve mod çöküşü (mode collapse) sorunlarıyla mücadele eder. Diffusion modelleri ise her iki yaklaşımın dezavantajlarını büyük ölçüde aşarak görsel kalitede yeni bir standart belirlemiştir. VAE'nin gizli uzayının düzgün ve yapılandırılmış (smooth, structured latent space) olması onu yorumlanabilir temsil öğrenmesi (disentangled representation learning) için çekici kılar. beta-VAE KL ağırlığını artırarak her gizli boyutun farklı anlam taşımasını hedefler. VQ-VAE gizli uzayı süreksiz (discrete) yapar; bu özellik DALL-E 1 ve dil modeli tabanlı görsel kodlama sistemleri için önem taşır. Uygulama alanları; görüntü üretimi, anomali tespiti, eksik veri doldurma, yüz sentezi ve ilaç keşfinde molekül uzayında anlamlı interpolasyonu kapsar.

Standart Otokodlayıcı ile Fark

Klasik otokoder, girdiyi deterministik bir nokta olarak gizli uzaya kodlar. VAE ise gizli nokta yerine bir dağılım parametresi (ortalama ve varyans) kodlar; gerçek gizli vektör bu dağılımdan örneklenir. Bu stokastik yaklaşım gizli uzayı düzgün ve aranabilir hale getirir: iki noktanın interpolasyonu anlamlı görseller üretebilir.

Reparametrizasyon Hilesi

Örnekleme operasyonu türevlenebilir değildir; bu nedenle gradyan türevi geri yayılamazdı. Reparametrizasyon hilesi (reparameterization trick) bu sorunu çözer: z = mu + sigma * epsilon şeklinde, epsilon ~ N(0,1) sabit rastgelelikten gelir. Böylece gradyan mu ve sigma üzerinden akar; model eğitimi geri yayılım ile gerçekleşmiş olur. Bu yöntem VAE'nin eğitim algoritmik temelini oluşturur.

Uygulama Alanları

Görüntü üretiminde VAE, latent vektörlerin interpolasyonuyla bir yüzden diğerine yumuşak geçiş sağlayabilir. Anomali tespitinde normal veri üzerinde eğitilen VAE, anomalileri yüksek yeniden yapım hatası ile belirler. Eksik veri doldurma (imputation) için gizli uzay tahmini kullanılabilir. İlaç keşfi alanında molekül uzayında anlamlı interpolasyon ve yeni molekül üretimi VAE ile yapılmaktadır.

VQ-VAE ve Uzantılar

beta-VAE, KL sapma kaybının ağırlığını artırarak daha ayrışık gizli değişkenlere ulaşır; her gizli boyut farklı anlam taşır. CVAE (Conditional VAE), üretimi sınıf etiketi veya diğer koşullanma bilgisiyle yönlendirir. VQ-VAE (Vector Quantized VAE), gizli uzayı süreksiz (discrete) yapar; bu özellik DALL-E 1 ve dil modeli tabanlı görsel kodlama sistemleri için önemlidir.

🔄 Varyasyonel Otokodlayıcı Uygulama Alanları

  • check_circle Görüntü üretimi: gizil uzayı örnekleyerek gerçekçi ama daha önce görülmemiş görüntüler sentezleme
  • check_circle Veri artırma: eğitim örneklerinin gizil temsilleri interpolasyon yaparak yeni varyantlar üretme
  • check_circle Anomali tespiti: yeniden yapılandırma hatası yüksek örnekler normal dağılımdan saptı işareti
  • check_circle Latent space interpolasyon: iki varlık arasında yumuşak geçiş; yüz yaşlandırma ve stil karıştırma
  • check_circle Latent Diffusion: VAE gizil uzayında difüzyon modeli çalıştırarak hesaplama verimliliği artırılır

Sıkça Sorulan Sorular

  • check_circle VAE mi GAN mi kullanmalıyım? Eğitim kararlılığı ve yorumlanabilirlik için VAE; görsel kalitenin ön planda olduğu uygulamalar için GAN veya Diffusion Model tercih edilir.
  • check_circle ELBO nedir? Evidence Lower BOund: VAE'nin maksimize etmeye çalıştığı ölçüt. Yeniden yapım doğruluğu ile gizli düzenlilik (KL) arasında denge kurar.
  • check_circle VAE'nin gizli boyutu nasıl belirlenir? Veri karmaşıklığına göre deneysel seçim gerekir; 2-32 boyut görüntü gibi basit veriler için, yüzlerce boyut karmaşık veri için kullanılabilir.
  • check_circle VAE ile Diffusion Model farkı nedir? Diffusion Model gizli uzay yerine doğrudan piksel uzayında bozuma-geri yürütme süreciyle çok daha yüksek kaliteli görüntü üretir; ancak çok daha ağır hesaplama gerektirir.