DDPM (Gürültü Giderme Difüzyon Olasılık Modeli)

DDPM, kademeli gürültü ekleme ve çıkarmayı öğrenerek gerçekçi veri üreten, modern difüzyon modellerinin temel taşı olan üretici modeldir.

DDPM (Denoising Diffusion Probabilistic Models), Jonathan Ho ve arkadaşları tarafından 2020 yılında yayımlanan, modern difüzyon modellerinin temelini atan çığır açıcı bir üretici yapay zeka modelidir. "Denoising Diffusion Probabilistic Models" (NeurIPS 2020) makalesiyle tanıtılan DDPM, GAN ile kıyaslanabilir görüntü kalitesi sunarken çok daha kararlı bir eğitim sürecine sahip olduğunu kanıtlamıştır. DDPM iki süreçten oluşur. İleri süreçte (forward process, q) temiz veri x₀'a kademeli olarak T adım boyunca Gaussian gürültü eklenir. Her adımda gürültü miktarı, β_t olarak adlandırılan küçük sabit bir değerle kontrol edilir. T adım sonunda (genellikle T=1.000) veri tamamen bir Gaussian dağılımına (saf gürültüye) dönüşür. Ters süreçte (reverse process, p_θ) model, gürültülü bir örnekten başlayarak gerçek veri dağılımını adım adım kurtarmayı öğrenir. Her adımda bir sinir ağı (genellikle U-Net), o adımdaki gürültüyü tahmin eder. Kayıp fonksiyonu sadeleştirilerek "gürültüyü tahmin etmek"e (epsilon prediction) indirgenir. DDPM, sonraki tüm büyük gelişmelerin (DDIM, LDM, Stable Diffusion, DALL-E 2/3) çıkış noktası olmuştur.

functions DDPM Matematiği (Sezgisel)

İleri süreçte, temiz görüntü x₀'a her adımda az miktarda Gaussian gürültü eklenir. Bu süreç Markov zinciridir: q(x_t | x_{t-1}) = N(x_t; √(1-β_t)·x_{t-1}, β_t·I). β_t değerleri genellikle lineer veya kosinüs eğrimiyle artar (0.0001 → 0.02). T adım sonunda x_T ≈ N(0, I), yani saf gürültü. Ters süreçte model, gürültülü görüntü x_t ve adım t verildiğinde, o adımda eklenen ε gürültüsünü tahmin eder. Eğitim kaybı: L = E[||ε - ε_θ(x_t, t)||²]. Çıkarım sırasında x_T ~ N(0,I)'den başlanır ve model adım adım gürültüyü çıkararak x₀'ı kurtarır. Zaman adımı t, U-Net'e sinüs pozisyonel gömme (sinusoidal embedding) olarak koşullandırma sinyali verilir.

DDPM'den Sonraki Gelişmeler

fast_forward DDIM (2020)

Song ve ark. Belirleyici (deterministic) örnekleme ile 50 adımda DDPM kalitesini yakalar. Latent uzayda interpolasyon ve inversion mümkün olur.

rule Classifier Guidance (2021)

Dhariwal ve ark. Sınıflandırıcı gradyanını ters sürece ekleyerek koşullu üretimi güçlendirir; FID skorlarını GAN seviyesine taşır.

tune Classifier-Free Guidance (2022)

Ho ve Salimans. Ayrı sınıflandırıcı olmadan metin/sınıf koşullandırması. Tüm modern Stable Diffusion sistemlerinin kullandığı yöntem.

compress LDM / Stable Diffusion (2022)

DDPM'i latent uzaya taşıyarak hesaplama maliyetini ~48 kat azaltır; ev kullanıcısı için erişilebilir kılar.

quiz Sıkça Sorulan Sorular

  • check_circle DDPM neden 1.000 adım kullanıyor?: Daha fazla adım, ileri süreçteki gürültüyü daha kademeli ve matematiksel olarak daha temiz tanımlar. 1.000 adım, kalite ve hesaplama maliyeti arasında iyi bir denge sağlar. Daha az adım (örn. 100) kaliteyi düşürür; DDIM gibi hızlandırıcılar bu problemi aşmak için geliştirilmiştir.
  • check_circle DDPM ile GAN arasındaki temel fark nedir?: GAN iki ayrı ağ (generator + discriminator) kullanır ve eğitimi sıklıkla dengesizleşir. DDPM tek bir ağ eğitir (U-Net) ve kayıp fonksiyonu basit MSE'dir — çok daha kararlı. DDPM daha yüksek çeşitlilik sunarken GAN genellikle daha hızlı çıkarım sağlar.
  • check_circle DDPM orijinal kağıt hangi veritabanında test edildi?: CIFAR-10, CelebA-HQ, LSUN-Bedrooms ve LSUN-Church veri setlerinde test edildi. CIFAR-10'da FID 3.17 ile o dönemin en iyi GAN modellerini geçti — bu difüzyon modellerinin ciddi bir seçenek olduğunu kanıtladı.
  • check_circle DDPM video ve ses üretiminde kullanılır mı?: Evet. Video Diffusion Models (Ho ve ark. 2022) DDPM'yi uzamsal+zamansal 3B U-Net ile genişletir. AudioDiffusion, mel-spektrogram üzerinde DDPM uygular. Molecule diffusion ise protein ve ilaç tasarımı için difüzyonu atomik koordinatlara uygular.