DDPM (Gürültü Giderme Difüzyon Olasılık Modeli)

DDPM, kademeli gürültü ekleme ve çıkarmayı öğrenerek gerçekçi veri üreten, modern difüzyon modellerinin temel taşı olan üretici modeldir.

DDPM (Denoising Diffusion Probabilistic Models), Jonathan Ho ve arkadaşları tarafından 2020 yılında yayımlanan ve NeurIPS 2020'de sunulan, modern difüzyon modellerinin temelini atan çığır açıcı bir üretici yapay zeka modelidir. GAN ile kıyaslanabilir görüntü kalitesi sunarken çok daha kararlı bir eğitim sürecine sahip olduğunu kanıtlamış; böylece üretici modelleme araştırmalarının rotasını kalıcı olarak değiştirmiştir. DDPM'nin çalışma prensibi iki karşıt süreç üzerine kuruludur. İleri süreçte (forward process, q) temiz veri x₀'a T adım boyunca kademeli Gaussian gürültü eklenir; β_t parametresiyle kontrol edilen bu süreç sonunda veri, N(0,I) dağılımına — yani saf gürültüye — dönüşür. T değeri genellikle 1.000 olarak seçilir; lineer ya da kosinüs gürültü çizelgesi kullanılır. Kosinüs çizelgesi, son adımlarda aşırı gürültüden kaynaklanan kalite kayıplarını azaltması nedeniyle tercih edilir. Ters süreçte (reverse process, p_θ) ise eğitilmiş bir sinir ağı, gürültülü örnekten başlayarak gerçek veri dağılımını adım adım kurtarır. Bu aşamada U-Net mimarisi her adımda eklenen gürültüyü (ε) tahmin eder; kayıp fonksiyonu sadeleştirilerek basit bir ortalama kare hata formuna, L = E[||ε - ε_θ(x_t, t)||²] biçimine indirgenir. U-Net, zaman adımını sinüs pozisyonel gömme olarak aldığından aynı ağırlıklar T farklı gürültü seviyesinde çalışabilir. Böylece eğitim süreci kararlı hale gelir ve GAN'larda sık görülen adversarial dengesizlik sorunu tamamen ortadan kalkar. DDPM'in akademik etkisi son derece geniştir. DDIM (Song ve ark., 2020) belirleyici örnekleme ile adım sayısını 50'ye indirdi; LDM ve Stable Diffusion gizli uzay üzerinde çalışarak hesaplama maliyetini yaklaşık 48 kat azalttı. DALL-E 2, Imagen ve günümüzdeki Flux modelleri metin-görüntü eşleştirmeyi mükemmelleştirdi. Video, ses ve protein tasarımı alanlarına uyarlanan mimariler de DDPM'in temel ε-prediction formülasyonunu devralmıştır. Görüntü oluşturmanın ötesinde, DDPM'den türeyen modeller ilaç keşfi, iklim modelleme ve ses sentezinde de giderek yaygınlaşmaktadır.

functions DDPM Matematiği (Sezgisel)

İleri süreçte, temiz görüntü x₀’a her adımda az miktarda Gaussian gürültü eklenir. Bu süreç Markov zinciridir: q(x_t | x_{t-1}) = N(x_t; √(1-β_t)·x_{t-1}, β_t·I). β_t değerleri genellikle lineer veya kosinüs eğrimiyle artar (0.0001 → 0.02). T adım sonunda x_T ≈ N(0, I), yani saf gürültü. Ters süreçte model, gürültülü görüntü x_t ve adım t verildiğinde, o adımda eklenen ε gürültüsünü tahmin eder. Eğitim kaybı: L = E[||ε - ε_θ(x_t, t)||²]. Çıkarım sırasında x_T ~ N(0,I)’den başlanır ve model adım adım gürültüyü çıkararak x₀’ı kurtarır. Zaman adımı t, U-Net’e sinüs pozisyonel gömme (sinusoidal embedding) olarak koşullandırma sinyali verilir.

school Eğitim ve Çıkarım Algoritması

Eğitim döngüsü 4 adımdan oluşur: (1) Veri setinden x₀ örnekle; (2) Rastgele t ∈ {1,…,T} seç ve ε ~ N(0,I) gürültüsü üret; (3) x_t = √ᾱ_t · x₀ + √(1-ᾱ_t) · ε formülüyle gürültülü örnek oluştur (ᾱ_t kümülatif gürültü çarpımı); (4) U-Net ile ε̂ = ε_θ(x_t, t) tahmin et ve MSE kaybını geri yay. Çıkarım tam tersi yönde çalışır: x_T ~ N(0,I)’den başlanır, her adımda ε̂ tahmin edilir, reparametrizasyonla x_{t-1} hesaplanır ve bu süreç T adım tekrarlanarak x₀ elde edilir. DDIM hızlandırması belirleyici ters süreç uygulayarak aynı kaliteyi 20-50 adımda sunar; DPM-Solver ise diferansiyel denklem çözücüsü yaklaşımıyla adımı daha da düşürür.

Pratik Uygulama Alanları

image Görüntü Üretimi ve Düzenleme

Stable Diffusion, DALL-E 2/3 ve Flux gibi modeller DDPM mimarisini temel alır. İnpainting, outpainting ve img2img dönüşümü için de yaygın kullanılır.

videocam Video ve 3D Üretimi

Video Diffusion Models (Ho ve ark., 2022) uzamsal+zamansal 3B U-Net kullanır. Gen-1, Sora ve Runway bu temeli devralmıştır. 3D nokta bulutu ve mesh üretimi de aynı formülasyona dayanır.

biotech Protein ve İlaç Tasarımı

DiffDock ve AlphaFold3, difüzyon sürecini atomik koordinatlara uygulayarak ilaç-protein bağlanma pozlarını tahmin eder. Geleneksel arama yöntemlerine göre çok daha hızlı sonuç üretir.

audio_file Ses ve Müzik Üretimi

AudioDiffusion ve WaveGrad mel-spektrogram üzerinde DDPM çalıştırır. Voicebox (Meta) ses klonlama ve gürültü temizleme için akış eşleştirmeli difüzyon kullanır.

DDPM'den Sonraki Gelişmeler

fast_forward DDIM (2020)

Song ve ark. Belirleyici (deterministic) örnekleme ile 50 adımda DDPM kalitesini yakalar. Latent uzayda interpolasyon ve inversion mümkün olur.

rule Classifier Guidance (2021)

Dhariwal ve ark. Sınıflandırıcı gradyanını ters sürece ekleyerek koşullu üretimi güçlendirir; FID skorlarını GAN seviyesine taşır.

tune Classifier-Free Guidance (2022)

Ho ve Salimans. Ayrı sınıflandırıcı olmadan metin/sınıf koşullandırması. Tüm modern Stable Diffusion sistemlerinin kullandığı yöntem.

compress LDM / Stable Diffusion (2022)

DDPM'i latent uzaya taşıyarak hesaplama maliyetini ~48 kat azaltır; ev kullanıcısı için erişilebilir kılar.

quiz Sık Sorulan Sorular

  • check_circle DDPM neden 1.000 adım kullanıyor?: Daha fazla adım, ileri süreçteki gürültüyü daha kademeli ve matematiksel olarak daha temiz tanımlar. 1.000 adım, kalite ve hesaplama maliyeti arasında iyi bir denge sunar. Daha az adım kaliteyi düşürür; DDIM gibi hızlandırıcılar bu sorunu aşmak için geliştirilmiştir.
  • check_circle DDPM ile GAN arasındaki temel fark nedir?: GAN iki ayrı ağ (generator + discriminator) kullanır ve eğitimi sıklıkla dengesizleşir. DDPM tek bir U-Net eğitir; kayıp fonksiyonu basit MSE’dir — çok daha kararlı. DDPM daha yüksek çeşitlilik sunarken GAN genellikle daha hızlı çıkarım yapar.
  • check_circle DDPM orijinal makalede hangi veri setlerinde test edildi?: CIFAR-10, CelebA-HQ, LSUN-Bedrooms ve LSUN-Church veri setlerinde test edildi. CIFAR-10’da FID 3.17 ile o dönemin en iyi GAN modellerini geçti ve difüzyon modellerinin ciddi bir seçenek olduğunu kanıtladı.
  • check_circle Stable Diffusion ile DDPM arasındaki ilişki nedir?: Stable Diffusion (LDM), DDPM'i piksel uzayı yerine VAE gizli uzayında uygular. Temel ε-prediction yaklaşımı aynıdır; ancak ~48 kat daha küçük uzayda çalıştığından tüketici GPU’larında saniyeler içinde görüntü üretmek mümkün olur.
  • check_circle DDPM video ve ses üretiminde kullanılır mı?: Evet. Video Diffusion Models (Ho ve ark. 2022) DDPM’yi uzamsal+zamansal 3B U-Net ile genişletir. AudioDiffusion mel-spektrogram üzerinde aynı prensibi uygular. Protein tasarımı için difüzyon ise atomik koordinatlara uyarlanmıştır.