functions DDPM Matematiği (Sezgisel)
İleri süreçte, temiz görüntü x₀’a her adımda az miktarda Gaussian gürültü eklenir. Bu süreç Markov zinciridir: q(x_t | x_{t-1}) = N(x_t; √(1-β_t)·x_{t-1}, β_t·I). β_t değerleri genellikle lineer veya kosinüs eğrimiyle artar (0.0001 → 0.02). T adım sonunda x_T ≈ N(0, I), yani saf gürültü. Ters süreçte model, gürültülü görüntü x_t ve adım t verildiğinde, o adımda eklenen ε gürültüsünü tahmin eder. Eğitim kaybı: L = E[||ε - ε_θ(x_t, t)||²]. Çıkarım sırasında x_T ~ N(0,I)’den başlanır ve model adım adım gürültüyü çıkararak x₀’ı kurtarır. Zaman adımı t, U-Net’e sinüs pozisyonel gömme (sinusoidal embedding) olarak koşullandırma sinyali verilir.
school Eğitim ve Çıkarım Algoritması
Eğitim döngüsü 4 adımdan oluşur: (1) Veri setinden x₀ örnekle; (2) Rastgele t ∈ {1,…,T} seç ve ε ~ N(0,I) gürültüsü üret; (3) x_t = √ᾱ_t · x₀ + √(1-ᾱ_t) · ε formülüyle gürültülü örnek oluştur (ᾱ_t kümülatif gürültü çarpımı); (4) U-Net ile ε̂ = ε_θ(x_t, t) tahmin et ve MSE kaybını geri yay. Çıkarım tam tersi yönde çalışır: x_T ~ N(0,I)’den başlanır, her adımda ε̂ tahmin edilir, reparametrizasyonla x_{t-1} hesaplanır ve bu süreç T adım tekrarlanarak x₀ elde edilir. DDIM hızlandırması belirleyici ters süreç uygulayarak aynı kaliteyi 20-50 adımda sunar; DPM-Solver ise diferansiyel denklem çözücüsü yaklaşımıyla adımı daha da düşürür.
Pratik Uygulama Alanları
image Görüntü Üretimi ve Düzenleme
Stable Diffusion, DALL-E 2/3 ve Flux gibi modeller DDPM mimarisini temel alır. İnpainting, outpainting ve img2img dönüşümü için de yaygın kullanılır.
videocam Video ve 3D Üretimi
Video Diffusion Models (Ho ve ark., 2022) uzamsal+zamansal 3B U-Net kullanır. Gen-1, Sora ve Runway bu temeli devralmıştır. 3D nokta bulutu ve mesh üretimi de aynı formülasyona dayanır.
biotech Protein ve İlaç Tasarımı
DiffDock ve AlphaFold3, difüzyon sürecini atomik koordinatlara uygulayarak ilaç-protein bağlanma pozlarını tahmin eder. Geleneksel arama yöntemlerine göre çok daha hızlı sonuç üretir.
audio_file Ses ve Müzik Üretimi
AudioDiffusion ve WaveGrad mel-spektrogram üzerinde DDPM çalıştırır. Voicebox (Meta) ses klonlama ve gürültü temizleme için akış eşleştirmeli difüzyon kullanır.
DDPM'den Sonraki Gelişmeler
fast_forward DDIM (2020)
Song ve ark. Belirleyici (deterministic) örnekleme ile 50 adımda DDPM kalitesini yakalar. Latent uzayda interpolasyon ve inversion mümkün olur.
rule Classifier Guidance (2021)
Dhariwal ve ark. Sınıflandırıcı gradyanını ters sürece ekleyerek koşullu üretimi güçlendirir; FID skorlarını GAN seviyesine taşır.
tune Classifier-Free Guidance (2022)
Ho ve Salimans. Ayrı sınıflandırıcı olmadan metin/sınıf koşullandırması. Tüm modern Stable Diffusion sistemlerinin kullandığı yöntem.
compress LDM / Stable Diffusion (2022)
DDPM'i latent uzaya taşıyarak hesaplama maliyetini ~48 kat azaltır; ev kullanıcısı için erişilebilir kılar.
quiz Sık Sorulan Sorular
- check_circle DDPM neden 1.000 adım kullanıyor?: Daha fazla adım, ileri süreçteki gürültüyü daha kademeli ve matematiksel olarak daha temiz tanımlar. 1.000 adım, kalite ve hesaplama maliyeti arasında iyi bir denge sunar. Daha az adım kaliteyi düşürür; DDIM gibi hızlandırıcılar bu sorunu aşmak için geliştirilmiştir.
- check_circle DDPM ile GAN arasındaki temel fark nedir?: GAN iki ayrı ağ (generator + discriminator) kullanır ve eğitimi sıklıkla dengesizleşir. DDPM tek bir U-Net eğitir; kayıp fonksiyonu basit MSE’dir — çok daha kararlı. DDPM daha yüksek çeşitlilik sunarken GAN genellikle daha hızlı çıkarım yapar.
- check_circle DDPM orijinal makalede hangi veri setlerinde test edildi?: CIFAR-10, CelebA-HQ, LSUN-Bedrooms ve LSUN-Church veri setlerinde test edildi. CIFAR-10’da FID 3.17 ile o dönemin en iyi GAN modellerini geçti ve difüzyon modellerinin ciddi bir seçenek olduğunu kanıtladı.
- check_circle Stable Diffusion ile DDPM arasındaki ilişki nedir?: Stable Diffusion (LDM), DDPM'i piksel uzayı yerine VAE gizli uzayında uygular. Temel ε-prediction yaklaşımı aynıdır; ancak ~48 kat daha küçük uzayda çalıştığından tüketici GPU’larında saniyeler içinde görüntü üretmek mümkün olur.
- check_circle DDPM video ve ses üretiminde kullanılır mı?: Evet. Video Diffusion Models (Ho ve ark. 2022) DDPM’yi uzamsal+zamansal 3B U-Net ile genişletir. AudioDiffusion mel-spektrogram üzerinde aynı prensibi uygular. Protein tasarımı için difüzyon ise atomik koordinatlara uyarlanmıştır.