İleri ve Ters Süreç
Difüzyon modelinin kalbi iki karşıt süreçtir. İleri süreçte (q) temiz görüntüye her adımda küçük miktarda Gaussian gürültü eklenir; T adım sonunda görüntü tam anlamıyla gürültüye dönüşmüştür. Bu süreç sabit bir gürültü takvimi (noise schedule) ile tanımlanır — doğrusal ya da kosinüs tabanlı takvimlerde gürültünün ne hızda artacağı önceden belirlenir, herhangi bir parametrenin öğrenilmesi gerekmez. Ters süreçte (p_θ) model, parametre setine (θ) sahip bir U-Net sinir ağı kullanarak her adımda "bu gürültüden ne kadarını çıkarmalıyım?" sorusunu yanıtlar. Eğitim sırasında model, rastgele bir t adımındaki gürültülü görüntüye bakarak o adımda eklenen gürültüyü tahmin eder; kayıp fonksiyonu tahmin edilen ile gerçek gürültü arasındaki MSE'dir. Çıkarım sırasında tamamen rastgele gürültüden başlanarak ters süreç adım adım uygulanır.
Difüzyon Model Aileleri
Difüzyon modellerinin birkaç önemli varyantı alanı şekillendirmiştir. DDPM (Ho ve ark., NeurIPS 2020), Markov zinciri tabanlı ilk pratik yaklaşımı sundu; ancak çıkarım için 1.000 adım gerektirir. DDIM (Song ve ark., ICLR 2021) deterministik çıkarım yoluyla aynı kaliteyi 20-50 adımda elde eder. Score-based modeller (Score Matching), veri dağılımının gradyanını (skoru) tahmin eden alternatif bir formülasyondur; DDPM ile matematiksel olarak eşdeğer olduğu kanıtlanmıştır. Latent Diffusion Model (LDM / Rombach ve ark., CVPR 2022) ise işlemi piksel uzayı yerine sıkıştırılmış gizli uzayda (latent space) yürütür. Bu yaklaşım Stable Diffusion'ın temelidir ve 512×512 çözünürlükte 8-16 kat bellek tasarrufu sunar. Classifier-free guidance (CFG) tekniği ise metin koşullandırmanın görüntü kalitesiyle ne kadar güçlü ilişkilendirileceğini kontrol etmek için yaygın biçimde kullanılmaktadır.
Latent Uzayda Difüzyon ve Metin Koşullandırma
Stable Diffusion ve DALL-E 3 gibi modern sistemler difüzyonu piksel uzayı yerine gizli uzayda (latent space) yürütür. Süreç şöyle işler: önce bir VAE (Variational Autoencoder) görüntüyü küçük boyutlu bir gizli temsile sıkıştırır (örneğin 512×512 piksel → 64×64 latent). Difüzyon bu gizli temsil üzerinde gerçekleştirilir; çıkarım tamamlanınca VAE dekoderi gizli temsili tekrar piksele dönüştürür. Metin yönlendirmesi için CLIP ya da T5 gibi bir metin kodlayıcısı, girilen metni sabit boyutlu bir vektöre dönüştürür. Bu vektör, U-Net mimarisinin her çözünürlük katmanındaki cross-attention başlıkları aracılığıyla difüzyon sürecine enjekte edilir ve modelin gürültü tahminini metin bağlamına göre yönlendirir. Classifier-free guidance (CFG) parametresi 1-20 arasında ayarlanabilir; yüksek değerler metne daha sıkı bağlılık sağlar ancak çeşitliliği azaltır.
Uygulama Alanları
Difüzyon modelleri başlangıçta görüntü üretiminde parladı, ancak uygulama alanı çok daha geniştir. Görüntü alanında Stable Diffusion, DALL-E 3 ve Midjourney metin-görüntü dönüşümünü yaygınlaştırdı; görüntü düzenleme (inpainting, outpainting) ve süper çözünürlük gibi görevlerde de kullanılmaktadır. Video üretiminde OpenAI'nin Sora modeli ve Runway Gen-2, difüzyon ilkelerini zamansal tutarlılıkla birleştirmektedir. Ses alanında AudioLDM ve Stable Audio müzik üretimini mümkün kılarken ElevenLabs gibi sistemler yüksek kaliteli konuşma sentezinde difüzyon ilkelerinden yararlanır. Molekül ve protein tasarımında AlphaFold 3 ve RFDiffusion yeni ilaç adayı yapılarını simüle etmektedir. 3B içerik üretiminde DreamFusion, 2B difüzyon bilgisini NeRF ile birleştirerek metin tabanlı 3B nesne oluşturur.