Latent Diffusion Model (Gizil Uzay Difüzyon Modeli (Latent Diffusion))

Latent Diffusion, difüzyon işlemini piksel uzayı yerine VAE ile sıkıştırılmış gizil uzayda çalıştıran Stable Diffusion'ın temelidir.

Latent Diffusion Model (LDM), difüzyon işlemini piksel uzayı yerine sıkıştırılmış bir gizil (latent) uzayda gerçekleştiren verimli bir üretici yapay zeka mimarisidir. Robin Rombach ve arkadaşları tarafından 2022 yılında CVPR'da yayımlanan High-Resolution Image Synthesis with Latent Diffusion Models çalışmasıyla kamuoyuna tanıtılan bu yaklaşım, Stable Diffusion'ın temelini oluşturur ve modern yapay zeka görüntü üretiminin standart mimarisine dönüşmüştür. Geleneksel piksel uzayı difüzyon modellerinde (DDPM gibi) tüm hesaplama görüntünün tam boyutunda (örn. 512×512×3 = 786.432 boyut) yapılır; bu son derece hesaplama yoğundur. LDM'de ise süreç üç aşamaya ayrılır: önce bir Varyasyonel Otoenkoder (VAE) görüntüyü çok daha küçük bir gizil temsile sıkıştırır (örn. 64×64×4 = 16.384 boyut); ardından difüzyon süreci bu küçük uzayda çalışır; son olarak VAE dekoderi gizil çıktıyı tam boyutlu görüntüye dönüştürür. Bu sıkıştırma, hesaplama maliyetini piksel tabanlı difüzyona kıyasla yaklaşık 48 kat azaltır. Metin koşullandırması CLIP veya OpenCLIP metin kodlayıcısından gelen vektörlerin U-Net'in cross-attention katmanlarına enjekte edilmesiyle gerçekleşir. Kullanıcının doğal dil açıklaması, görsel uzayda karşılık bulan vektörlere dönüştürülerek görüntü oluşturma sürecini yönlendirir. Sıkıştırma ve kalite arasındaki denge, VAE'nin yeniden yapılandırma başarısına bağlıdır. LDM mimarisinin pratik etkisi devasa olmuştur: tüketici GPU'larında (4–8 GB VRAM) yüksek kaliteli görüntü üretimini mümkün kılmış, SDXL, SD3 ve FLUX.1 gibi türev modellerin gelişimini hızlandırmış, ControlNet ve LoRA gibi kişiselleştirme araçlarına zemin hazırlamıştır. Metin-görüntü üretiminin ötesinde aynı mimari ses (AudioLDM), video (VideoLDM) ve 3D içerik üretiminde de kullanılmaktadır. Türkiye'de grafik tasarım, reklam ve oyun sektörlerinde LDM tabanlı araçların kullanımı 2024-2025 yıllarında belirgin biçimde artmıştır. Gelecekte latent uzay tekniklerinin 3D sahnelere, moleküler yapılara ve ilaç tasarımına genişletilmesi araştırmacılar tarafından aktif olarak incelenmektedir.

architecture Latent Diffusion Nasıl Çalışır? VAE, U-Net ve Metin Kodlayıcı

LDM üç ana bileşenden oluşur. VAE (Varyasyonel Otoenkoder): eğitim aşamasında görüntüyü sıkıştırılmış bir gizil vektöre dönüştüren encoder ve bu vektörü geri görüntüye açan decoder'dan oluşur. Eğitim tamamlandıktan sonra VAE ağırlıkları dondurulur ve difüzyon eğitimi başlar. U-Net, gizil uzayda çalışan ana difüzyon modelidir; gürültüyü tahmin eden bu ağ, cross-attention katmanları aracılığıyla metin ve diğer koşullandırma sinyallerini alır. Metin kodlayıcı ise CLIP veya T5 gibi önceden eğitilmiş bir dil modelidir; kullanıcının metin prompt'unu vektör dizisine dönüştürür. Çıkarım sırasında tamamen gürültüden başlayan süreç, U-Net'in latent uzayda denoising döngüsünü adım adım tamamlamasıyla ilerler; döngünün sonunda VAE decoder gizil çıktıyı piksel görüntüsüne çevirir.

Piksel Uzayı vs Gizil Uzay: Temel Farklar

grid_on Piksel Difüzyon (DDPM)

Gürültü ekleme ve giderme doğrudan 512x512x3 piksel uzayında yapılır. Her adım yaklaşık 786 K boyutlu vektör işlemi gerektirir. Yüksek VRAM ve uzun çıkarım süresi dezavantajdır.

compress Latent Difüzyon (LDM)

Aynı görüntü önce 64x64x4 latent uzaya (yaklaşık 16 K boyut) sıkıştırılır. Difüzyon bu küçük uzayda gerçekleşir; hesaplama 48 kat azalır. 4–8 GB VRAM ile tüketici GPU'larında çalışır.

LDM Versiyonları: Stable Diffusion Ailesi

filter_1 SD 1.x

Orijinal Stable Diffusion. 512x512 varsayılan çözünürlük, CLIP ViT-L/14 metin kodlayıcı, 4 GB VRAM ile çalışır.

filter_2 SD 2.x

OpenCLIP ViT-H/14 kodlayıcı, daha büyük U-Net. 768x768 çözünürlük destekler.

hd SDXL

İki U-Net aşamalı (base + refiner), 1024x1024 varsayılan. Daha gerçekçi yüzler ve metinler üretir.

auto_awesome FLUX.1 / SD3

Transformer tabanlı difüzyon (DiT). Metin ve görüntü tokenları birlikte işlenir. FLUX.1 2024'ün en iyi yerel açık ağırlıklı modelidir.

apps Uygulama Alanları

  • check_circle Metin-Görüntü Üretimi: Doğal dil açıklamasından yüksek kaliteli görüntü oluşturma; Stable Diffusion, Midjourney ve DALL-E 3 bu alanda öncü uygulamalardır.
  • check_circle Görüntü Düzenleme (Inpainting / Outpainting): Mevcut görüntünün seçili alanını metin komutuyla değiştirme (inpainting) veya görüntüyü sınırlarının ötesine genişletme (outpainting).
  • check_circle Video Üretimi: Geçici boyut eklenerek aynı mimari video kare dizileri için uyarlanabilir; Stable Video Diffusion ve çeşitli Sora benzeri modeller bu yaklaşımı kullanır.
  • check_circle Ses Sentezi (AudioLDM): Mel-spektrogram latent uzayda temsil edilerek metin-ses üretimi mümkün olur; AudioLDM2 ve Stable Audio bu mimariyi takip eder.
  • check_circle Tıbbi Görüntü Artırma: Az sayıda MRI veya CT tarama verisinden veri artırımı (augmentation) yaparak eğitim kümesini genişletme; tıbbi AI araştırmalarında giderek yaygınlaşıyor.

tune Fine-tuning ve Kişiselleştirme

  • check_circle LoRA (Low-Rank Adaptation): U-Net'in dikkat katmanlarına düşük kerteli matris çiftleri ekleyerek az veriyle (20-100 görüntü) hızlı kişiselleştirme sağlar. Belirli bir sanatçı stilini veya karakteri modele öğretmek için en yaygın yöntemdir.
  • check_circle ControlNet: U-Net'e paralel bir kopya eklenerek kontur, derinlik haritası, poz iskeleti veya renk ipuçları gibi ek koşullandırma sunar. Çıktı üzerinde piksel düzeyinde kontrol imkânı tanır.
  • check_circle DreamBooth: Belirli bir nesne veya kişiyi (3-5 fotoğrafla) modele öğreten ince ayar tekniği. Özgün bir tanımlayıcı token kullanarak istenilen her bağlamda o nesneyi üretir.
  • check_circle Textual Inversion: Yeni bir token vektörü optimize ederek hedef konsepti metin uzayında kodlar. Düşük hesaplama maliyetiyle kişiselleştirme için uygundur.

quiz Sık Sorulan Sorular

  • check_circle Latent uzay neden daha verimli?: 512x512 RGB görüntü 786.432 boyutlu bir vektördür. Aynı görüntünün 64x64x4 gizil temsili yalnızca 16.384 boyutludur — yaklaşık 48 kat daha küçük. U-Net bu küçük uzayda çalıştığında hesaplama ve bellek gereksinimi dramatik biçimde düşer.
  • check_circle VAE neden ayrı bir model?: VAE görüntü sıkıştırma ve yeniden yapılandırma için özel olarak eğitilir; bu eğitim difüzyon eğitiminden bağımsızdır. Önceden eğitilmiş VAE'nin dondurulması LDM eğitimini daha kararlı kılar. Özel bir VAE ile ince ayar yapılarak belirli görsel alanlar optimize edilebilir.
  • check_circle ControlNet ve LoRA latent difüzyonla nasıl çalışır?: ControlNet, U-Net'e paralel bir kopya ekleyerek kontur, derinlik veya poz gibi ek koşullandırma sunar. LoRA ise U-Net'in dikkat katmanlarına düşük kerteli matris çiftleri ekleyerek az veriyle hızlı kişiselleştirme sağlar. Her ikisi de LDM mimarisinin üstüne eklenti olarak çalışır.
  • check_circle Latent Diffusion ses üretiminde de kullanılır mı?: Evet. AudioLDM ve AudioLDM2, mel-spektrogramı latent uzayda temsil ederek metin-ses üretimi için LDM mimarisini kullanır. Stable Audio ve MusicGen de bu yaklaşımdan esinlenmiştir.
  • check_circle Stable Diffusion için minimum donanım gereksinimleri nedir?: SD 1.x ve 2.x için 4 GB VRAM'li bir GPU (örn. NVIDIA RTX 3060) yeterlidir. SDXL en az 8 GB VRAM gerektirir. Apple Silicon (M1/M2/M3) Metal Performance Shaders (MPS) ile de çalışır; ancak CUDA kadar hızlı değildir.