architecture Latent Diffusion Nasıl Çalışır? VAE, U-Net ve Metin Kodlayıcı
LDM üç ana bileşenden oluşur. VAE (Varyasyonel Otoenkoder): eğitim aşamasında görüntüyü sıkıştırılmış bir gizil vektöre dönüştüren encoder ve bu vektörü geri görüntüye açan decoder'dan oluşur. Eğitim tamamlandıktan sonra VAE ağırlıkları dondurulur ve difüzyon eğitimi başlar. U-Net, gizil uzayda çalışan ana difüzyon modelidir; gürültüyü tahmin eden bu ağ, cross-attention katmanları aracılığıyla metin ve diğer koşullandırma sinyallerini alır. Metin kodlayıcı ise CLIP veya T5 gibi önceden eğitilmiş bir dil modelidir; kullanıcının metin prompt'unu vektör dizisine dönüştürür. Çıkarım sırasında tamamen gürültüden başlayan süreç, U-Net'in latent uzayda denoising döngüsünü adım adım tamamlamasıyla ilerler; döngünün sonunda VAE decoder gizil çıktıyı piksel görüntüsüne çevirir.
Piksel Uzayı vs Gizil Uzay: Temel Farklar
grid_on Piksel Difüzyon (DDPM)
Gürültü ekleme ve giderme doğrudan 512x512x3 piksel uzayında yapılır. Her adım yaklaşık 786 K boyutlu vektör işlemi gerektirir. Yüksek VRAM ve uzun çıkarım süresi dezavantajdır.
compress Latent Difüzyon (LDM)
Aynı görüntü önce 64x64x4 latent uzaya (yaklaşık 16 K boyut) sıkıştırılır. Difüzyon bu küçük uzayda gerçekleşir; hesaplama 48 kat azalır. 4–8 GB VRAM ile tüketici GPU'larında çalışır.
LDM Versiyonları: Stable Diffusion Ailesi
filter_1 SD 1.x
Orijinal Stable Diffusion. 512x512 varsayılan çözünürlük, CLIP ViT-L/14 metin kodlayıcı, 4 GB VRAM ile çalışır.
filter_2 SD 2.x
OpenCLIP ViT-H/14 kodlayıcı, daha büyük U-Net. 768x768 çözünürlük destekler.
hd SDXL
İki U-Net aşamalı (base + refiner), 1024x1024 varsayılan. Daha gerçekçi yüzler ve metinler üretir.
auto_awesome FLUX.1 / SD3
Transformer tabanlı difüzyon (DiT). Metin ve görüntü tokenları birlikte işlenir. FLUX.1 2024'ün en iyi yerel açık ağırlıklı modelidir.
apps Uygulama Alanları
- check_circle Metin-Görüntü Üretimi: Doğal dil açıklamasından yüksek kaliteli görüntü oluşturma; Stable Diffusion, Midjourney ve DALL-E 3 bu alanda öncü uygulamalardır.
- check_circle Görüntü Düzenleme (Inpainting / Outpainting): Mevcut görüntünün seçili alanını metin komutuyla değiştirme (inpainting) veya görüntüyü sınırlarının ötesine genişletme (outpainting).
- check_circle Video Üretimi: Geçici boyut eklenerek aynı mimari video kare dizileri için uyarlanabilir; Stable Video Diffusion ve çeşitli Sora benzeri modeller bu yaklaşımı kullanır.
- check_circle Ses Sentezi (AudioLDM): Mel-spektrogram latent uzayda temsil edilerek metin-ses üretimi mümkün olur; AudioLDM2 ve Stable Audio bu mimariyi takip eder.
- check_circle Tıbbi Görüntü Artırma: Az sayıda MRI veya CT tarama verisinden veri artırımı (augmentation) yaparak eğitim kümesini genişletme; tıbbi AI araştırmalarında giderek yaygınlaşıyor.
tune Fine-tuning ve Kişiselleştirme
- check_circle LoRA (Low-Rank Adaptation): U-Net'in dikkat katmanlarına düşük kerteli matris çiftleri ekleyerek az veriyle (20-100 görüntü) hızlı kişiselleştirme sağlar. Belirli bir sanatçı stilini veya karakteri modele öğretmek için en yaygın yöntemdir.
- check_circle ControlNet: U-Net'e paralel bir kopya eklenerek kontur, derinlik haritası, poz iskeleti veya renk ipuçları gibi ek koşullandırma sunar. Çıktı üzerinde piksel düzeyinde kontrol imkânı tanır.
- check_circle DreamBooth: Belirli bir nesne veya kişiyi (3-5 fotoğrafla) modele öğreten ince ayar tekniği. Özgün bir tanımlayıcı token kullanarak istenilen her bağlamda o nesneyi üretir.
- check_circle Textual Inversion: Yeni bir token vektörü optimize ederek hedef konsepti metin uzayında kodlar. Düşük hesaplama maliyetiyle kişiselleştirme için uygundur.
quiz Sık Sorulan Sorular
- check_circle Latent uzay neden daha verimli?: 512x512 RGB görüntü 786.432 boyutlu bir vektördür. Aynı görüntünün 64x64x4 gizil temsili yalnızca 16.384 boyutludur — yaklaşık 48 kat daha küçük. U-Net bu küçük uzayda çalıştığında hesaplama ve bellek gereksinimi dramatik biçimde düşer.
- check_circle VAE neden ayrı bir model?: VAE görüntü sıkıştırma ve yeniden yapılandırma için özel olarak eğitilir; bu eğitim difüzyon eğitiminden bağımsızdır. Önceden eğitilmiş VAE'nin dondurulması LDM eğitimini daha kararlı kılar. Özel bir VAE ile ince ayar yapılarak belirli görsel alanlar optimize edilebilir.
- check_circle ControlNet ve LoRA latent difüzyonla nasıl çalışır?: ControlNet, U-Net'e paralel bir kopya ekleyerek kontur, derinlik veya poz gibi ek koşullandırma sunar. LoRA ise U-Net'in dikkat katmanlarına düşük kerteli matris çiftleri ekleyerek az veriyle hızlı kişiselleştirme sağlar. Her ikisi de LDM mimarisinin üstüne eklenti olarak çalışır.
- check_circle Latent Diffusion ses üretiminde de kullanılır mı?: Evet. AudioLDM ve AudioLDM2, mel-spektrogramı latent uzayda temsil ederek metin-ses üretimi için LDM mimarisini kullanır. Stable Audio ve MusicGen de bu yaklaşımdan esinlenmiştir.
- check_circle Stable Diffusion için minimum donanım gereksinimleri nedir?: SD 1.x ve 2.x için 4 GB VRAM'li bir GPU (örn. NVIDIA RTX 3060) yeterlidir. SDXL en az 8 GB VRAM gerektirir. Apple Silicon (M1/M2/M3) Metal Performance Shaders (MPS) ile de çalışır; ancak CUDA kadar hızlı değildir.