Stability AI'ın 2022'de yayımladığı açık ağırlıklı metin-görüntü latent difüzyon modeli; LoRA/DreamBooth ile özelleştirilebilir, kişisel bilgisayarda ücretsiz çalışır.

Stable Diffusion, 2022 yılında CompVis araştırma grubu ve Stability AI iş birliğiyle yayımlanan, metinden görüntü üreten açık ağırlıklı bir latent difüzyon modelidir. Robin Rombach ve ekibinin "High-Resolution Image Synthesis with Latent Diffusion Models" (2022) makalesine dayanan model, difüzyon sürecini piksel uzayı yerine sıkıştırılmış bir latent uzayda yürütür; bu yaklaşım hesaplama maliyetini önemli ölçüde azaltır ve tüketici sınıfı ekran kartlarında çalışmayı mümkün kılar. Midjourney ve DALL-E'den temel farkı, ağırlıklarının kamuya açık olması; yani modelin kişisel bilgisayara indirilerek ücretsiz, sansürsüz ve tamamen özelleştirilebilir biçimde çalıştırılabilmesidir. Mimari dört ana bileşen üzerine kuruludur. VAE (Varyasyonel Otokodlayıcı), 512×512 piksel görüntüyü 64×64 latent temsile sıkıştırır; üretim sonunda latent yeniden piksel uzayına dönüştürülür. U-Net, zaman adımı ve metin koşuluna göre latent üzerindeki gürültüyü iteratif biçimde tahmin edip çıkarır. CLIP metin kodlayıcı, kullanıcı promptunu anlamsal vektöre çevirerek U-Net'in cross-attention katmanlarını yönlendirir. Gürültü zamanlayıcı (DDIM, DPM-Solver gibi algoritmalar) ise ileri ve ters difüzyon süreçlerini düzenler; DDIM ile 1.000 adımlık stokastik süreç 20-50 deterministik adıma indirilebilir. Model, yayımından bu yana büyük evrim geçirdi: SD 1.x (512×512), SD 2.x (768×768, OpenCLIP), SDXL (1024×1024, çift U-Net), SD 3.0 (MM-DiT mimarisi, T5 metin kodlayıcı) ve 2024'te Black Forest Labs tarafından yayımlanan FLUX.1. Topluluk tarafından geliştirilen Automatic1111 ve ComfyUI arayüzleri, ControlNet (poz ve kompozisyon kontrolü), LoRA (hafif ince ayar) ve DreamBooth (kişisel stil öğretme) eklentileriyle birlikte dünyanın en büyük açık kaynaklı görüntü üretim ekosistemine dönüştü. CivitAI platformu 100.000'den fazla topluluk modelini barındırır. Kullanım alanları; konsept sanat, e-ticaret ürün görseli, mimari görselleştirme, avatar tasarımı ve video üretim pipeline'larına entegrasyonu kapsar. Açık ağırlık yapısı deepfake üretim risklerini de beraberinde getirdiğinden AB Yapay Zeka Yasası (AI Act), modeli genel amaçlı yapay zeka kapsamında değerlendirmekte ve içerik etiketleme gereksinimleri tartışılmaktadır.

Latent Difüzyon: Stable Diffusion Neden Farklı?

Geleneksel difüzyon modelleri görüntüyü piksel uzayında işler; 512×512 bir görüntü için 786.432 pikselin her birinde gürültü ekleme ve çıkarma işlemi çok büyük hesaplama kaynağı tüketir. Stable Diffusion bu sorunu latent uzay yaklaşımıyla çözer: VAE (Varyasyonel Otokodlayıcı), görüntüyü önce 8× sıkıştırılmış bir latent temsile indirir (512×512 → 64×64); difüzyon süreci bu küçük uzayda yürütülür; işlem bittiğinde VAE decoder latenti yeniden tam çözünürlüğe dönüştürür. Piksel tabanlı difüzyona kıyasla 64× daha az hesaplama gerektirir; tüketici ekran kartlarında (8 GB VRAM) gerçek zamanlıya yakın üretim mümkün olur.

Stable Diffusion'ın Teknik Bileşenleri

  • check_circle VAE — Varyasyonel Otokodlayıcı: Görüntüyü piksel uzayından latent uzaya sıkıştırır (encoder) ve ters yönde tam çözünürlüğe geri döndürür (decoder). 512×512 piksel görüntü yaklaşık 64×64 latent temsile indirilir; hesaplama maliyeti dramatik biçimde düşer ve difüzyon süreci çok daha verimli çalışır.
  • check_circle U-Net — Gürültü Tahmincisi: Difüzyon modelinin kalbi: gürültülü latent görsele verilen zaman adımı ve metin koşulunu (conditioning) kullanarak eklenen gürültüyü tahmin eder. Her iterasyonda tahmin edilen gürültü çıkarılır; bu süreç tekrarlanarak rastgele gürültüden anlamlı görüntüye ulaşılır. Cross-attention katmanları CLIP vektörüyle metin koşulunu entegre eder.
  • check_circle CLIP Metin Kodlayıcı: Kullanıcının promptunu anlamsal vektöre dönüştüren bileşen. U-Net'in cross-attention katmanları bu vektörle koşullanır; "kırmızı elma" promptu görüntünün kırmızı elma içermesini yönlendirir. SDXL ve SD 3.0 farklı metin kodlayıcılar (OpenCLIP, T5-XXL) kullanarak daha uzun ve karmaşık promptları daha iyi yorumlar.
  • check_circle Gürültü Zamanlayıcı (Noise Scheduler): İleri süreç: orijinal görüntüye adım adım Gaussian gürültü eklenir; ters süreç (inference): saf gürültüden başlanarak U-Net'in gürültü tahmini iteratif biçimde çıkarılır. DDIM ve DPM-Solver algoritmaları deterministik örnekleme yaparak 1.000 adımlık süreci 20-50 adıma indirir ve üretim hızını artırır.

Stable Diffusion Ara Yüzleri

browser_updated Automatic1111

Dünya çapında en popüler WebUI arayüzü. 1.000+ eklenti, ControlNet, Inpainting, Hires.fix ve kapsamlı model desteği.

account_tree ComfyUI

Modüler düğüm (node) sistemi. Profesyonel görüntü üretim iş akışları kurmak için tercih edilen görsel programlama arayüzü.

cloud_download CivitAI

Topluluğun ürettiği 100.000+ Stable Diffusion modeli, LoRA ve checkpoint'leri ücretsiz indirme platformu.

Kişiselleştirme: LoRA ve DreamBooth

Stable Diffusion'ın açık ağırlık yapısı kullanıcılara ince ayar imkânı sunar. DreamBooth: 3-20 referans görüntüyle belirli bir kişi, nesne veya stil modele öğretilir; nadiren kullanılan benzersiz bir token (ör. "sks köpek") atanarak üretim yönlendirilir. LoRA (Low-Rank Adaptation): modele küçük ek matrisler ekleyerek stil veya karakter öğrenir; dosya boyutu birkaç MB'a kadar iner. Textual Inversion ise yeni bir konsepti tek bir embedding vektörüyle kodlar. ControlNet eklentisi; iskelet, derinlik haritası veya kenar tespiti gibi kontrol sinyalleriyle kompozisyon ve poz üzerinde tam denetim kurar. Bu teknikler kişiselleştirilmiş avatar, ürün görseli ve stüdyo fotoğrafı alternatifleri gibi ticari uygulamaları mümkün kılar.

Sürümler ve Ekosistem Gelişimi

  • check_circle SD 1.x (Ağustos 2022): 512×512 piksel çıktı, CLIP metin kodlayıcı, 860M U-Net parametresi. Açık kaynak yayımıyla topluluğun ana modeli haline geldi; on binlerce ince ayarlı model ve LoRA türedi.
  • check_circle SDXL (Temmuz 2023): 1024×1024 piksel, çift U-Net (3.5B + 900M), iki aşamalı pipeline (base + refiner). Daha iyi metin yorumlama ve detay kalitesi. SDXL Turbo ile tek adımda gerçek zamanlı üretim mümkün oldu.
  • check_circle SD 3.0 (Mart 2024): Multimodal Diffusion Transformer (MM-DiT) mimarisi; T5-XXL ve CLIP metin kodlayıcıları birleşimi. Metin içeren görüntülerde belirgin iyileşme; 800M ile 8B parametre arasında çeşitli boyutlar sunulur.
  • check_circle FLUX.1 (Ağustos 2024): Black Forest Labs (Robin Rombach ekibi) tarafından yayımlanan yeni nesil model; Flow Matching ve MM-DiT mimarisi. dev (12B, izin gerekli), schnell (12B, Apache 2.0), pro (API) varyantlarıyla fotorealizm ve prompt uyumunda yeni kıyaslama noktası.

Sık Sorulan Sorular

  • check_circle Stable Diffusion nedir?: Stability AI ve CompVis'in 2022'de yayımladığı açık ağırlıklı metin-görüntü difüzyon modelidir. Latent uzayda çalışan bu model, tüketici sınıfı GPU'larda ücretsiz ve yerel olarak çalıştırılabilir; binlerce topluluk modeli ve eklentisiyle tam özelleştirme imkânı sunar.
  • check_circle Stable Diffusion ile DALL-E 3 farkı nedir?: Stable Diffusion açık ağırlık, yerel çalıştırma, ücretsiz ve tam özelleştirme ekosistemi (LoRA, ControlNet, DreamBooth). DALL-E 3 ise OpenAI'nin kapalı modeli; ChatGPT ve API üzerinden erişilir, sıkı içerik filtreleri vardır, metin içeren görsellerde daha güçlüdür. Gizlilik ve özelleştirme için SD, pratiklik için DALL-E tercih edilir.
  • check_circle Stable Diffusion kaç VRAM gerektirir?: SD 1.x: minimum 4 GB VRAM (yarı hassasiyet). SDXL: 8-10 GB önerilir. SD 3.0 ve FLUX.1: 8-16 GB (modele göre değişir). Quantize edilmiş versiyonlar (GGUF, NNCF) daha düşük bellekle çalışabilir. Google Colab veya RunPod bulut seçenekleri de kullanılabilir.
  • check_circle LoRA nedir ve nasıl kullanılır?: Low-Rank Adaptation: modelin mevcut ağırlıklarını dondurup küçük ek matrisler (rank 4-128) ekleyerek stil, karakter veya sanatçı tarzı öğrenir. DreamBooth'a göre çok daha hafif (birkaç MB) ve hızlı eğitilir. CivitAI'da on binlerce LoRA ücretsiz indirilebilir; Automatic1111'de <lora:model_adı:ağırlık> sözdizimi ile aktive edilir.
  • check_circle Stable Diffusion ile üretilen görüntüler telif hakkı kapsamında mı?: Model ağırlıkları RAIL-M lisansıyla yayımlanmış olup ticari kullanıma büyük ölçüde izin verilir. Üretilen görüntülerin telif durumu ülkeye göre hukuki belirsizliğini korumaktadır; gerçek kişilerin izinsiz deepfake üretimi ise çoğu ülkede yasal değildir.