tag DiffusionModel

Bu sayfada DiffusionModel etiketi ile işaretlenmiş 6 yapay zeka kavramını bulabilirsiniz.

Diffusion modeli, veriye kademeli olarak gürültü ekleyen (ileri süreç) ve ardından bu gürültüden orijinal veriyi adım adım yeniden oluşturmayı öğrenen (ters süreç) bir üretici yapay zeka mimarisidir. Stable Diffusion, DALL-E 3, Midjourney ve Imagen gibi günümüzün en güçlü görüntü üretim sistemleri difüzyon modeline dayanmaktadır. İleri süreçte (forward process) modele verilen temiz görüntüye T adım boyunca Gaussian gürültü eklenir; sonunda görüntü tamamen gürültüye dönüşür. Bu süreç deterministik ve önceden tanımlanmıştır — öğrenme gerektirmez. Ters süreçte (reverse process) model, tamamen gürültülü bir görüntüden başlayarak her adımda biraz daha temizleyerek orijinale yakın bir görüntü üretir. Model bu ters süreci veriden öğrenir. Eğitim sırasında model, belirli bir gürültü seviyesindeki görüntüden hangi gürültünün çıkarılması gerektiğini tahmin etmeyi öğrenir. Kayıp fonksiyonu, tahmin edilen gürültü ile gerçek gürültü arasındaki ortalama kare hatası (MSE) üzerine kuruludur. Çıkarım sırasında tamamen rastgele gürültüden başlanır ve model bu tahmin sürecini T adım boyunca tekrarlayarak yeni, gerçekçi bir görüntü üretir. Metin koşullandırması (text conditioning) ise CLIP gibi bir metin kodlayıcısından gelen vektörün dikkat mekanizmasına (cross-attention) enjekte edilmesiyle gerçekleştirilir. 2020'de Ho ve arkadaşlarının DDPM (Denoising Diffusion Probabilistic Models) çalışması difüzyon modellerini öne çıkardı. Song ve arkadaşlarının DDIM'i (Denoising Diffusion Implicit Models) çıkarım adımlarını yüzlerden onlara indirerek hızlı sentezi mümkün kıldı. Rombach ve arkadaşlarının 2022'de yayımladığı Latent Diffusion Model (LDM) ise pikseller yerine VAE kodlayıcısından üretilen gizli temsil uzayında (latent space) difüzyon işlemini yürüttü; bellek ve hesaplama maliyetini önemli ölçüde düşürdü. Stable Diffusion bu yaklaşımı temel almaktadır. Difüzyon modelleri yalnızca görüntüyle sınırlı değildir: ses (AudioLDM, MusicGen), video (Sora, Gen-2), 3B molekül yapıları ve protein tasarımı (AlphaFold 3) gibi alanlarda da kullanılmaktadır. GAN'lara kıyasla eğitim kararlılığı daha yüksektir ve mod çökmesine daha az eğilimlidir; ancak çıkarım adımlarının tekrarlı uygulanması GAN'lara göre daha yavaş kalır.

noise_aware

DDPM (Gürültü Giderme Difüzyon Olasılık Modeli)

DDPM (Denoising Diffusion Probabilistic Models), Jonathan Ho ve arkadaşları tarafından 2020 yılında yayımlanan ve NeurIPS 2020'de sunulan, modern difüzyon modellerinin temelini atan çığır açıcı bir üretici yapay zeka modelidir. GAN ile kıyaslanabilir görüntü kalitesi sunarken çok daha kararlı bir eğitim sürecine sahip olduğunu kanıtlamış; böylece üretici modelleme araştırmalarının rotasını kalıcı olarak değiştirmiştir. DDPM'nin çalışma prensibi iki karşıt süreç üzerine kuruludur. İleri süreçte (forward process, q) temiz veri x₀'a T adım boyunca kademeli Gaussian gürültü eklenir; β_t parametresiyle kontrol edilen bu süreç sonunda veri, N(0,I) dağılımına — yani saf gürültüye — dönüşür. T değeri genellikle 1.000 olarak seçilir; lineer ya da kosinüs gürültü çizelgesi kullanılır. Kosinüs çizelgesi, son adımlarda aşırı gürültüden kaynaklanan kalite kayıplarını azaltması nedeniyle tercih edilir. Ters süreçte (reverse process, p_θ) ise eğitilmiş bir sinir ağı, gürültülü örnekten başlayarak gerçek veri dağılımını adım adım kurtarır. Bu aşamada U-Net mimarisi her adımda eklenen gürültüyü (ε) tahmin eder; kayıp fonksiyonu sadeleştirilerek basit bir ortalama kare hata formuna, L = E[||ε - ε_θ(x_t, t)||²] biçimine indirgenir. U-Net, zaman adımını sinüs pozisyonel gömme olarak aldığından aynı ağırlıklar T farklı gürültü seviyesinde çalışabilir. Böylece eğitim süreci kararlı hale gelir ve GAN'larda sık görülen adversarial dengesizlik sorunu tamamen ortadan kalkar. DDPM'in akademik etkisi son derece geniştir. DDIM (Song ve ark., 2020) belirleyici örnekleme ile adım sayısını 50'ye indirdi; LDM ve Stable Diffusion gizli uzay üzerinde çalışarak hesaplama maliyetini yaklaşık 48 kat azalttı. DALL-E 2, Imagen ve günümüzdeki Flux modelleri metin-görüntü eşleştirmeyi mükemmelleştirdi. Video, ses ve protein tasarımı alanlarına uyarlanan mimariler de DDPM'in temel ε-prediction formülasyonunu devralmıştır. Görüntü oluşturmanın ötesinde, DDPM'den türeyen modeller ilaç keşfi, iklim modelleme ve ses sentezinde de giderek yaygınlaşmaktadır.

arrow_forward
noise_control_off

Denoising (Gürültü Giderme (Denoising))

Gürültü giderme (denoising), sinyal işleme ve makine öğreniminde bir veriden istenmeyen bozulmaları veya rastgele gürültüyü kaldırma işlemidir. Görüntü işlemede piksellerdeki rastgele varyasyonları temizlemek, seste arka plan gürültüsünü bastırmak ve zaman serisi verilerinde ani sapmalarını düzeltmek için kullanılır. Derin öğrenmede gürültü giderme özellikle iki bağlamda kritik öneme sahiptir. Birincisi, veri ön işleme: Eğitim verisi gerçek dünya kaynaklı olduğundan gürültü doğaldır; temiz veriyle eğitilen modeller genellikle daha iyi genelleme yapar. İkincisi ve daha çarpıcı olanı, difüzyon modellerinin (Diffusion Models) temel mekanizmasıdır: bu modeller bir görüntüye kademeli olarak Gaussian gürültü ekler (forward process), ardından bu gürültüyü adım adım temizlemeyi öğrenir (reverse process). DALL-E 2, Stable Diffusion ve Flux gibi modeller bu gürültü ekleme-giderme döngüsüne dayanır. Klasik gürültü giderme yöntemleri arasında Gaussian filtresi (blur), Median filtresi, Wiener filtresi ve Non-local Means bulunur. Derin öğrenme tabanlı yaklaşımlar bu yöntemlerin çok ötesine geçti: DnCNN (Denoising Convolutional Neural Network), gürültü seviyesini tahmin eden blind denoising; U-Net mimarisi temelli encoder-decoder yapılar ise piksel düzeyi hassasiyetle gürültü haritası üretir. Difüzyon modellerinde kullanılan score matching ve DDPM (Denoising Diffusion Probabilistic Model) çerçevesi, gürültü gidermeyi olasılıksal bir süreç olarak modelleyen ve T adım boyunca gürültüyü kademeli olarak azaltan yaklaşımdır. Her adımda model, ε-prediction veya x0-prediction hedefiyle eğitilir: gürültü tahmini yaparak temiz sinyale ulaşır. Bu yapı, yalnızca görüntü değil; ses sentezi (WaveNet), video üretimi ve 3D nokta bulutu oluşturma alanlarında da temel teknik olarak benimsenmiştir. DDIM örnekleyici ise az adımla deterministik gürültü giderme yaparak çıkarım hızını önemli ölçüde artırır. Latent Diffusion modelleri bu süreci VAE ile sıkıştırılmış latent uzayda yürütür; böylece piksel uzayına kıyasla hesaplama maliyeti dramatik biçimde düşer ve 512×512 görüntü üretimi tüketici GPU'larında mümkün hâle gelir. Flow Matching (Flux'un kullandığı yöntem) ise forward süreci daha kısa ve düz bir eğriyle tanımlayarak DDPM'e kıyasla hem daha hızlı hem daha kaliteli gürültü giderme yapabilmektedir.

arrow_forward
blur_on

Diffusion Model (Yayılım Modeli (Diffusion Modeli))

Diffusion modeli, veriye kademeli olarak gürültü ekleyen (ileri süreç) ve ardından bu gürültüden orijinal veriyi adım adım yeniden oluşturmayı öğrenen (ters süreç) bir üretici yapay zeka mimarisidir. Stable Diffusion, DALL-E 3, Midjourney ve Imagen gibi günümüzün en güçlü görüntü üretim sistemleri difüzyon modeline dayanmaktadır. İleri süreçte (forward process) modele verilen temiz görüntüye T adım boyunca Gaussian gürültü eklenir; sonunda görüntü tamamen gürültüye dönüşür. Bu süreç deterministik ve önceden tanımlanmıştır — öğrenme gerektirmez. Ters süreçte (reverse process) model, tamamen gürültülü bir görüntüden başlayarak her adımda biraz daha temizleyerek orijinale yakın bir görüntü üretir. Model bu ters süreci veriden öğrenir. Eğitim sırasında model, belirli bir gürültü seviyesindeki görüntüden hangi gürültünün çıkarılması gerektiğini tahmin etmeyi öğrenir. Kayıp fonksiyonu, tahmin edilen gürültü ile gerçek gürültü arasındaki ortalama kare hatası (MSE) üzerine kuruludur. Çıkarım sırasında tamamen rastgele gürültüden başlanır ve model bu tahmin sürecini T adım boyunca tekrarlayarak yeni, gerçekçi bir görüntü üretir. Metin koşullandırması (text conditioning) ise CLIP gibi bir metin kodlayıcısından gelen vektörün dikkat mekanizmasına (cross-attention) enjekte edilmesiyle gerçekleştirilir. 2020'de Ho ve arkadaşlarının DDPM (Denoising Diffusion Probabilistic Models) çalışması difüzyon modellerini öne çıkardı. Song ve arkadaşlarının DDIM'i (Denoising Diffusion Implicit Models) çıkarım adımlarını yüzlerden onlara indirerek hızlı sentezi mümkün kıldı. Rombach ve arkadaşlarının 2022'de yayımladığı Latent Diffusion Model (LDM) ise pikseller yerine VAE kodlayıcısından üretilen gizli temsil uzayında (latent space) difüzyon işlemini yürüttü; bellek ve hesaplama maliyetini önemli ölçüde düşürdü. Stable Diffusion bu yaklaşımı temel almaktadır. Difüzyon modelleri yalnızca görüntüyle sınırlı değildir: ses (AudioLDM, MusicGen), video (Sora, Gen-2), 3B molekül yapıları ve protein tasarımı (AlphaFold 3) gibi alanlarda da kullanılmaktadır. GAN'lara kıyasla eğitim kararlılığı daha yüksektir ve mod çökmesine daha az eğilimlidir; ancak çıkarım adımlarının tekrarlı uygulanması GAN'lara göre daha yavaş kalır.

arrow_forward
layers

Latent Diffusion Model (Gizil Uzay Difüzyon Modeli (Latent Diffusion))

Latent Diffusion Model (LDM), difüzyon işlemini piksel uzayı yerine sıkıştırılmış bir gizil (latent) uzayda gerçekleştiren verimli bir üretici yapay zeka mimarisidir. Robin Rombach ve arkadaşları tarafından 2022 yılında CVPR'da yayımlanan High-Resolution Image Synthesis with Latent Diffusion Models çalışmasıyla kamuoyuna tanıtılan bu yaklaşım, Stable Diffusion'ın temelini oluşturur ve modern yapay zeka görüntü üretiminin standart mimarisine dönüşmüştür. Geleneksel piksel uzayı difüzyon modellerinde (DDPM gibi) tüm hesaplama görüntünün tam boyutunda (örn. 512×512×3 = 786.432 boyut) yapılır; bu son derece hesaplama yoğundur. LDM'de ise süreç üç aşamaya ayrılır: önce bir Varyasyonel Otoenkoder (VAE) görüntüyü çok daha küçük bir gizil temsile sıkıştırır (örn. 64×64×4 = 16.384 boyut); ardından difüzyon süreci bu küçük uzayda çalışır; son olarak VAE dekoderi gizil çıktıyı tam boyutlu görüntüye dönüştürür. Bu sıkıştırma, hesaplama maliyetini piksel tabanlı difüzyona kıyasla yaklaşık 48 kat azaltır. Metin koşullandırması CLIP veya OpenCLIP metin kodlayıcısından gelen vektörlerin U-Net'in cross-attention katmanlarına enjekte edilmesiyle gerçekleşir. Kullanıcının doğal dil açıklaması, görsel uzayda karşılık bulan vektörlere dönüştürülerek görüntü oluşturma sürecini yönlendirir. Sıkıştırma ve kalite arasındaki denge, VAE'nin yeniden yapılandırma başarısına bağlıdır. LDM mimarisinin pratik etkisi devasa olmuştur: tüketici GPU'larında (4–8 GB VRAM) yüksek kaliteli görüntü üretimini mümkün kılmış, SDXL, SD3 ve FLUX.1 gibi türev modellerin gelişimini hızlandırmış, ControlNet ve LoRA gibi kişiselleştirme araçlarına zemin hazırlamıştır. Metin-görüntü üretiminin ötesinde aynı mimari ses (AudioLDM), video (VideoLDM) ve 3D içerik üretiminde de kullanılmaktadır. Türkiye'de grafik tasarım, reklam ve oyun sektörlerinde LDM tabanlı araçların kullanımı 2024-2025 yıllarında belirgin biçimde artmıştır. Gelecekte latent uzay tekniklerinin 3D sahnelere, moleküler yapılara ve ilaç tasarımına genişletilmesi araştırmacılar tarafından aktif olarak incelenmektedir.

arrow_forward
movie

Stable Video Diffusion (Stable Video Diffusion)

Stable Video Diffusion (SVD), Stability AI'ın Kasım 2023'te açık ağırlıklarla yayımladığı, tek bir kaynak görüntüden kısa video klipleri üreten üretken video modelidir. Model, Stable Diffusion 2.1'in latent difüzyon mimarisini temel alır ve U-Net'teki her uzamsal katmanın ardına zamansal evrişim ile zamansal dikkat (temporal attention) katmanları ekleyerek tek tek kareler yerine kare dizilerini gizil uzayda üretir. Kaynak görüntü iki kanaldan koşullandırma olarak verilir: CLIP görüntü kodlayıcısından çıkan gömme çapraz dikkat yoluyla ağa beslenir, görüntünün VAE ile sıkıştırılmış latent temsili ise gürültülü kare latentlerine kanal ekseninde eklenir. Böylece üretilen klip hem kaynak görüntünün kimliğini korur hem de öğrenilmiş hareket dinamiklerini taşır. Modelin iki çeşidi vardır: SVD 14 kare, genişletilmiş SVD-XT ise 25 kare üretir; her ikisi de 1024×576 (16:9) çözünürlükte çalışır. Şubat 2024'te yayımlanan SVD-XT 1.1, aynı çözünürlükte daha tutarlı çıktı için ince ayarlanmış sürümdür. Üretim üç mikro koşullandırma parametresiyle yönlendirilir: fps_id kare hızını, motion_bucket_id (0-255) hareket yoğunluğunu, cond_aug ya da augmentation_strength ise kaynak görüntüye eklenen gürültü miktarını belirler. SVD makalesinin asıl katkısı eğitim reçetesidir. Ekip; görüntü ön eğitimi, büyük ölçekli video ön eğitimi ve yüksek kaliteli video ince ayarı olmak üzere üç aşamalı bir süreç tanımlar. Kesme tespiti, optik akış ile durağan klip eleme ve otomatik altyazılama içeren titiz veri küratörlüğünün nihai kaliteyi en az mimari kadar etkilediğini deneysel olarak gösterir. Aynı taban model daha sonra çoklu görünüm sentezine (SV3D) ve dinamik 3B üretime (SV4D) uyarlanmıştır. Sora, Veo, Kling ve Runway gibi kapalı modeller ile Wan, HunyuanVideo ve LTX-Video gibi yeni açık modeller süre ve kalite açısından SVD'yi geride bıraktı. Yine de SVD; ComfyUI ve Diffusers entegrasyonu, 12-24 GB VRAM ile çalışabilmesi ve kolay ince ayar olanağıyla görüntüden video araştırmalarında ve yerel prototiplemede referans model olmayı sürdürüyor.

arrow_forward
account_tree

U-Net (U-Net Mimarisi)

U-Net, Olaf Ronneberger ve arkadaşları tarafından 2015 yılında tıbbi görüntü segmentasyonu için geliştirilen, encoder-decoder yapısını simetrik atlama bağlantılarıyla (skip connections) birleştiren bir evrişimli sinir ağı mimarisidir. "U-Net: Convolutional Networks for Biomedical Image Segmentation" adlı makaleyle MICCAI 2015'te sunulan bu mimari, tek bir GPU'da saatler içinde eğitilebilmesi ve az etiketli veriyle çalışabilmesiyle dikkat çekti. Bugün hem tıbbi görüntü analizinin hem de difüzyon tabanlı görüntü üretiminin standart bileşeni hâline gelmiştir. Mimari iki simetrik koldan oluşur ve U harfi şeklindeki diyagramından adını alır. Encoder (daralma yolu), bir dizi konvolüsyon bloğu ve max-pooling katmanıyla görüntüden giderek soyutlanan özellikler çıkarır; her katmanda uzamsal boyut yarıya iner, kanal sayısı iki katına çıkar (ör. 64→128→256→512). Decoder (genişleme yolu), transposed convolution veya bilinear upsampling ile uzamsal boyutu kademeli olarak geri kazanır. Her çözünürlük seviyesinde encoder çıkışı, decoder girişiyle kanala göre birleştirilerek (concatenate) hem ince mekânsal ayrıntılar hem de derin anlambilimsel bilgi eş zamanlı korunur — bu skip connections mimarinin temel yeniliğidir. U-Net'in kritik özelliklerinden biri az etiketli veriyle güçlü sonuçlar üretebilmesidir. Orijinal çalışmada yalnızca 30 eğitim görüntüsüyle rekabetçi segmentasyon başarısı elde edildi; elastic deformation ve ağır veri artırma (data augmentation) bu başarıda belirleyici rol oynadı. Mimari her piksel için sınıf etiketi ürettiğinden "tam evrişimli" (fully convolutional) kategorisine girer; sabit boyutlu giriş kısıtı yoktur ve farklı çözünürlüklerdeki görüntülere doğrudan uygulanabilir. Zaman içinde birçok türev mimari geliştirildi: Attention U-Net gürültülü bağlamlarda yalnızca ilgili özellikleri vurgulayan dikkat kapıları ekler; nnU-Net medikal veri kümelerini otomatik yapılandırır; 3D U-Net hacimsel MRI ve BT verilerini işler; Swin-UNet transformatör bloklarını U şekliyle birleştirir. 2020'den itibaren DDPM ve Stable Diffusion gibi difüzyon modellerinin gürültü tahmin ağı (ε-network) olarak U-Net'i benimsemesi, mimarinin görüntü üretimi alanındaki önemini de pekiştirdi.

arrow_forward