tag VAE

Latent Diffusion Model (Gizil Uzay Difüzyon Modeli (Latent Diffusion))

Bu sayfada VAE (Latent Diffusion Model (Gizil Uzay Difüzyon Modeli (Latent Diffusion))) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

Latent Diffusion Model (LDM), difüzyon işlemini piksel uzayı yerine sıkıştırılmış bir gizil (latent) uzayda gerçekleştiren verimli bir üretici yapay zeka mimarisidir. Robin Rombach ve arkadaşları tarafından 2022 yılında yayımlanan "High-Resolution Image Synthesis with Latent Diffusion Models" makalesiyle tanıtılan bu mimari, Stable Diffusion'ın temelini oluşturur. Geleneksel piksel uzayı difüzyon modellerinde (DDPM gibi) tüm hesaplama, görüntünün tam boyutunda (örn. 512×512×3 = 786.432 boyut) yapılır. Bu son derece hesaplama yoğundur. LDM'de ise önce bir Varyasyonel Otoenkoder (VAE) görüntüyü çok daha küçük bir gizil temsile sıkıştırır (örn. 64×64×4 = 16.384 boyut); difüzyon süreci bu küçük uzayda çalışır; sonunda VAE dekoderi gizil uzay çıktısını tam boyutlu görüntüye dönüştürür. Bu yaklaşım, hesaplama maliyetini piksel tabanlı difüzyona kıyasla yaklaşık 48 kat azaltır. Metin koşullandırması, CLIP veya OpenCLIP metin kodlayıcısından gelen vektörlerin U-Net'in cross-attention katmanlarına enjekte edilmesiyle sağlanır. Sıkıştırma ve kalite arasındaki denge, VAE'nin yeniden yapılandırma başarısına bağlıdır.

layers

Latent Diffusion Model (Gizil Uzay Difüzyon Modeli (Latent Diffusion))

Latent Diffusion Model (LDM), difüzyon işlemini piksel uzayı yerine sıkıştırılmış bir gizil (latent) uzayda gerçekleştiren verimli bir üretici yapay zeka mimarisidir. Robin Rombach ve arkadaşları tarafından 2022 yılında yayımlanan "High-Resolution Image Synthesis with Latent Diffusion Models" makalesiyle tanıtılan bu mimari, Stable Diffusion'ın temelini oluşturur. Geleneksel piksel uzayı difüzyon modellerinde (DDPM gibi) tüm hesaplama, görüntünün tam boyutunda (örn. 512×512×3 = 786.432 boyut) yapılır. Bu son derece hesaplama yoğundur. LDM'de ise önce bir Varyasyonel Otoenkoder (VAE) görüntüyü çok daha küçük bir gizil temsile sıkıştırır (örn. 64×64×4 = 16.384 boyut); difüzyon süreci bu küçük uzayda çalışır; sonunda VAE dekoderi gizil uzay çıktısını tam boyutlu görüntüye dönüştürür. Bu yaklaşım, hesaplama maliyetini piksel tabanlı difüzyona kıyasla yaklaşık 48 kat azaltır. Metin koşullandırması, CLIP veya OpenCLIP metin kodlayıcısından gelen vektörlerin U-Net'in cross-attention katmanlarına enjekte edilmesiyle sağlanır. Sıkıştırma ve kalite arasındaki denge, VAE'nin yeniden yapılandırma başarısına bağlıdır.

arrow_forward
bubble_chart

Latent Uzay (Latent Uzay)

Latent Uzay (Latent Space), bir sinir ağının ham girdi verilerini sıkıştırarak kodladığı düşük boyutlu, sürekli ve anlamlı iç temsil uzayıdır. 'Latent' kelimesinin anlamı 'gizli'dir; uzay, modelin hammadde gürültüsünü soyutlayarak veriyi açıklayan temel faktörleri yansıtır. Modern üretken yapay zekanın merkezi kavramlarından biridir. Latent uzay kavramı önce otokodlayıcılarda (autoencoder) somutlaştı. Kodlayıcı (encoder), ham girdiyi daha az boyutlu latent vektöre sıkıştırır; çözücü (decoder) bu vektörü orijinal girdiyi yeniden oluşturmak üzere genişletir. Modelin öğrendiği latent boyutlar genellikle yorumlanabilir anlam taşır: yüz görüntüleri için yaş, ışık yönü veya ifade gibi faktörler latent boyutlara karşılık gelebilir. Varyasyonel otokodlayıcılar (VAE), latent uzayı sürekli ve düzenli kılmak için belirleyici nokta yerine olasılık dağılımı (Gaussian) kodlar. Bu yaklaşım latent uzayın örnekleme yoluyla yeni veri üretimi için kullanılmasını mümkün kılar. İki latent vektör arasında interpolasyon yapılarak iki yüz arasında sorunsuz geçiş üretilebilir. Difüzyon modelleri latent uzayı farklı biçimde kullanır: Stable Diffusion gibi modeller piksel uzayında değil sıkıştırılmış latent uzayda gürültü ekleme ve giderme işlemi gerçekleştirir; bu yöntem 'latent difüzyon' olarak bilinir ve hesaplama maliyetini dramatik biçimde düşürür. Embedding uzayları da latent uzayın bir türüdür: kelime veya cümle gömmeleri dilbilgisel ve anlamsal özellikleri temsil eden latent koordinatlar içerir. Semantik aritmetik ('king' - 'man' + 'woman' ≈ 'queen') bu yapının somut göstergesidir.

arrow_forward