tag UNet
Bu sayfada UNet etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.
U-Net, Olaf Ronneberger ve arkadaşları tarafından 2015 yılında tıbbi görüntü segmentasyonu için geliştirilen, encoder-decoder yapısını simetrik atlama bağlantılarıyla (skip connections) birleştiren bir evrişimli sinir ağı mimarisidir. "U-Net: Convolutional Networks for Biomedical Image Segmentation" adlı makaleyle MICCAI 2015'te sunulan bu mimari, tek bir GPU'da saatler içinde eğitilebilmesi ve az etiketli veriyle çalışabilmesiyle dikkat çekti. Bugün hem tıbbi görüntü analizinin hem de difüzyon tabanlı görüntü üretiminin standart bileşeni hâline gelmiştir. Mimari iki simetrik koldan oluşur ve U harfi şeklindeki diyagramından adını alır. Encoder (daralma yolu), bir dizi konvolüsyon bloğu ve max-pooling katmanıyla görüntüden giderek soyutlanan özellikler çıkarır; her katmanda uzamsal boyut yarıya iner, kanal sayısı iki katına çıkar (ör. 64→128→256→512). Decoder (genişleme yolu), transposed convolution veya bilinear upsampling ile uzamsal boyutu kademeli olarak geri kazanır. Her çözünürlük seviyesinde encoder çıkışı, decoder girişiyle kanala göre birleştirilerek (concatenate) hem ince mekânsal ayrıntılar hem de derin anlambilimsel bilgi eş zamanlı korunur — bu skip connections mimarinin temel yeniliğidir. U-Net'in kritik özelliklerinden biri az etiketli veriyle güçlü sonuçlar üretebilmesidir. Orijinal çalışmada yalnızca 30 eğitim görüntüsüyle rekabetçi segmentasyon başarısı elde edildi; elastic deformation ve ağır veri artırma (data augmentation) bu başarıda belirleyici rol oynadı. Mimari her piksel için sınıf etiketi ürettiğinden "tam evrişimli" (fully convolutional) kategorisine girer; sabit boyutlu giriş kısıtı yoktur ve farklı çözünürlüklerdeki görüntülere doğrudan uygulanabilir. Zaman içinde birçok türev mimari geliştirildi: Attention U-Net gürültülü bağlamlarda yalnızca ilgili özellikleri vurgulayan dikkat kapıları ekler; nnU-Net medikal veri kümelerini otomatik yapılandırır; 3D U-Net hacimsel MRI ve BT verilerini işler; Swin-UNet transformatör bloklarını U şekliyle birleştirir. 2020'den itibaren DDPM ve Stable Diffusion gibi difüzyon modellerinin gürültü tahmin ağı (ε-network) olarak U-Net'i benimsemesi, mimarinin görüntü üretimi alanındaki önemini de pekiştirdi.
DDPM (Gürültü Giderme Difüzyon Olasılık Modeli)
DDPM (Denoising Diffusion Probabilistic Models), Jonathan Ho ve arkadaşları tarafından 2020 yılında yayımlanan ve NeurIPS 2020'de sunulan, modern difüzyon modellerinin temelini atan çığır açıcı bir üretici yapay zeka modelidir. GAN ile kıyaslanabilir görüntü kalitesi sunarken çok daha kararlı bir eğitim sürecine sahip olduğunu kanıtlamış; böylece üretici modelleme araştırmalarının rotasını kalıcı olarak değiştirmiştir. DDPM'nin çalışma prensibi iki karşıt süreç üzerine kuruludur. İleri süreçte (forward process, q) temiz veri x₀'a T adım boyunca kademeli Gaussian gürültü eklenir; β_t parametresiyle kontrol edilen bu süreç sonunda veri, N(0,I) dağılımına — yani saf gürültüye — dönüşür. T değeri genellikle 1.000 olarak seçilir; lineer ya da kosinüs gürültü çizelgesi kullanılır. Kosinüs çizelgesi, son adımlarda aşırı gürültüden kaynaklanan kalite kayıplarını azaltması nedeniyle tercih edilir. Ters süreçte (reverse process, p_θ) ise eğitilmiş bir sinir ağı, gürültülü örnekten başlayarak gerçek veri dağılımını adım adım kurtarır. Bu aşamada U-Net mimarisi her adımda eklenen gürültüyü (ε) tahmin eder; kayıp fonksiyonu sadeleştirilerek basit bir ortalama kare hata formuna, L = E[||ε - ε_θ(x_t, t)||²] biçimine indirgenir. U-Net, zaman adımını sinüs pozisyonel gömme olarak aldığından aynı ağırlıklar T farklı gürültü seviyesinde çalışabilir. Böylece eğitim süreci kararlı hale gelir ve GAN'larda sık görülen adversarial dengesizlik sorunu tamamen ortadan kalkar. DDPM'in akademik etkisi son derece geniştir. DDIM (Song ve ark., 2020) belirleyici örnekleme ile adım sayısını 50'ye indirdi; LDM ve Stable Diffusion gizli uzay üzerinde çalışarak hesaplama maliyetini yaklaşık 48 kat azalttı. DALL-E 2, Imagen ve günümüzdeki Flux modelleri metin-görüntü eşleştirmeyi mükemmelleştirdi. Video, ses ve protein tasarımı alanlarına uyarlanan mimariler de DDPM'in temel ε-prediction formülasyonunu devralmıştır. Görüntü oluşturmanın ötesinde, DDPM'den türeyen modeller ilaç keşfi, iklim modelleme ve ses sentezinde de giderek yaygınlaşmaktadır.
Semantic Segmentation (Semantik Bölütleme)
Semantik bölütleme (semantic segmentation), bir görüntüdeki her pikseli belirli bir anlam kategorisiyle etiketleyen bilgisayarla görme görevidir. Nesne tespitinin sınırlayıcı kutular ürettiği ve örnek bölütlemenin aynı sınıftaki nesneleri birbirinden ayırt ettiği aksine; semantik bölütleme pikselleri sınıf düzeyinde sınıflandırır. Çıktı, her piksel için atanmış bir sınıf etiketinden oluşan yoğun bir haritadır. Bu görev, 2014 yılında UC Berkeley'den Long ve arkadaşları tarafından önerilen Tamamen Evrişimli Ağlar (FCN) ile derin öğrenme ekosisteminde köklü bir dönüşüm yaşadı. FCN, kesin piksel tahminlerini üretebilen ilk uçtan uca eğitilebilir mimari olarak kabul edilir; tam bağlantılı katmanları evrişimli katmanlarla değiştirerek değişken boyutlu girdi alabilir hâle geldi. 2015 yılında tıbbi görüntüleme için geliştirilen U-Net, simetrik kodlayıcı-kod çözücü yapısına atlama bağlantıları ekleyerek konumsal bilginin korunmasını sağladı; az örnekli veri kümelerinde bile yüksek başarım gösterdi. Google Brain'in DeepLab serisi, atrous (genişletilmiş) evrişim ile alıcı alanı büyüterek çok ölçekli bağlamı yakaladı. DeepLabV3+ (2018), ayrıntılı bir kod çözücü ekleyerek sınır piksellerindeki doğruluğu belirgin biçimde iyileştirdi. Günümüzde SegFormer ve Mask2Former gibi transformer tabanlı mimariler, küresel dikkat mekanizmasıyla uzun mesafeli bağımlılıkları yakalıyor ve semantik, örnek ile panoramik bölütlemeyi tek yapıda birleştiriyor. Başarım ölçütü olarak mIoU (Mean Intersection over Union) kullanılır. Cityscapes (19 kentsel sınıf), ADE20K (150+ sınıf) ve PASCAL VOC (21 sınıf) temel kıyaslama veri kümeleridir. Özerk araçlar, tıbbi görüntüleme, uydu fotoğrafı analizi ve endüstriyel kalite denetimi en yaygın uygulama alanlarıdır. Gerçek zamanlı çalışması gereken otonom araç sistemlerinde model boyutu ile çıkarım hızı arasındaki denge kritik bir tasarım kararı olmayı sürdürmektedir. Veri etiketleme maliyeti yüksek olduğundan zayıf ve yarı denetimli öğrenme yöntemleri araştırmacılar arasında giderek daha fazla ilgi görmektedir.
U-Net (U-Net Mimarisi)
U-Net, Olaf Ronneberger ve arkadaşları tarafından 2015 yılında tıbbi görüntü segmentasyonu için geliştirilen, encoder-decoder yapısını simetrik atlama bağlantılarıyla (skip connections) birleştiren bir evrişimli sinir ağı mimarisidir. "U-Net: Convolutional Networks for Biomedical Image Segmentation" adlı makaleyle MICCAI 2015'te sunulan bu mimari, tek bir GPU'da saatler içinde eğitilebilmesi ve az etiketli veriyle çalışabilmesiyle dikkat çekti. Bugün hem tıbbi görüntü analizinin hem de difüzyon tabanlı görüntü üretiminin standart bileşeni hâline gelmiştir. Mimari iki simetrik koldan oluşur ve U harfi şeklindeki diyagramından adını alır. Encoder (daralma yolu), bir dizi konvolüsyon bloğu ve max-pooling katmanıyla görüntüden giderek soyutlanan özellikler çıkarır; her katmanda uzamsal boyut yarıya iner, kanal sayısı iki katına çıkar (ör. 64→128→256→512). Decoder (genişleme yolu), transposed convolution veya bilinear upsampling ile uzamsal boyutu kademeli olarak geri kazanır. Her çözünürlük seviyesinde encoder çıkışı, decoder girişiyle kanala göre birleştirilerek (concatenate) hem ince mekânsal ayrıntılar hem de derin anlambilimsel bilgi eş zamanlı korunur — bu skip connections mimarinin temel yeniliğidir. U-Net'in kritik özelliklerinden biri az etiketli veriyle güçlü sonuçlar üretebilmesidir. Orijinal çalışmada yalnızca 30 eğitim görüntüsüyle rekabetçi segmentasyon başarısı elde edildi; elastic deformation ve ağır veri artırma (data augmentation) bu başarıda belirleyici rol oynadı. Mimari her piksel için sınıf etiketi ürettiğinden "tam evrişimli" (fully convolutional) kategorisine girer; sabit boyutlu giriş kısıtı yoktur ve farklı çözünürlüklerdeki görüntülere doğrudan uygulanabilir. Zaman içinde birçok türev mimari geliştirildi: Attention U-Net gürültülü bağlamlarda yalnızca ilgili özellikleri vurgulayan dikkat kapıları ekler; nnU-Net medikal veri kümelerini otomatik yapılandırır; 3D U-Net hacimsel MRI ve BT verilerini işler; Swin-UNet transformatör bloklarını U şekliyle birleştirir. 2020'den itibaren DDPM ve Stable Diffusion gibi difüzyon modellerinin gürültü tahmin ağı (ε-network) olarak U-Net'i benimsemesi, mimarinin görüntü üretimi alanındaki önemini de pekiştirdi.