tag image-recognition

Vision Transformer (ViT) (Görüntü Transformer)

Bu sayfada image-recognition (Vision Transformer (ViT) (Görüntü Transformer)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Vision Transformer (ViT), 2020 yılında Google Brain ekibi tarafından yayımlanan "An Image is Worth 16x16 Words" makalesiyle tanıtılan ve görüntü işleme alanında Transformer mimarisini merkeze alan çığır açıcı bir derin öğrenme modelidir. CNN'lerin (Evrişimli Sinir Ağları) onlarca yıl boyunca hâkim olduğu bilgisayarlı görü alanında ViT, bu paradigmayı kökten değiştirmiştir. ViT'in temel çalışma ilkesi görüntüyü sabit boyutlu yamalar (patch) dizisine bölmektir. Örneğin 224×224 piksellik bir görüntü, 16×16 boyutunda 196 yamaya ayrılır; her yama düzleştirilerek (flatten) doğrusal bir projeksiyon katmanından geçirilir ve D-boyutlu bir gömme vektörüne dönüştürülür. Sınıflandırma için öğrenilebilir bir [CLS] tokeni eklenir; tüm yamalara pozisyonel kodlama uygulanarak sıralamanın kaybolması önlenir. Bu vektör dizisi standart Transformer encoder bloklarına — çok başlı öz-dikkat ve ileri beslemeli ağ katmanlarına — beslenir. Çıkışta [CLS] tokeninin gömme vektörü bir MLP kafasına verilerek görüntü sınıfı tahmin edilir. CNN'lerden temel farkı, uzamsal tümevarımsal önyargı (inductive bias) taşımamasıdır. CNN yerel evrişimler ve paylaşımlı ağırlıklarla bu önyargıyı yapıya kodlarken ViT tüm bu örüntüleri veriden öğrenir; bu yüzden JFT-300M gibi çok büyük veri kümelerinde ön eğitim gerektirir. DeiT mimarisi öğretmen-öğrenci damıtma ile bu gereksinimi ImageNet ölçeğine indirmiştir. Başlıca varyantlar arasında Swin Transformer (kayan pencereli dikkat ile hiyerarşik özellik haritaları), BEiT ve MAE (maskeli ön eğitim), DINOv2 (öz-süpervizyon) ve SAM/SAM2 (evrensel segmentasyon) sayılabilir. Nesne tespitinde DETR, semantik segmentasyonda SegFormer, görsel-dilsel temel modellerde CLIP ve Flamingo ViT'i omurga olarak kullanmaktadır. ViT'in dikkat ısı haritaları yorumlanabilirliği artırır: hangi yamaların sınıflandırma kararını etkilediği görselleştirilebilir. Tıbbi görüntülemede, uydu görüntüsü analizinde, otonom araç algı sistemlerinde ve çok-kipli (multimodal) büyük modellerde ViT vazgeçilmez bir bileşen haline gelmiştir. 36.000'i aşkın atıf sayısıyla bu makale, bilgisayarlı görünün en etkili çalışmaları arasına girmiştir.

code_blocks

Vision Transformer (ViT) (Görüntü Transformer)

Vision Transformer (ViT), 2020 yılında Google Brain ekibi tarafından yayımlanan "An Image is Worth 16x16 Words" makalesiyle tanıtılan ve görüntü işleme alanında Transformer mimarisini merkeze alan çığır açıcı bir derin öğrenme modelidir. CNN'lerin (Evrişimli Sinir Ağları) onlarca yıl boyunca hâkim olduğu bilgisayarlı görü alanında ViT, bu paradigmayı kökten değiştirmiştir. ViT'in temel çalışma ilkesi görüntüyü sabit boyutlu yamalar (patch) dizisine bölmektir. Örneğin 224×224 piksellik bir görüntü, 16×16 boyutunda 196 yamaya ayrılır; her yama düzleştirilerek (flatten) doğrusal bir projeksiyon katmanından geçirilir ve D-boyutlu bir gömme vektörüne dönüştürülür. Sınıflandırma için öğrenilebilir bir [CLS] tokeni eklenir; tüm yamalara pozisyonel kodlama uygulanarak sıralamanın kaybolması önlenir. Bu vektör dizisi standart Transformer encoder bloklarına — çok başlı öz-dikkat ve ileri beslemeli ağ katmanlarına — beslenir. Çıkışta [CLS] tokeninin gömme vektörü bir MLP kafasına verilerek görüntü sınıfı tahmin edilir. CNN'lerden temel farkı, uzamsal tümevarımsal önyargı (inductive bias) taşımamasıdır. CNN yerel evrişimler ve paylaşımlı ağırlıklarla bu önyargıyı yapıya kodlarken ViT tüm bu örüntüleri veriden öğrenir; bu yüzden JFT-300M gibi çok büyük veri kümelerinde ön eğitim gerektirir. DeiT mimarisi öğretmen-öğrenci damıtma ile bu gereksinimi ImageNet ölçeğine indirmiştir. Başlıca varyantlar arasında Swin Transformer (kayan pencereli dikkat ile hiyerarşik özellik haritaları), BEiT ve MAE (maskeli ön eğitim), DINOv2 (öz-süpervizyon) ve SAM/SAM2 (evrensel segmentasyon) sayılabilir. Nesne tespitinde DETR, semantik segmentasyonda SegFormer, görsel-dilsel temel modellerde CLIP ve Flamingo ViT'i omurga olarak kullanmaktadır. ViT'in dikkat ısı haritaları yorumlanabilirliği artırır: hangi yamaların sınıflandırma kararını etkilediği görselleştirilebilir. Tıbbi görüntülemede, uydu görüntüsü analizinde, otonom araç algı sistemlerinde ve çok-kipli (multimodal) büyük modellerde ViT vazgeçilmez bir bileşen haline gelmiştir. 36.000'i aşkın atıf sayısıyla bu makale, bilgisayarlı görünün en etkili çalışmaları arasına girmiştir.

arrow_forward