Vision Transformer (ViT) (Görüntü Transformer)

Görüntüleri yamalara bölerek Transformer mimarisini doğrudan bilgisayarlı görüye uygulayan, CNN'e meydan okuyan derin öğrenme modeli.

Vision Transformer (ViT), 2020 yılında Google Brain ekibi tarafından yayımlanan "An Image is Worth 16x16 Words" makalesiyle tanıtılan ve görüntü işleme alanında Transformer mimarisini merkeze alan çığır açıcı bir derin öğrenme modelidir. CNN'lerin (Evrişimli Sinir Ağları) onlarca yıl boyunca hâkim olduğu bilgisayarlı görü alanında ViT, bu paradigmayı kökten değiştirmiştir. ViT'in temel çalışma ilkesi görüntüyü sabit boyutlu yamalar (patch) dizisine bölmektir. Örneğin 224×224 piksellik bir görüntü, 16×16 boyutunda 196 yamaya ayrılır; her yama düzleştirilerek (flatten) doğrusal bir projeksiyon katmanından geçirilir ve D-boyutlu bir gömme vektörüne dönüştürülür. Sınıflandırma için öğrenilebilir bir [CLS] tokeni eklenir; tüm yamalara pozisyonel kodlama uygulanarak sıralamanın kaybolması önlenir. Bu vektör dizisi standart Transformer encoder bloklarına — çok başlı öz-dikkat ve ileri beslemeli ağ katmanlarına — beslenir. Çıkışta [CLS] tokeninin gömme vektörü bir MLP kafasına verilerek görüntü sınıfı tahmin edilir. CNN'lerden temel farkı, uzamsal tümevarımsal önyargı (inductive bias) taşımamasıdır. CNN yerel evrişimler ve paylaşımlı ağırlıklarla bu önyargıyı yapıya kodlarken ViT tüm bu örüntüleri veriden öğrenir; bu yüzden JFT-300M gibi çok büyük veri kümelerinde ön eğitim gerektirir. DeiT mimarisi öğretmen-öğrenci damıtma ile bu gereksinimi ImageNet ölçeğine indirmiştir. Başlıca varyantlar arasında Swin Transformer (kayan pencereli dikkat ile hiyerarşik özellik haritaları), BEiT ve MAE (maskeli ön eğitim), DINOv2 (öz-süpervizyon) ve SAM/SAM2 (evrensel segmentasyon) sayılabilir. Nesne tespitinde DETR, semantik segmentasyonda SegFormer, görsel-dilsel temel modellerde CLIP ve Flamingo ViT'i omurga olarak kullanmaktadır. ViT'in dikkat ısı haritaları yorumlanabilirliği artırır: hangi yamaların sınıflandırma kararını etkilediği görselleştirilebilir. Tıbbi görüntülemede, uydu görüntüsü analizinde, otonom araç algı sistemlerinde ve çok-kipli (multimodal) büyük modellerde ViT vazgeçilmez bir bileşen haline gelmiştir. 36.000'i aşkın atıf sayısıyla bu makale, bilgisayarlı görünün en etkili çalışmaları arasına girmiştir.

Temel Çalışma Prensibi

ViT, görüntüyü N adet sabit boyutlu yamaya (örneğin 16×16 piksel) böler. Her yama düzleştirilerek (flatten) bir D-boyutlu vektöre projeksiyon yapılır. Bu vektörlere öğrenilebilir bir [CLS] token eklenir ve konum gömmeleri (1D pozisyonel embedding) uygulanır. Elde edilen sekans, standart Transformer encoder bloklarına gönderilir; çıkışta [CLS] tokenının gömme vektörü sınıflandırma kafasına (MLP head) beslenerek görüntü kategorisi tahmin edilir.

Neden CNN'den Farklı?

Evrişimli sinir ağları (CNN), yerel alıcı alanlar ve paylaşımlı ağırlıklar aracılığıyla uzamsal tümevarımsal önyargıyı doğrudan yapıya kodlar. ViT ise bu önyargıyı taşımaz; öz-dikkat mekanizmasıyla tüm yama çiftleri arasındaki ilişkiyi küresel düzeyde öğrenir. Bu, CNN'in yerel örüntü çıkarımına karşılık ViT'in uzun menzilli bağımlılıkları çok daha erken katmanlarda yakaladığı anlamına gelir. Ancak söz konusu esneklik çok büyük miktarda eğitim verisi gerektirmektedir.

Başlıca Varyantlar

ViT-Ti (Tiny), ViT-S (Small), ViT-B/16 (Base), ViT-L/16 (Large) ve ViT-H/14 (Huge) olmak üzere farklı ölçek seçenekleri mevcuttur. DeiT, öğretmen-öğrenci damıtma ile ImageNet'te CNN rekabetine ulaşır. Swin Transformer, kayan yerel pencereler ve yama birleştirme ile hiyerarşik özellik haritaları üretir ve çok ölçekli görevler için standart omurga konumundadır. BEiT ve MAE maskeli ön eğitim stratejileri kullanır; DINOv2 ise öz-süpervizyon ile güçlü görsel özellikler öğrenir.

Uygulama Alanları

Görüntü sınıflandırmanın ötesinde ViT tabanlı modeller; nesne tespitinde DETR ile, semantik segmentasyonda SegFormer ile, görsel-dilsel sistemlerde CLIP ve Flamingo ile kullanılmaktadır. SAM (Segment Anything Model) ve SAM2, ViT'i evrensel segmentasyon için arka omurga olarak benimsemektedir. Tıbbi görüntülemede, uydu görüntüsü analizinde, otonom araç algı sistemlerinde ve çok-kipli büyük modellerde de geniş uygulama alanı bulunmaktadır.

Sınırlamalar ve Çözümler

ViT'in başlıca sınırlamaları şunlardır: büyük ölçekli ön eğitim verisi gereksinimi, dikkat mekanizmasının karesel hesaplama karmaşıklığı ve tek çözünürlüklü yama yapısının çok ölçekli görevlerde yetersiz kalması. Bu sorunlara yanıt olarak FlashAttention verimli dikkat hesabını, Swin Transformer hiyerarşik yapıyı ve DeiT damıtma yöntemini ortaya koymuştur. MobileViT gibi hafif varyantlar kenar (edge) cihazlarda çalışmayı mümkün kılmaktadır.

Endüstri Etkisi

ViT makalesi 36.000'in üzerinde atıfla bilgisayarlı görünün en etkili çalışmalarından biri konumuna yükselmiştir. Google, Meta, Microsoft ve OpenAI gibi şirketler ViT tabanlı mimarileri temel modellerinde kullanmaktadır. DINOv2 (Meta) etiket gerektirmeden güçlü görsel özellikler üretirken; CLIP, görsel arama ve sıfır-atışlı sınıflandırmanın temelini oluşturmaktadır.

Sık Sorulan Sorular

  • check_circle ViT ile CNN arasındaki temel fark nedir? CNN yerel evrişim filtreleri kullanırken ViT, görüntüyü yamalara bölerek global öz-dikkat mekanizmasıyla tüm yama çiftleri arasındaki ilişkiyi doğrudan öğrenir.
  • check_circle ViT neden büyük veri seti gerektirir? CNN'lerin aksine ViT, uzamsal tümevarımsal önyargı taşımaz; yerellik ve öteleme değişmezliği gibi örüntüleri veriden öğrenmek için çok daha fazla örneğe ihtiyaç duyar.
  • check_circle Swin Transformer ne işe yarar? Swin Transformer, kayan yerel pencere dikkati ve yama birleştirme ile hiyerarşik özellik haritaları üretir; nesne tespiti ve segmentasyon gibi çok ölçekli görevlerde standart ViT'e üstünlük sağlar.
  • check_circle ViT hangi uygulamalarda kullanılır? Görüntü sınıflandırma, nesne tespiti, semantik segmentasyon, tıbbi görüntüleme, uydu analizi ve görsel-dilsel temel modeller (CLIP, SAM) başlıca uygulama alanlarıdır.