Temel Çalışma Prensibi
ViT, görüntüyü N adet sabit boyutlu yamaya (örneğin 16×16 piksel) böler. Her yama düzleştirilerek (flatten) bir D-boyutlu vektöre projeksiyon yapılır. Bu vektörlere öğrenilebilir bir [CLS] token eklenir ve konum gömmeleri (1D pozisyonel embedding) uygulanır. Elde edilen sekans, standart Transformer encoder bloklarına gönderilir; çıkışta [CLS] tokenının gömme vektörü sınıflandırma kafasına (MLP head) beslenerek görüntü kategorisi tahmin edilir.
Neden CNN'den Farklı?
Evrişimli sinir ağları (CNN), yerel alıcı alanlar ve paylaşımlı ağırlıklar aracılığıyla uzamsal tümevarımsal önyargıyı doğrudan yapıya kodlar. ViT ise bu önyargıyı taşımaz; öz-dikkat mekanizmasıyla tüm yama çiftleri arasındaki ilişkiyi küresel düzeyde öğrenir. Bu, CNN'in yerel örüntü çıkarımına karşılık ViT'in uzun menzilli bağımlılıkları çok daha erken katmanlarda yakaladığı anlamına gelir. Ancak söz konusu esneklik çok büyük miktarda eğitim verisi gerektirmektedir.
Başlıca Varyantlar
ViT-Ti (Tiny), ViT-S (Small), ViT-B/16 (Base), ViT-L/16 (Large) ve ViT-H/14 (Huge) olmak üzere farklı ölçek seçenekleri mevcuttur. DeiT, öğretmen-öğrenci damıtma ile ImageNet'te CNN rekabetine ulaşır. Swin Transformer, kayan yerel pencereler ve yama birleştirme ile hiyerarşik özellik haritaları üretir ve çok ölçekli görevler için standart omurga konumundadır. BEiT ve MAE maskeli ön eğitim stratejileri kullanır; DINOv2 ise öz-süpervizyon ile güçlü görsel özellikler öğrenir.
Uygulama Alanları
Görüntü sınıflandırmanın ötesinde ViT tabanlı modeller; nesne tespitinde DETR ile, semantik segmentasyonda SegFormer ile, görsel-dilsel sistemlerde CLIP ve Flamingo ile kullanılmaktadır. SAM (Segment Anything Model) ve SAM2, ViT'i evrensel segmentasyon için arka omurga olarak benimsemektedir. Tıbbi görüntülemede, uydu görüntüsü analizinde, otonom araç algı sistemlerinde ve çok-kipli büyük modellerde de geniş uygulama alanı bulunmaktadır.
Sınırlamalar ve Çözümler
ViT'in başlıca sınırlamaları şunlardır: büyük ölçekli ön eğitim verisi gereksinimi, dikkat mekanizmasının karesel hesaplama karmaşıklığı ve tek çözünürlüklü yama yapısının çok ölçekli görevlerde yetersiz kalması. Bu sorunlara yanıt olarak FlashAttention verimli dikkat hesabını, Swin Transformer hiyerarşik yapıyı ve DeiT damıtma yöntemini ortaya koymuştur. MobileViT gibi hafif varyantlar kenar (edge) cihazlarda çalışmayı mümkün kılmaktadır.
Endüstri Etkisi
ViT makalesi 36.000'in üzerinde atıfla bilgisayarlı görünün en etkili çalışmalarından biri konumuna yükselmiştir. Google, Meta, Microsoft ve OpenAI gibi şirketler ViT tabanlı mimarileri temel modellerinde kullanmaktadır. DINOv2 (Meta) etiket gerektirmeden güçlü görsel özellikler üretirken; CLIP, görsel arama ve sıfır-atışlı sınıflandırmanın temelini oluşturmaktadır.
Sık Sorulan Sorular
- check_circle ViT ile CNN arasındaki temel fark nedir? CNN yerel evrişim filtreleri kullanırken ViT, görüntüyü yamalara bölerek global öz-dikkat mekanizmasıyla tüm yama çiftleri arasındaki ilişkiyi doğrudan öğrenir.
- check_circle ViT neden büyük veri seti gerektirir? CNN'lerin aksine ViT, uzamsal tümevarımsal önyargı taşımaz; yerellik ve öteleme değişmezliği gibi örüntüleri veriden öğrenmek için çok daha fazla örneğe ihtiyaç duyar.
- check_circle Swin Transformer ne işe yarar? Swin Transformer, kayan yerel pencere dikkati ve yama birleştirme ile hiyerarşik özellik haritaları üretir; nesne tespiti ve segmentasyon gibi çok ölçekli görevlerde standart ViT'e üstünlük sağlar.
- check_circle ViT hangi uygulamalarda kullanılır? Görüntü sınıflandırma, nesne tespiti, semantik segmentasyon, tıbbi görüntüleme, uydu analizi ve görsel-dilsel temel modeller (CLIP, SAM) başlıca uygulama alanlarıdır.