tag image-recognition
Vision Transformer (ViT) (Görüntü Transformer)
Bu sayfada image-recognition (Vision Transformer (ViT) (Görüntü Transformer)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
Vision Transformer (ViT), görüntü tanıma görevleri için Transformer mimarisini doğrudan uygulayan bir derin öğrenme modelidir. 2020 yılında Google Brain ekibinden Alexey Dosovitskiy ve arkadaşları tarafından "An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale" başlıklı çalışmayla tanıtılmıştır. ViT, giriş görüntüsünü sabit boyutlu yamalara (genellikle 16×16 piksel) böler. Her yama, doğrusal bir projeksiyon ile bir vektör gömmeye dönüştürülür ve konumsal bilgiyi korumak için konum gömmeleri eklenir. Bu yama gömmeleri NLP'deki token dizileri gibi işlenir ve standart bir Transformer kodlayıcısından geçirilir. Çok başlı öz-dikkat (multi-head self-attention) mekanizması sayesinde model, görüntünün herhangi iki noktası arasındaki uzun menzilli bağımlılıkları doğrudan yakalayabilir; bu CNN'lerin yerel evrişim penceresinin ötesinde bir özelliktir. ViT, ImageNet-21k veya JFT-300M gibi büyük ölçekli veri kümeleriyle ön eğitim yapıldığında ResNet ve EfficientNet gibi güçlü CNN'leri geride bırakmaktadır. Küçük veri kümelerinde ise CNN'lerin taşıdığı tümevarımsal önyargı (inductive bias) — yerellik ve öteleme değişmezliği — eksikliği nedeniyle performans düşebilir. Bu sorunu gidermek amacıyla çeşitli varyantlar geliştirilmiştir: DeiT, bilgi damıtma (knowledge distillation) ile veri verimliliğini artırırken; Swin Transformer (Microsoft, 2021), kayan pencere dikkati kullanarak hiyerarşik özellik haritaları üretir ve nesne tespiti ile segmentasyon görevlerinde üstün başarı sağlar. Günümüzde ViT tabanlı modeller, CLIP (görsel-dilsel temel model), DINOv2 (öz-denetimli görsel temel model) ve SAM2 (segment anything) gibi sistemlerin omurgasını oluşturmaktadır. Bilgisayarlı görünün temel mimarisi olarak CNN'in yerini almıştır.