Computer Vision (Bilgisayarlı Görü)

Bilgisayarların dijital görüntü ve videoları analiz ederek sınıflandırma, nesne tespiti ve segmentasyon kararları üretmesini sağlayan yapay zeka dalı.

Bilgisayarlı görü (Computer Vision), yapay zekanın dijital görüntü, video ve kameralardan gelen ham piksel verilerini anlayarak anlamlı kararlar üretmesini sağlayan dalıdır. İnsan görsel korteksinin nesne tanıma, derinlik algısı ve hareket takibi gibi yeteneklerini yazılım ve donanım kombinasyonuyla taklit etmeyi hedefler. Temel işlem hattı üç aşamada özetlenebilir: görüntü edinimi (kamera, uydu, tıbbi tarayıcı), özellik çıkarma (kenarlar, dokular, şekiller veya derin öğrenme ile öğrenilmiş gizli temsiller) ve karar verme (sınıflandırma, konumlama, segmentasyon). 2012'de AlexNet'in ImageNet yarışmasında hata oranını yüzde yirmi altıdan on altıya düşürmesi alandaki derin öğrenme devrimini başlattı. Modern bilgisayarlı görü iki ana mimari yoldan ilerler: ResNet ve EfficientNet gibi konvolüsyonel sinir ağları (CNN) görsel özellik çıkarmada standart haline gelirken, 2020'de Google Brain tarafından tanıtılan Vision Transformer (ViT) dikkat mekanizmasını görsel görevlere uyarlayarak büyük veri setlerinde CNN'lere rakip sonuçlar verdi. YOLO (You Only Look Once) serisi tek geçişli mimarisiyle gerçek zamanlı nesne tespitinde endüstri standardı konumundadır. 2023'te Meta'nın yayımladığı SAM (Segment Anything Model) sıfır atışlı segmentasyonla foundation model dönemini bilgisayarlı görüye taşıdı; CLIP (OpenAI, 2021) ise metin-görüntü çift eğitimiyle sıfır atışlı görüntü sınıflandırmasının önünü açtı. GPT-4V ve Gemini Vision gibi büyük dil modelleriyle entegre çok modlu sistemler 2024-2026 döneminde ana akıma girdi. 2026 itibarıyla SAM 2 video segmentasyonunu, Depth Anything v2 tek kamerayla piksel düzeyinde üç boyutlu derinlik çıkarmayı ve YOLO World açık-kelime nesne tespitini mümkün kılmaktadır. Pazar araştırmaları alanın 2030'a kadar yıllık yüzde yirmi beşi aşan bir büyüme oranıyla ilerleyeceğini öngörüyor. AB Yapay Zeka Yasası, kamuya açık alanlarda gerçek zamanlı biyometrik yüz tanımayı yüksek riskli yapay zeka olarak sınıflandırarak sektörde etik denetim çıtasını önemli ölçüde yükseltti.

Bilgisayarlı Görü Nasıl Çalışır?

Bilgisayarlı görü (computer vision), dijital görüntüleri ve videoları analiz ederek anlamlandıran yapay zeka dalıdır. İnsan görü sisteminin milyonlarca yıl evrim süreci boyunca geliştirdiği yetenekleri hesaplama yoluyla taklit etmeyi amaçlar. Temel iş akışı şu adımlardan oluşur: görüntü yakalama, ön işleme (boyut normalizasyonu, renk uzayı dönüşümü, gürültü giderme), özellik çıkarımı ve karar verme. 2012 öncesinde el ile tasarlanan özellik mühendisliği (HOG, SIFT, SURF) hakim yöntemdi; AlexNet'in ImageNet yarışmasını ezici üstünlükle kazanmasıyla birlikte derin öğrenme tabanlı konvolüsyonel sinir ağları (CNN) bu alanı kökünden değiştirdi. Günümüzde Vision Transformer (ViT) mimarileri CNN'lerin yerini almaya başlamıştır: görüntü yamalar (patch) halinde bölünür, her yama bir token gibi işlenir ve transformer'in öz-dikkat (self-attention) mekanizmasıyla küresel bağlam kurulur. Bu yaklaşım özellikle büyük veri setlerinde CNN'leri geride bırakmaktadır. Eğitim süreci için ImageNet (1.2M görüntü, 1000 sınıf), COCO (nesne algılama, bölütleme) ve Open Images gibi büyük ölçekli veri setleri kritik rol oynar. Transfer öğrenme ile bu veri setleri üzerinde eğitilmiş modeller, küçük domain veri setlerine ince ayar uygulanarak hızla özelleştirilir.

Temel Görev Türleri

  • check_circle Görüntü Sınıflandırma: Bir görüntünün hangi sınıfa ait olduğunu belirler. ResNet, EfficientNet ve ViT bu görevde referans modellerdir.
  • check_circle Nesne Algılama (Object Detection): Görüntüdeki nesnelerin konumunu (sınırlı kutu) ve sınıfını aynı anda tahmin eder. YOLO ailesi gerçek zamanlı algılamada standarttır.
  • check_circle Anlamsal Bölütleme (Semantic Segmentation): Her pikseli bir sınıfa atar; otonom sürüşte yol, araç ve yaya bölgeleri bu yöntemle ayırt edilir.
  • check_circle Örnek Bölütleme (Instance Segmentation): Aynı sınıftan birden fazla nesneyi piksel düzeyinde birbirinden ayırır. Mask R-CNN bu görev için temel referanstır.
  • check_circle Anahtar Nokta Tahmini: İnsan iskelet tespiti veya yüz landmark algılama gibi görevlerde bedenin veya nesnenin kritik noktalarını tahmin eder.

Öne Çıkan Mimariler

  • check_circle ResNet / EfficientNet: Kalıntı bağlantıları (residual connections) ile derin CNN eğitimini mümkün kılan mimari ailesi; görüntü sınıflandırmada uzun süre referans oldu.
  • check_circle YOLO (v5-v11): Gerçek zamanlı nesne algılama için tek geçişli (one-shot) mimari; edge cihazlarda ve güvenlik kameralarında yaygın.
  • check_circle Vision Transformer (ViT): Görüntüyü yamalar halinde işleyen transformer mimarisi; büyük veri setlerinde CNN'leri geride bırakır.
  • check_circle SAM (Segment Anything Model): Meta'nın geliştirdiği, herhangi bir nesneyi interaktif prompt ile bölütleyebilen temel görüntü modeli.
  • check_circle CLIP (OpenAI): Görüntü ve metin çiftleri üzerinde eğitilen contrastive model; sıfır-atışlı sınıflandırma ve görüntü aramada standart haline gelmiştir.

Kullanım Alanları

Bilgisayarlı görünün uygulama yelpazesi son derece geniştir. Sağlıkta bilgisayarlı tomografi, MRI ve patoloji görüntüleri üzerinde kanser tespiti, retina hastalığı taraması ve cilt lezyonu sınıflandırması yapılmaktadır; FDA onayı alan yapay zeka destekli tanı araçları artık klinik ortamlarda aktif olarak kullanılmaktadır. Üretimde görsel kalite kontrol sistemleri saniyede yüzlerce ürünü incelerken insan gözünün kaçırdığı micron ölçekli hataları yakalar. Otonom sürüşte LiDAR nokta bulutları, kamera görüntüleri ve radar verilerinin birleştirildiği algılama boru hatlarında computer vision merkezi rol üstlenir. Perakende sektöründe Amazon Go gibi kasiyersiz mağazalar raf stok takibi ve müşteri davranışı analizi için görüntü işleme kullanır. Tarımda drone görüntüleri üzerinde bitki hastalığı tespiti ve mahsul verim tahmini yapılmaktadır. Güvenlik sistemleri arasında yüz tanıma, anormal davranış tespiti ve kalabalık analizi sayılabilir. Türkiye'de savunma sanayiinde insansız hava araçları ve akıllı sınır kamerası sistemleri bilgisayarlı görü teknolojilerine yoğun biçimde dayanmaktadır.

Çok Modlu Modeller ve Güncel Trendler

2022 sonrasından itibaren bilgisayarlı görüde en büyük dönüşüm, görü ve dil modellerinin birleşmesiyle yaşanmaktadır. GPT-4V, Claude 3, Gemini ve LLaVA gibi çok modlu büyük dil modelleri görüntüleri doğal dille yorumlayabilmekte, grafik analiz edebilmekte ve görsel soru-cevap görevlerini insanla rekabet edebilir düzeyde gerçekleştirmektedir. Video anlama alanında Gemini 1.5'in 1 saatlik video işleme kapasitesi gibi gelişmeler, statik görüntü analizinin ötesine geçildiğini göstermektedir. SAM 2 ile gerçek zamanlı video nesne bölütleme mümkün hale gelmiştir. 3D görüntü alanı da hız kazanmaktadır: NeRF (Neural Radiance Field) ve Gaussian Splatting teknikleri 2D görüntülerden yüksek kaliteli 3D sahneler oluşturmaya olanak tanır. Edge AI alanındaki ilerlemeler ise bilgisayarlı görü modellerinin akıllı telefonlar ve gömülü sistemlerde gerçek zamanlı çalışmasını mümkün kılmaktadır.

Zorluklar ve Etik Boyutlar

Bilgisayarlı görünün pratik zorlukları arasında veri kalitesi ve etiketleme maliyeti başında gelir: tıbbi görüntü veri setleri için uzman radyolog etiketlemesi son derece pahalı ve zaman alıcıdır. Dağıtım kayması (distribution shift) sorunu, modelin eğitim verisiyle aynı dağılımda olmayan gerçek dünya görüntüleri üzerinde başarımının düşmesine yol açar. Etik boyutta yüz tanıma sistemlerinin devlet gözetimi için kullanılması, algoritmik önyargılar (özellikle azınlık topluluklarında daha yüksek yanlışlık oranları) ve görüntülerin izin alınmadan toplanması kritik tartışma konularıdır. Avrupa Yapay Zeka Yasası (2026), kamuya açık alanlarda gerçek zamanlı uzaktan biyometrik tanımayı yüksek riskli yapay zeka uygulaması olarak sınıflandırmış ve katı düzenlemelere tabi kılmıştır. Sahte görüntü üretimi (deepfake) ve görsel dezenformasyon ise güven ekosistemi açısından büyüyen bir tehdit oluşturmaktadır.

Sık Sorulan Sorular

  • check_circle Computer vision ile görüntü işleme arasındaki fark nedir? Görüntü işleme (image processing) görüntünün piksel düzeyinde matematiksel dönüşümlerini kapsar (keskinleştirme, gürültü giderme). Computer vision ise bu işlenmiş görüntüden anlam çıkarmayı, yani nesneleri, sahneleri ve olayları anlamayı hedefler.
  • check_circle Küçük bir veri setiyle bilgisayarlı görü modeli eğitmek mümkün mü? Evet. ImageNet üzerinde eğitilmiş modeller (ResNet, EfficientNet, ViT) transfer öğrenme ile küçük veri setlerine ince ayar uygulanabilir. Yüz-birkaç yüz örnek bile etkin bir sınıflandırıcı için yeterli olabilir.
  • check_circle YOLO ve R-CNN ailesi arasındaki temel fark nedir? YOLO tek geçişte (one-shot) hem sınıflandırma hem konum tahmini yapar; çok hızlıdır fakat küçük nesnelerde hassasiyet düşebilir. R-CNN ailesi önce bölge önerisi üretir, sonra her bölgeyi ayrı sınıflandırır; daha hassas fakat daha yavaştır.
  • check_circle Türkiye'de bilgisayarlı görü hangi alanlarda kullanılıyor? Savunma sanayiinde insansız hava aracı görü sistemleri, akıllı sınır güvenliği kameraları, tarımda dron tabanlı bitki sağlığı analizi ve üretimde görsel kalite kontrol uygulamaları öne çıkan alanlardır. TUSAŞ ve ROKETSAN bu teknolojileri aktif olarak kullanmaktadır.
  • check_circle Multimodal AI ile computer vision ilişkisi nedir? Güncel multimodal modeller (GPT-4V, Claude 3, Gemini) görüntü ve metni birlikte işleme kapasitesine sahiptir. Bu modeller klasik computer vision görevlerinin (nesne tespiti, sahne anlama) ötesinde görsel muhakeme ve doğal dil bazlı görsel soru-cevap yapabilir.
  • check_circle Edge'de computer vision çalıştırmak için hangi donanımlar kullanılıyor? NVIDIA Jetson serisi, Google Coral (Edge TPU), Apple Neural Engine ve Qualcomm AI Hub gibi özel hızlandırıcılar bilgisayarlı görü modellerini düşük güç tüketiminde gerçek zamanlı çalıştırmayı mümkün kılar.