Action Recognition (Eylem Tanıma)

Video ve görüntü dizilerinden insan hareketlerini ve eylemlerini otomatik olarak tanıyan bilgisayarlı görü teknolojisi.

Eylem tanıma (action recognition), video klipler ve ardışık görüntü karelerinden insan hareketlerini ve aktivitelerini otomatik olarak sınıflandıran bir bilgisayarlı görü görevidir. Bir sistemin belirli bir zaman penceresindeki görsel veriyi analiz ederek "koşma", "el sıkışma" veya "bıçakla kesme" gibi anlamlı eylemleri doğru biçimde etiketlemesi hedeflenir. Sistemin başarısı için uzamsal (spatial) ve zamansal (temporal) özelliklerin birlikte ele alınması zorunludur. İlk önemli yaklaşım olan çift akışlı ağlar (two-stream networks), biri RGB karelerini diğeri optik akışı (optical flow) işleyen iki paralel evrişimli sinir ağından oluşur. 3D evrişimli ağlar (3D CNN) ise evrişim işlemini zaman boyutuna taşıyarak uzamsal-zamansal örüntüleri doğrudan öğrenir. C3D ilk pratik modeli sunarken I3D, önceden eğitilmiş 2D ağırlıkları üç boyuta şişirerek güçlü bir transfer öğrenme temeli oluşturur. Facebook AI'ın geliştirdiği SlowFast mimarisi, düşük kare hızıyla uzamsal semantiği, yüksek kare hızıyla ince hareketi eş zamanlı yakalamak için iki paralel yol kullanır. Görsel dönüştürücüler (Vision Transformers) bu alanda da belirleyici hale gelmiştir: TimeSformer bölünmüş uzay-zaman dikkat mekanizmasıyla video karelerini işlerken VideoMAE V2, maskeli video otokodlama ön eğitimiyle büyük ölçekli veri kümelerini verimli biçimde kullanır. İskelet tabanlı yöntemler ise vücut eklem noktalarını Graf Evrişimli Ağlarla (GCN) modelleyerek arka plan gürültüsüne karşı dayanıklılık kazandırır. Temel veri kümeleri arasında YouTube kliplerine dayanan Kinetics-400/700, UCF-101, HMDB-51 ve zamansal akıl yürütmeye odaklanan Something-Something v2 yer alır. Uygulama alanları güvenlik kameralarında anomali tespiti, spor analizinde otomatik özet çıkarma, hastane ve bakım evlerinde düşme tespiti, robotik hareket taklidi ve otonom araçlarda yaya niyet tahminini kapsar. Ana zorluklar kısmi örtüşme, bakış açısı değişkenliği, arka plan gürültüsüne aşırı uyum, farklı eylem süreleri ve uç cihazlardaki yüksek hesaplama maliyetidir.

Nasıl Çalışır?

Eylem tanıma sistemleri, uzamsal (görsel içerik) ve zamansal (zaman içindeki değişim) özellikleri eş zamanlı analiz eder. Çift akışlı ağlar RGB karelerinden görünümü, optik akıştan hareketi ayrı ayrı öğrenir. 3D evrişimli ağlar her iki boyutu tek bir modelde birleştirirken TimeSformer, video karelerini yamaç dizileri olarak işleyerek bölünmüş uzay-zaman dikkat mekanizması uygular. İskelet tabanlı yöntemler ise insan vücudunun eklem noktalarını bir graf olarak temsil eder ve Graf Evrişimli Ağlarla hareket dinamiklerini öğrenir.

Temel Mimariler

  • check_circle :
  • check_circle :
  • check_circle :
  • check_circle :
  • check_circle :

Uygulama Alanları

  • check_circle :
  • check_circle :
  • check_circle :
  • check_circle :
  • check_circle :

Benchmark Veri Kümeleri

Kinetics-400/600/700, YouTube'dan derlenen 10 saniyelik kliplerle 400-700 eylem sınıfını kapsar ve alanda standart ön eğitim veri kümesidir. UCF-101 (101 sınıf, 13.320 klip) ve HMDB-51 (51 sınıf) ince ayar değerlendirmesinde yaygın kullanılır. Something-Something v2 ise zamansal akıl yürütmeye odaklanır; modelin sahneyi değil, hareketi öğrenip öğrenmediğini test eder.

Zorluklar

  • check_circle :
  • check_circle :
  • check_circle :
  • check_circle :

Sık Sorulan Sorular

  • check_circle :
  • check_circle :
  • check_circle :
  • check_circle :
  • check_circle :