Action Recognition (Eylem Tanıma)

Video ve görüntü dizilerinden insan hareketlerini ve eylemlerini otomatik olarak tanıyan bilgisayarlı görü teknolojisi.

Eylem tanıma (action recognition), video klipler ve ardışık görüntü karelerinden insan hareketlerini ve aktivitelerini otomatik olarak sınıflandıran bir bilgisayarlı görü görevidir. Bir sistemin belirli bir zaman penceresindeki görsel veriyi analiz ederek "koşma", "el sıkışma" veya "bıçakla kesme" gibi anlamlı eylemleri doğru biçimde etiketlemesi hedeflenir. Sistemin başarısı için uzamsal (spatial) ve zamansal (temporal) özelliklerin birlikte ele alınması zorunludur. İlk önemli yaklaşım olan çift akışlı ağlar (two-stream networks), biri RGB karelerini diğeri optik akışı (optical flow) işleyen iki paralel evrişimli sinir ağından oluşur. 3D evrişimli ağlar (3D CNN) ise evrişim işlemini zaman boyutuna taşıyarak uzamsal-zamansal örüntüleri doğrudan öğrenir. C3D ilk pratik modeli sunarken I3D, önceden eğitilmiş 2D ağırlıkları üç boyuta şişirerek güçlü bir transfer öğrenme temeli oluşturur. Facebook AI'ın geliştirdiği SlowFast mimarisi, düşük kare hızıyla uzamsal semantiği, yüksek kare hızıyla ince hareketi eş zamanlı yakalamak için iki paralel yol kullanır. Görsel dönüştürücüler (Vision Transformers) bu alanda da belirleyici hale gelmiştir: TimeSformer bölünmüş uzay-zaman dikkat mekanizmasıyla video karelerini işlerken VideoMAE V2, maskeli video otokodlama ön eğitimiyle büyük ölçekli veri kümelerini verimli biçimde kullanır. İskelet tabanlı yöntemler ise vücut eklem noktalarını Graf Evrişimli Ağlarla (GCN) modelleyerek arka plan gürültüsüne karşı dayanıklılık kazandırır. Temel veri kümeleri arasında YouTube kliplerine dayanan Kinetics-400/700, UCF-101, HMDB-51 ve zamansal akıl yürütmeye odaklanan Something-Something v2 yer alır. Uygulama alanları güvenlik kameralarında anomali tespiti, spor analizinde otomatik özet çıkarma, hastane ve bakım evlerinde düşme tespiti, robotik hareket taklidi ve otonom araçlarda yaya niyet tahminini kapsar. Ana zorluklar kısmi örtüşme, bakış açısı değişkenliği, arka plan gürültüsüne aşırı uyum, farklı eylem süreleri ve uç cihazlardaki yüksek hesaplama maliyetidir.

Nasıl Çalışır?

Eylem tanıma sistemleri, uzamsal (görsel içerik) ve zamansal (zaman içindeki değişim) özellikleri eş zamanlı analiz eder. Çift akışlı ağlar RGB karelerinden görünümü, optik akıştan hareketi ayrı ayrı öğrenir. 3D evrişimli ağlar her iki boyutu tek bir modelde birleştirirken TimeSformer, video karelerini yamaç dizileri olarak işleyerek bölünmüş uzay-zaman dikkat mekanizması uygular. İskelet tabanlı yöntemler ise insan vücudunun eklem noktalarını bir graf olarak temsil eder ve Graf Evrişimli Ağlarla hareket dinamiklerini öğrenir.

Temel Mimariler

  • check_circle Two-Stream Networks (2014): RGB ve optik akış kollarından oluşan çift akışlı ilk güçlü temel.
  • check_circle C3D / I3D (2015-2017): 3D evrişimi video kliplerine uygulayan öncü mimariler; I3D 2D ağırlıkları şişirir.
  • check_circle SlowFast (2019): Düşük/yüksek kare hızlı çift yol; Kinetics'te %79 doğruluk.
  • check_circle TimeSformer (2021): Pure Transformer; bölünmüş uzay-zaman dikkatini video yamaçlarına uygular.
  • check_circle VideoMAE V2 (2023): Maskeli video otokodlama ön eğitimi; güncel alan sınır değeri.

Uygulama Alanları

  • check_circle Güvenlik ve gözetim: CCTV akışlarında kavga, düşme veya hırsızlık anomalilerinin tespiti.
  • check_circle Spor analizi: Atlet hareketlerinin otomatik sınıflandırılması ve maç özeti çıkarma.
  • check_circle Sağlık izleme: Hastanelerde düşme tespiti ve rehabilitasyon egzersizlerinin değerlendirilmesi.
  • check_circle Robotik: İnsan eylemlerinin gözlemlenerek taklit edilmesi; jest tabanlı robot kontrolü.
  • check_circle Otonom sürüş: Yaya ve bisikletçilerin niyetlerinin (yola çıkma, el sallama) öngörülmesi.

Benchmark Veri Kümeleri

Kinetics-400/600/700, YouTube'dan derlenen 10 saniyelik kliplerle 400-700 eylem sınıfını kapsar ve alanda standart ön eğitim veri kümesidir. UCF-101 (101 sınıf, 13.320 klip) ve HMDB-51 (51 sınıf) ince ayar değerlendirmesinde yaygın kullanılır. Something-Something v2 ise zamansal akıl yürütmeye odaklanır; modelin sahneyi değil, hareketi öğrenip öğrenmediğini test eder.

Zorluklar

  • check_circle Örtüşme (occlusion): Kısmi gizlenme durumlarında iskelet tahmini ve görünüm modelleri başarısız olabilir.
  • check_circle Bakış açısı değişkenliği: Aynı eylem farklı kamera açılarından görsel olarak büyük ölçüde farklılaşır.
  • check_circle Arka plan aşırı uyumu: Modeller eylemi değil, sahne bağlamını (havuz=yüzme) öğrenebilir.
  • check_circle Hesaplama maliyeti: Video dönüştürücüler ve 3D CNN'ler uç cihazlarda gerçek zamanlı çıkarım için ağırdır.

Sık Sorulan Sorular

  • check_circle Eylem tanıma ile nesne tespiti arasındaki fark nedir? Nesne tespiti tek bir karede ne olduğunu bulurken eylem tanıma, zaman boyutundaki değişimi analiz ederek ne yapıldığını belirler.
  • check_circle Optik akış neden önemlidir? Optik akış kareler arasındaki piksel hareket vektörlerini hesaplar ve hareket bilgisini doğrudan temsil ederek çift akışlı ağların hareket koluna girdi olur.
  • check_circle VideoMAE V2 diğer modellerden neden üstündür? Maskeli video otokodlama ön eğitimi, büyük miktarda etiketsiz videodan güçlü temsiller öğrenmesini ve az etiketli veriyle yüksek doğruluk elde etmesini sağlar.
  • check_circle Eylem tanıma gerçek zamanlı çalışabilir mi? Ağır modeller GPU gerektirir; ancak iskelet tabanlı veya hafifletilmiş modeller uç cihazlarda gerçek zamanlı çalışabilir.
  • check_circle Çoklu kişi eylem tanıma tek kişiden farklı mıdır? Grup aktivitesi tanıma ek zorluklar içerir: kişiler arası ilişki modellenmesi ve her bireyin eyleminin ayrı izlenmesi gerekir.