tag VideoAnalizi

Action Recognition (Eylem Tanıma)

Bu sayfada VideoAnalizi (Action Recognition (Eylem Tanıma)) etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.

Eylem tanıma (action recognition), video klipler ve ardışık görüntü karelerinden insan hareketlerini ve aktivitelerini otomatik olarak sınıflandıran bir bilgisayarlı görü görevidir. Bir sistemin belirli bir zaman penceresindeki görsel veriyi analiz ederek "koşma", "el sıkışma" veya "bıçakla kesme" gibi anlamlı eylemleri doğru biçimde etiketlemesi hedeflenir. Sistemin başarısı için uzamsal (spatial) ve zamansal (temporal) özelliklerin birlikte ele alınması zorunludur. İlk önemli yaklaşım olan çift akışlı ağlar (two-stream networks), biri RGB karelerini diğeri optik akışı (optical flow) işleyen iki paralel evrişimli sinir ağından oluşur. 3D evrişimli ağlar (3D CNN) ise evrişim işlemini zaman boyutuna taşıyarak uzamsal-zamansal örüntüleri doğrudan öğrenir. C3D ilk pratik modeli sunarken I3D, önceden eğitilmiş 2D ağırlıkları üç boyuta şişirerek güçlü bir transfer öğrenme temeli oluşturur. Facebook AI'ın geliştirdiği SlowFast mimarisi, düşük kare hızıyla uzamsal semantiği, yüksek kare hızıyla ince hareketi eş zamanlı yakalamak için iki paralel yol kullanır. Görsel dönüştürücüler (Vision Transformers) bu alanda da belirleyici hale gelmiştir: TimeSformer bölünmüş uzay-zaman dikkat mekanizmasıyla video karelerini işlerken VideoMAE V2, maskeli video otokodlama ön eğitimiyle büyük ölçekli veri kümelerini verimli biçimde kullanır. İskelet tabanlı yöntemler ise vücut eklem noktalarını Graf Evrişimli Ağlarla (GCN) modelleyerek arka plan gürültüsüne karşı dayanıklılık kazandırır. Temel veri kümeleri arasında YouTube kliplerine dayanan Kinetics-400/700, UCF-101, HMDB-51 ve zamansal akıl yürütmeye odaklanan Something-Something v2 yer alır. Uygulama alanları güvenlik kameralarında anomali tespiti, spor analizinde otomatik özet çıkarma, hastane ve bakım evlerinde düşme tespiti, robotik hareket taklidi ve otonom araçlarda yaya niyet tahminini kapsar. Ana zorluklar kısmi örtüşme, bakış açısı değişkenliği, arka plan gürültüsüne aşırı uyum, farklı eylem süreleri ve uç cihazlardaki yüksek hesaplama maliyetidir.

code_blocks

Action Recognition (Eylem Tanıma)

Eylem tanıma (action recognition), video klipler ve ardışık görüntü karelerinden insan hareketlerini ve aktivitelerini otomatik olarak sınıflandıran bir bilgisayarlı görü görevidir. Bir sistemin belirli bir zaman penceresindeki görsel veriyi analiz ederek "koşma", "el sıkışma" veya "bıçakla kesme" gibi anlamlı eylemleri doğru biçimde etiketlemesi hedeflenir. Sistemin başarısı için uzamsal (spatial) ve zamansal (temporal) özelliklerin birlikte ele alınması zorunludur. İlk önemli yaklaşım olan çift akışlı ağlar (two-stream networks), biri RGB karelerini diğeri optik akışı (optical flow) işleyen iki paralel evrişimli sinir ağından oluşur. 3D evrişimli ağlar (3D CNN) ise evrişim işlemini zaman boyutuna taşıyarak uzamsal-zamansal örüntüleri doğrudan öğrenir. C3D ilk pratik modeli sunarken I3D, önceden eğitilmiş 2D ağırlıkları üç boyuta şişirerek güçlü bir transfer öğrenme temeli oluşturur. Facebook AI'ın geliştirdiği SlowFast mimarisi, düşük kare hızıyla uzamsal semantiği, yüksek kare hızıyla ince hareketi eş zamanlı yakalamak için iki paralel yol kullanır. Görsel dönüştürücüler (Vision Transformers) bu alanda da belirleyici hale gelmiştir: TimeSformer bölünmüş uzay-zaman dikkat mekanizmasıyla video karelerini işlerken VideoMAE V2, maskeli video otokodlama ön eğitimiyle büyük ölçekli veri kümelerini verimli biçimde kullanır. İskelet tabanlı yöntemler ise vücut eklem noktalarını Graf Evrişimli Ağlarla (GCN) modelleyerek arka plan gürültüsüne karşı dayanıklılık kazandırır. Temel veri kümeleri arasında YouTube kliplerine dayanan Kinetics-400/700, UCF-101, HMDB-51 ve zamansal akıl yürütmeye odaklanan Something-Something v2 yer alır. Uygulama alanları güvenlik kameralarında anomali tespiti, spor analizinde otomatik özet çıkarma, hastane ve bakım evlerinde düşme tespiti, robotik hareket taklidi ve otonom araçlarda yaya niyet tahminini kapsar. Ana zorluklar kısmi örtüşme, bakış açısı değişkenliği, arka plan gürültüsüne aşırı uyum, farklı eylem süreleri ve uç cihazlardaki yüksek hesaplama maliyetidir.

arrow_forward
video

Object Tracking (Nesne Takibi)

Object Tracking (Nesne Takibi), video akışlarında belirli nesnelerin hareketini kareden kareye sürekli izleyen bir bilgisayarlı görü disiplinidir. Kişiler, araçlar, hayvanlar veya endüstriyel bileşenler gibi her türlü cisim bu teknikle takip edilebilir. Nesne tespitinden (object detection) temel farkı şudur: tespit her kareye bağımsız bakarken, takip nesnelerin zaman içindeki sürekli kimliğini (ID) koruyarak hareketlerini izler. Algoritma tasarımında iki temel mimari yaklaşım öne çıkar. Algıla-ve-Takip Et (Detection-Based Tracking) yaklaşımında her karede YOLO veya Faster R-CNN gibi bağımsız bir dedektör çalışır; ardından Kalman filtresi ve Macar algoritması mevcut iz listesiyle eşleştirme yapar. 2016 yılından bu yana endüstri standardı hâline gelen SORT ve DeepSORT bu yaklaşımın öncüleridir. İkinci yaklaşım olan uçtan uca transformer tabanlı modeller ise TrackFormer ve MOTR gibi ağlarla temsil edilir; tespit ve takibi tek mimari içinde birleştirir ve el yapımı birleştirme kuralı gerektirmez. Temel performans metrikleri arasında MOTA (Multi-Object Tracking Accuracy), IDF1 (kimlik süreklilik skoru) ve HOTA yer alır. Uluslararası MOT Challenge yarışması bu metrikleri standartlaştırmış olup ByteTrack ve BoT-SORT en güncel karşılaştırma listelerinde lider konumdadır. Başlıca zorluklar şunlardır: Örtüşme (occlusion), nesne başka bir cismin arkasında geçici olarak kaybolduğunda kimlik kaybına yol açar. Hız değişimleri ve ani yön dönüşleri Kalman filtresi tahminlerini güçleştirir. Benzer görünümlü nesneler ID anahtarı (ID switch) hatasını artırır. Küçük veya uzak nesneler ise dedektörün güven eşiğinin altında kalabilir. Gerçek zamanlı sistemlerde YOLO ile ByteTrack kombinasyonu yaygın tercih olurken, piksel düzeyinde hassasiyet gerektiren uygulamalarda Meta'nın 2024 tarihli SAM 2 modeli öne çıkmaktadır. Nesne takibi; otonom araçlar, spor analizi, akıllı güvenlik kameraları ve tıbbi görüntüleme alanlarında endüstri standardı hâline gelmiştir.

arrow_forward
🎬

Optical Flow Nedir? Video Analizinde Hareket Tespiti (Optik Akış)

Optical flow (optik akış), art arda gelen video karelerindeki piksel parlaklık örüntüsünün görünür hareketini hesaplayan temel bir bilgisayarlı görü tekniğidir. Her piksel ya da seçili özellik noktası için, bir kareden diğerine geçişte oluşan (u, v) hareket vektörü belirlenir; bu vektörlerin tümü bir "flow map" (akış haritası) oluşturur ve sahnenin dinamik yapısını sayısal olarak temsil eder. Teknik, parlaklık sabitliği (brightness constancy) hipotezine dayanır: I(x, y, t) = I(x+u, y+v, t+1). Yani kısa zaman aralıklarında bir pikselin görüntü üzerindeki parlaklığının değişmediği kabul edilir. Bu tek denklem iki bilinmeyen (u, v) içerdiğinden doğrudan çözülemez; "aperture problemi" olarak bilinen bu belirsizlik, ek uzamsal kısıtlamalar eklenerek giderilir. Klasik algoritmalar iki ana yaklaşımda gruplanır. Lucas-Kanade (1981), küçük bir piksel penceresindeki tüm noktaların aynı harekete sahip olduğunu varsayarak seçili köşe noktalarında seyrek (sparse) akış üretir; hız ve sağlamlığıyla günümüz nesne takip uygulamalarında hâlâ kullanılır. Horn-Schunck (1981) ise pürüzlülük (smoothness) kısıtlaması uygulayarak tüm piksel uzayında yoğun (dense) bir akış alanı bulur; gürültüye daha duyarlıdır ancak teorik temeli güçlüdür. 2010'ların ortasında derin öğrenme bu alanı dönüştürdü. FlowNet (2015) ve FlowNet2 (2017), sentetik verilerle eğitilmiş CNN mimarileriyle klasik yöntemlerin çok ötesinde doğruluk sundu. RAFT (Recurrent All-Pairs Field Transforms, 2020) ise GRU tabanlı yinelemeli mimarisiyle Sintel ve KITTI benchmark'larında rekor kırarak günümüz akademik standardı hâline geldi. Optical flow; otonom araç navigasyonu, video stabilizasyonu, eylem tanıma, gözetim sistemleri ve tıbbi görüntüleme (ekokardiyografi kalp hareketi analizi) gibi geniş bir yelpazeye uygulanır. Stable Video Diffusion ve benzeri jeneratif video modelleri de zamansal tutarlılık için optik akış rehberliğinden yararlanmaktadır. OpenCV, `calcOpticalFlowFarneback` ve `calcOpticalFlowPyrLK` fonksiyonlarıyla hem yoğun hem seyrek akış hesaplamayı pratikte erişilebilir kılar.

arrow_forward