tag temporal attention
Bu sayfada temporal attention etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
Video diffüzyon modelleri, görüntü difüzyon tekniklerini zaman boyutuna genişleterek ardışık ve tutarlı video kareleri üreten derin öğrenme yöntemidir. Temel prensip, eğitim aşamasında gerçek video verilerine kademeli olarak Gaussian gürültüsü eklemek, ardından bu gürültüyü adım adım gidererek anlamlı video dizileri yeniden oluşturmak üzerine kuruludur. Görüntü difüzyonundan temel farkı, modelin hem uzamsal hem de zamansal tutarlılığı aynı anda öğrenmek zorunda olmasıdır. Her kare diğer karelerle tutarlı olmalı; nesneler, ışık koşulları ve hareket vektörleri kesintisiz bir görsel akış oluşturmalıdır. Bu zorunluluk nedeniyle video diffüzyon mimarileri 3D dikkat mekanizmaları veya zamansal konvolüsyon katmanları içerir. Önemli modeller arasında OpenAI'ın Sora'sı öne çıkmaktadır. Sora, Diffusion Transformer mimarisini kullanarak yüksek çözünürlüklü, bir dakikaya kadar uzanan gerçekçi videolar üretebilmektedir. Meta'nın Make-A-Video modeli metin yönlendirmeli video üretimini daha erişilebilir kılarken Stability AI'ın Stable Video Diffusion modeli açık kaynak topluluğuna kapı aralamıştır. Google'ın Lumiere modeli uzay-zaman U-Net mimarisini benimseyerek hareket tutarlılığında çıta yükseltmiştir. Koşullandırma yöntemleri video diffüzyonun pratik kullanımını şekillendirir. Metin-video koşullandırması en yaygın biçimdir. Görüntü-video koşullandırması mevcut bir kareyi başlangıç noktası alarak animasyon üretirken video-video koşullandırması stil transferi ve düzenleme uygulamalarında tercih edilir. Uygulama alanları sinema ve reklam üretiminden tıbbi görselleştirmeye, eğitim içeriklerine ve oyun varlığı üretimine kadar uzanmaktadır. İçerik üreticileri ve reklam ajansları bu modelleri stok görüntü alternatifi olarak benimsemektedir. Zorluklar hâlâ büyüktür: uzun videoların zaman tutarlılığını korumak, fizik yasalarına uygunluğu garantilemek ve hesaplama maliyetini makul düzeyde tutmak başlıca araştırma gündemleridir. Bellek ve işlem gücü gereksinimleri görüntü modellerine kıyasla katbekat yüksektir. Etik açıdan deepfake üretiminin kolaylaşması ve telif hakkı sorunları toplumsal bir tartışma zemini oluşturmaktadır. Latent sıkıştırma ve verimli örnekleme yöntemleri bu engellerin aşılmasına katkı sunmaya devam etmektedir.