tag görüntü işleme

Bu sayfada görüntü işleme etiketi ile işaretlenmiş 13 yapay zeka kavramını bulabilirsiniz.

Autoencoder, girdi verisini daha dusuk boyutlu bir ara temsile (latent uzay veya bottleneck) sikistiran bir encoder ve bu temsili orijinal boyuta geri donusturebilen bir decoder birlesiminden olusan sinir agi mimarisidir. Egitim hedefi ciktiyi girdiyle olabildigince ozdes kilanmaktir; bu basit hedef, modelin veri icerisindeki en onemli yapilari ogrenmesini zorlar. Autoencoder tamamen denetimsiz bir ogrenme yaklasimidur: etikete ihtiyac duymaz, hata sinyali yalnizca girdinin ne kadar iyi geri olusturuldugunu olcer. Bu ozellik onu buyuk etiketlenmemis veri kumelerinde ozellik cikarma ve boyut indirgeme icin degerli kilar. Temel bilesenler encoder (daraltici aglar), latent uzay (dar boyutlu ara temsil) ve decoder'dir (genisletici aglar). Latent uzayin boyutu ne kadar kucuk olursa model o kadar guclu sikilstirma ogrenmek zorunda kalir; ne kadar buyuk olursa geri olusturma kolaylasor ama ogrenilen ozellikler daha az kompakt olur. Pratik uygulamalar genis bir yelpazede yer alir. Goruntu gürültü giderme icin autoencoder, gurultulu goruntu girdi olarak alip temizini olusturmak uzere egitilir. Anomali tespitinde yalnizca normal veriyle egitilmis bir autoencoder, egitim dagiliminin disindaki ornekleri yuksek rekonstruksiyon hatasi ile tanir. Onerilim sistemlerinde kullanicilarin davranislarinin latent temsillerini ogrenmede kullanilir. Variational Autoencoder (VAE), klasik autoencoderin uretici bir versiyonudur. Latent uzaya belirleyici bir nokta degil bir olasilik dagilimi ogrenir: her girdi ornek icin bir ortalama ve varyans vektoru hesaplanir ve latent uzaydan ornekleme yapilir. Bu olasiliksal temsil, latent uzay uzerinde anlayisli interpolasyon ve ornekleme yapmayi mumkun kilar; bu ozellik VAE'yi goruntu sentezi, muzik uretimi ve drug design gibi alanlarda kullanilan temel uretici model yaklasimlarindan biri haline getirir. **Sik Sorulan Sorular** **Autoencoder ile PCA arasindaki fark nedir?** PCA dogrusal donusumler kullanir. Autoencoder dogrusal olmayan aktivasyon fonksiyonlariyla cok daha karmasik, dogrusal olmayan boyut indirgeme ogrenebi­lir; bu onu yuksek boyutlu goruntu ve ses verisi icin daha guclu kilar. **Latent boyut nasil secilir?** Goreve baglidir: ne kadar kompakt bir temsil gerektigine gore ayarlanir. Genellikle farkli latent boyutlarda denenip rekonstruksiyon kalitesi ve asagi akis gorevi performansi incelenerek secim yapilir. **Autoencoder overfitting yapabilir mi?** Evet. Latent uzay cok genis olursa model verinin her ayrıntısini ezberleyerek siradan bir kopya cikarmasi ogrenir; boyut indirgeme veya ozellik ogrenimine zori kalmaz. Dropout veya regularizasyon bunu onler. **VAE ile GAN arasindaki fark nedir?** VAE kapsamli latent uzay tanimlayan ve gercek dagilimi maksimum olabilirlikle optimize eden bir uretici modeldir. GAN ise bir uretici ve bir ayirt edici ag arasindaki rekabetci oyunla egitilir; GAN gorselleri genellikle daha keskin olur ancak egitimi daha istikrarsizdir.

hourglass_empty

Autoencoder (Oto-Kodlayıcı)

Autoencoder, girdi verisini daha dusuk boyutlu bir ara temsile (latent uzay veya bottleneck) sikistiran bir encoder ve bu temsili orijinal boyuta geri donusturebilen bir decoder birlesiminden olusan sinir agi mimarisidir. Egitim hedefi ciktiyi girdiyle olabildigince ozdes kilanmaktir; bu basit hedef, modelin veri icerisindeki en onemli yapilari ogrenmesini zorlar. Autoencoder tamamen denetimsiz bir ogrenme yaklasimidur: etikete ihtiyac duymaz, hata sinyali yalnizca girdinin ne kadar iyi geri olusturuldugunu olcer. Bu ozellik onu buyuk etiketlenmemis veri kumelerinde ozellik cikarma ve boyut indirgeme icin degerli kilar. Temel bilesenler encoder (daraltici aglar), latent uzay (dar boyutlu ara temsil) ve decoder'dir (genisletici aglar). Latent uzayin boyutu ne kadar kucuk olursa model o kadar guclu sikilstirma ogrenmek zorunda kalir; ne kadar buyuk olursa geri olusturma kolaylasor ama ogrenilen ozellikler daha az kompakt olur. Pratik uygulamalar genis bir yelpazede yer alir. Goruntu gürültü giderme icin autoencoder, gurultulu goruntu girdi olarak alip temizini olusturmak uzere egitilir. Anomali tespitinde yalnizca normal veriyle egitilmis bir autoencoder, egitim dagiliminin disindaki ornekleri yuksek rekonstruksiyon hatasi ile tanir. Onerilim sistemlerinde kullanicilarin davranislarinin latent temsillerini ogrenmede kullanilir. Variational Autoencoder (VAE), klasik autoencoderin uretici bir versiyonudur. Latent uzaya belirleyici bir nokta degil bir olasilik dagilimi ogrenir: her girdi ornek icin bir ortalama ve varyans vektoru hesaplanir ve latent uzaydan ornekleme yapilir. Bu olasiliksal temsil, latent uzay uzerinde anlayisli interpolasyon ve ornekleme yapmayi mumkun kilar; bu ozellik VAE'yi goruntu sentezi, muzik uretimi ve drug design gibi alanlarda kullanilan temel uretici model yaklasimlarindan biri haline getirir. **Sik Sorulan Sorular** **Autoencoder ile PCA arasindaki fark nedir?** PCA dogrusal donusumler kullanir. Autoencoder dogrusal olmayan aktivasyon fonksiyonlariyla cok daha karmasik, dogrusal olmayan boyut indirgeme ogrenebi­lir; bu onu yuksek boyutlu goruntu ve ses verisi icin daha guclu kilar. **Latent boyut nasil secilir?** Goreve baglidir: ne kadar kompakt bir temsil gerektigine gore ayarlanir. Genellikle farkli latent boyutlarda denenip rekonstruksiyon kalitesi ve asagi akis gorevi performansi incelenerek secim yapilir. **Autoencoder overfitting yapabilir mi?** Evet. Latent uzay cok genis olursa model verinin her ayrıntısini ezberleyerek siradan bir kopya cikarmasi ogrenir; boyut indirgeme veya ozellik ogrenimine zori kalmaz. Dropout veya regularizasyon bunu onler. **VAE ile GAN arasindaki fark nedir?** VAE kapsamli latent uzay tanimlayan ve gercek dagilimi maksimum olabilirlikle optimize eden bir uretici modeldir. GAN ise bir uretici ve bir ayirt edici ag arasindaki rekabetci oyunla egitilir; GAN gorselleri genellikle daha keskin olur ancak egitimi daha istikrarsizdir.

arrow_forward
panorama

Convolutional Neural Network (CNN) (Evrişimli Sinir Ağı)

CNN (Convolutional Neural Network - Evrisimsel Sinir Agi), goruntu ve uzamsal verilerden hiyerarsik ozellikler cikartan bir derin ogrenme mimarisidir. Evrisme islemi sayesinde modelin her neron'unun tum girdiyle degil yalnizca yerel bir bolgeyle baglantili olmasi, parametre sayisini drastik bicimde azaltir ve uzamsal kaliplari gormek icin idealize edilmis bir yapi olusturur. CNN'in temel yapi tasi evrisme katmanidir. Bu katmanda kucuk bir filtre (kernel), genellikle 3x3 veya 5x5 boyutunda, girdi haritasi uzerinde kayan pencereyle carpma islemi uygular. Her filtre, kenar, doku veya renk gecisi gibi belirli bir uzamsal kaliba duyarlidir. Derin bir CNN'de ilk katmanlar basit kenarlar ogrenirken sonraki katmanlar bu kenarlari birlesitirerek sekiller, nesneler ve nihayet tum nesne kategorileri ogrenir. Havuzlama (pooling) katmanlari evrisme ciktilarinin uzamsal boyutunu kucultmektedir. Max-pooling, belirli bir bolgedeki en buyuk aktivasyon degerini secer; bu sayede model konum degisimlerine karsi olcude direncli hale gelir. Kuculen ozellik haritalari sonraki evrisme katmanlarinin daha genis bir alani gormeyi mumkun kilar. Mimari tarihinde CNN'in yeri kritiktir. Yann LeCun 1989'da el yazisi rakam tanima icin LeNet'i tasarladi. 2012'de Alex Krizhevsky ve ekibi ImageNet yarismmasinda AlexNet ile o zamana kadar gorulmemis bir suc orani saglamasi, derin ogrenme alaninin patlamasini tetikledi. Ardından VGGNet, GoogLeNet, ResNet ve EfficientNet gibi mimariler gorunteden anlama icin yeni standartlar belirledi. Kalan baglantili (residual) katmanlar mimarilerin cok daha derin ancak egitimi kolay hale gelmesini mumkun kildi. CNN'ler goruntu siniflandirma, nesne tespiti (YOLO, SSD), semantik segmentasyon, yuz tanima ve tibbi goruntu analizi gibi alanlarda yayginca kullanilmaktadir. Dil modelleme icin transformer mimarisinin yukselisiyle CNN'in NLP'deki rolu azalmis olsa da gorsel veri icin hala temel mimari olma ozelligini korumaktadir. **Sik Sorulan Sorular** **CNN ile tam baglantili (dense) aglar arasindaki fark nedir?** Tam baglantili aglar her neuronu tum girdiyle baglar; bu parametre patlamasi ve uzamsal bilgi kaybi demektir. CNN yerel baglanti ve agirlik paylasimi ile parametre ekonomisi saglar ve uzamsal kaliplari verimli ogrenilir. **Kucuk veri kumesiyle CNN egitmek mumkun mudur?** Transfer ogrenme ile evet. ImageNet uzerinde onegitim gormis bir CNN'in son katmanlari, kucuk bir ozgun veri kumesiyle ince ayar yapilarak kullanilabilir; bu yaklasim ozelliklede gorsel siniflandirma gorevlerinde yaygindir. **CNN'ler metin icin de kullanilabilir mi?** 1D evrisme katmanlari metin siniflandirma ve sentiment analizinde kullanilmistir. Ancak Transformer mimarisi uzun mesafe bagimliklarini daha iyi modelledigi icin NLP'de CNN'lerin populerligini buyuk olcude assmistir. **GPU CNN egitimini neden bu kadar hizlandiriyor?** Evrisme islemi buyuk olcekli paralel matris carpimlarindan olusur; GPU'larin binden fazla islem cekirdegi bu tip isleri CPU'ya gore onlarca kat daha hizli yurutmek icin optimize edilmistir.

arrow_forward
zoom_out_map

Data Augmentation (Veri Artırma / Çoğaltma)

Veri artırma (data augmentation), makine öğrenmesi modellerini eğitirken mevcut veri setini yapay yöntemlerle genişletme tekniğidir. Özellikle etiketli veri toplamak pahalı veya zaman alıcı olduğunda eldeki örneklerden türetilen yeni varyantlar modelin genelleme kapasitesini önemli ölçüde artırır. Teknik; bilgisayarla görü, doğal dil işleme ve ses tanıma gibi pek çok alanda standart bir uygulama haline gelmiş ve modern derin öğrenme boru hatlarının vazgeçilmez bir temel bileşeni olmuştur. Görüntü verisinde yatay çevirme, döndürme, rastgele kırpma ve renk jitter gibi geometrik ve fotometrik dönüşümler yaygın olarak kullanılır. Daha gelişmiş yaklaşımlar arasında GridDistortion, ElasticTransform ve RandomErasing yer alır. Bu teknikler modelin nesnenin konumundan veya ışık koşullarından bağımsız özellikler öğrenmesini destekler. Metin verisinde geri çeviri en güçlü yöntemlerden biridir: bir cümle önce farklı bir dile çevrilir ardından kaynak dile döndürülür; anlam korunurken ifade tarzı değişir. Eş anlamlı kelime değiştirme ve cümle yeniden çerçeveleme de yaygın kullanılır. Ses verisi için zaman uzatma ve perde kaydırma konuşma tanıma ve müzik sınıflandırma modellerinin akustik dayanıklılığını artırır. Mixup iki eğitim örneğini ve etiketini doğrusal olarak harmanlayarak modelin daha yumuşak karar sınırları öğrenmesini destekler. CutMix bir görüntünün dikdörtgen bölgesini başka bir görüntünün bölgesiyle değiştirir; etiket de alan oranıyla orantılı güncellenir. AutoAugment ve RandAugment hangi dönüşümlerin hangi yoğunlukta uygulanacağını otomatik belirler ve göreve özgü artırma politikası öğrenir. Üretken modeller (GAN, diffusion) gerçekçi sentetik örnekler üreterek veri artırmanın kapasitesini daha da genişletir. Doğru yapılandırılmış veri artırma modelin aşırı öğrenmesini engelleyen kritik bir bileşendir. Test seti artırma işlemine tabi tutulmamalı; orijinal haliyle korunarak tarafsız değerlendirme zemini oluşturulmalı ve uygulamacılar doğrulama kaybını izleyerek artırma yoğunluğunu optimize etmelidir.

arrow_forward
crop_free

Object Detection (Nesne Tespiti / Nesne Tanıma)

Nesne tespiti (object detection), bir görüntüde veya videodaki nesnelerin hem varlığını hem de konumunu otomatik olarak belirleyen bilgisayarlı görü tekniğidir. Yalnızca görüntünün genelinde ne olduğunu söyleyen görüntü sınıflandırmasının aksine nesne tespiti her nesnenin çevresine bir sınır kutusu (bounding box) çizer ve nesneyi etiketler. Nesne tespiti sistemleri iki ana kategoride incelenir. İki aşamalı detektörler (two-stage detectors), önce potansiyel nesne bölgeleri önerir (Region Proposal Network), ardından bu bölgeleri sınıflandırır. Faster R-CNN bu kategorinin öncü modelidir. Tek aşamalı detektörler (one-stage detectors), tahmin ve sınıflandırmayı tek bir geçişte gerçekleştirir; YOLO serisi ve SSD bu kategorinin en bilinen modelleridir. YOLO'nun evrimi nesne tespitinin tarihini özetler: YOLOv1 (2016), YOLOv3, YOLOv5, YOLOv8 ve YOLOv11'e uzanan her sürümde hız/doğruluk dengesi iyileştirilmiştir. Ultralytics'in YOLOv8'i, kolay kullanım ve güçlü performanıyla topluluk standardı haline gelmiştir. Transformer tabanlı DETR (Detection Transformer), bounding box tahmini ile dikkat mekanizmasını birleştirerek alanı yenilemiş; anchor-free tasarımıyla geleneksel bileşenlere olan bağımlılığı azaltmıştır. Değerlendirme metriği olarak mAP (mean Average Precision) kullanılır; bu metrik, farklı IoU (Intersection over Union) eşiklerindeki precision-recall eğrisinin altındaki alan ortalamasını ölçür. COCO veri kümesi, nesne tespiti modellerinin karşılaştırılması için endüstri standardı haline gelmiştir. Gerçek zamanlı uygulamalarda (otonom araçlar, güvenlik kameraları, drone görüntü analizi) düşük gecikme kritik olduğundan tek aşamalı detektörler ön plana çıkar. Örnek olarak YOLOv8n (nano), CPU üzerinde 60+ FPS hızında çalışabilirken YOLOv8x (extra large) COCO'da daha yüksek mAP değerleri elde eder. Model seçimi, donanım kısıtları ve doğruluk gereksinimine göre yapılmalıdır; TensorRT ve ONNX optimizasyonu üretim dağıtımında gecikmeyi önemli ölçüde düşürür; bu sayede edge cihazlarda bile gerçek zamanlı çıkarım mümkün olur. Instance segmentation (YOLOv8-seg, Mask R-CNN) ve keypoint detection gibi türev görevler, nesne tespiti altyapısını piksel düzeyi veya iskelet bazlı analizle genişletir.

arrow_forward
flare

Variational Autoencoder (VAE) (Varyasyonel Oto-Kodlayıcı)

Variasyonel Otokodlayıcı (VAE — Variational Autoencoder), gizli uzayda (latent space) olasılıksal bir dağılım öğrenerek yeni veri örnekleri üretebilen üretken derin öğrenme modelidir. 2013 yılında Kingma ve Welling tarafından önerilen VAE, otokoderın gizli uzay temsilini deterministik bir noktadan ibaret olmak yerine olasılıksal bir dağılım (çoğunlukla Gaussian) olarak modellemektedir. VAE mimarisinin iki ana bileşeni vardır: kodlayıcı (encoder) ve kod çözücü (decoder). Encoder, girdi verisini gizli uzaydaki bir ortalama (mean) ve varyans vektörü olarak kodlar; gerçek gizli vektör bu Gaussian dağılımından örneklenir. Decoder, bu gizli vektörü orijinal veri uzayına geri dönüştürmeye çalışır. Eğitim sırasında iki kayıp terimi vardır: yeniden yapım kaybı (reconstruction loss — girdinin çıktıya ne kadar benzediği) ve KL sapma kaybı (KL divergence — gizli dağılımın standart normale ne kadar yakın olduğu). Bu iki terimin toplamı ELBO (Evidence Lower BOund) adını alır ve VAE'nin maksimize etmeye çalıştığı hedeftir. Reparametrizasyon hilesi (reparameterization trick) eğitimi mümkün kılan kritik adımdır: örnekleme operasyonu türevlenebilir değildir, bu nedenle z = mu + sigma * epsilon formülüyle epsilon ~ N(0,1) sabit rastgelelikten gelir. Böylece gradyan mu ve sigma üzerinden akar ve model geri yayılım ile eğitilir. GAN'larla (Generative Adversarial Network) karşılaştırıldığında VAE'nin eğitimi daha kararlıdır; ancak üretilen örnekler çoğu zaman daha bulanık görünür. GAN'lar çok daha keskin görseller üretse de eğitim kararsızlığı ve mod çöküşü (mode collapse) sorunlarıyla mücadele eder. Diffusion modelleri ise her iki yaklaşımın dezavantajlarını büyük ölçüde aşarak görsel kalitede yeni bir standart belirlemiştir. VAE'nin gizli uzayının düzgün ve yapılandırılmış (smooth, structured latent space) olması onu yorumlanabilir temsil öğrenmesi (disentangled representation learning) için çekici kılar. beta-VAE KL ağırlığını artırarak her gizli boyutun farklı anlam taşımasını hedefler. VQ-VAE gizli uzayı süreksiz (discrete) yapar; bu özellik DALL-E 1 ve dil modeli tabanlı görsel kodlama sistemleri için önem taşır. Uygulama alanları; görüntü üretimi, anomali tespiti, eksik veri doldurma, yüz sentezi ve ilaç keşfinde molekül uzayında anlamlı interpolasyonu kapsar.

arrow_forward
camera

Computer Vision (Bilgisayarlı Görü)

Bilgisayarlı görü (Computer Vision), yapay zekanın dijital görüntü, video ve kameralardan gelen ham piksel verilerini anlayarak anlamlı kararlar üretmesini sağlayan dalıdır. İnsan görsel korteksinin nesne tanıma, derinlik algısı ve hareket takibi gibi yeteneklerini yazılım ve donanım kombinasyonuyla taklit etmeyi hedefler. Temel işlem hattı üç aşamada özetlenebilir: görüntü edinimi (kamera, uydu, tıbbi tarayıcı), özellik çıkarma (kenarlar, dokular, şekiller veya derin öğrenme ile öğrenilmiş gizli temsiller) ve karar verme (sınıflandırma, konumlama, segmentasyon). 2012'de AlexNet'in ImageNet yarışmasında hata oranını yüzde yirmi altıdan on altıya düşürmesi alandaki derin öğrenme devrimini başlattı. Modern bilgisayarlı görü iki ana mimari yoldan ilerler: ResNet ve EfficientNet gibi konvolüsyonel sinir ağları (CNN) görsel özellik çıkarmada standart haline gelirken, 2020'de Google Brain tarafından tanıtılan Vision Transformer (ViT) dikkat mekanizmasını görsel görevlere uyarlayarak büyük veri setlerinde CNN'lere rakip sonuçlar verdi. YOLO (You Only Look Once) serisi tek geçişli mimarisiyle gerçek zamanlı nesne tespitinde endüstri standardı konumundadır. 2023'te Meta'nın yayımladığı SAM (Segment Anything Model) sıfır atışlı segmentasyonla foundation model dönemini bilgisayarlı görüye taşıdı; CLIP (OpenAI, 2021) ise metin-görüntü çift eğitimiyle sıfır atışlı görüntü sınıflandırmasının önünü açtı. GPT-4V ve Gemini Vision gibi büyük dil modelleriyle entegre çok modlu sistemler 2024-2026 döneminde ana akıma girdi. 2026 itibarıyla SAM 2 video segmentasyonunu, Depth Anything v2 tek kamerayla piksel düzeyinde üç boyutlu derinlik çıkarmayı ve YOLO World açık-kelime nesne tespitini mümkün kılmaktadır. Pazar araştırmaları alanın 2030'a kadar yıllık yüzde yirmi beşi aşan bir büyüme oranıyla ilerleyeceğini öngörüyor. AB Yapay Zeka Yasası, kamuya açık alanlarda gerçek zamanlı biyometrik yüz tanımayı yüksek riskli yapay zeka olarak sınıflandırarak sektörde etik denetim çıtasını önemli ölçüde yükseltti.

arrow_forward
hd

Video Süper Çözünürlük (VSR) (Video Süper Çözünürlük)

Video Süper Çözünürlük (Video Super-Resolution, VSR), düşük çözünürlüklü video karelerini derin öğrenme modelleri aracılığıyla yüksek çözünürlüklü videolara dönüştüren bir yapay zeka teknolojisidir. Geleneksel yükseltme yöntemleri enterpolasyon (bilineer, çift kübik) kullanırken VSR modelleri, hem tek bir karedeki uzamsal bilgiyi hem de ardışık kareler arasındaki zamansal ilişkiyi öğrenerek gerçekçi doku ve kenar detayları sentezler. VSR sistemleri temel olarak iki kategoriye ayrılır: tekrarlayan ağlar (recurrent networks) ve kayar pencere (sliding window) yaklaşımları. Tekrarlayan ağlar, önceki ve sonraki karelerin bilgisini gizli durum vektörlerinde biriktirir; EDVR ve BasicVSR bu kategorinin öncü örnekleridir. EDVR (Enhanced Deformable convolutional Networks for Video Restoration), deformable convolution v2 ile hassas çok-ölçekli hizalama yaparak CVPR NTIRE 2019 Yarışması'nda birinci olmuştur. BasicVSR ve devamı BasicVSR++ (Wang ve ark., 2021-2022), çift yönlü yayılım ve optik akış tabanlı hizalamayı basit ama güçlü bir çerçevede birleştirerek açık kaynak referans mimari konumuna gelmiştir. Model mimarileri açısından konuşursak: uzamsal özellik çıkarımı için derin CNN veya Swin Transformer katmanları kullanılırken zamansal bilgi gizli durum veya kayar pencere mekanizmalarıyla aktarılır. Son aşamada pixel shuffle (alt piksel konvolüsyon) katmanı, özellik haritasını yüksek çözünürlüklü piksel ızgarasına çevirir. Optik akış tahmini veya deformable convolution ile karelar arası piksel ötelenmeleri hizalanır; bu hizalama adımı birden fazla kareden gelen doku bilgisinin birleştirilmesini mümkün kılar. Son yıllarda difüzyon tabanlı ve GAN tabanlı yaklaşımlar hız kazanmaktadır. DiffVSR, difüzyon modellerini temporal tutarlılık kısıtlamalarıyla birleştirerek gerçek dünya bozulmalarına karşı güçlü sonuçlar üretir. VideoGigaGAN (Adobe Research, 2024) ise büyük ölçekli GAN mimarisini video domainine taşıyarak 8× büyütmede çarpıcı doku zenginliği sunar. VSR, OTT arşivi upscaling, dijital yayıncılık, güvenlik kameraları, tıbbi görüntüleme ve tarihi film restorasyonu gibi geniş bir yelpazede uygulanmaktadır. Kalite değerlendirmesinde PSNR ve SSIM yanı sıra LPIPS ve NIQE gibi algısal metrikler de kullanılmaktadır.

arrow_forward
view_in_ar

Depth Estimation (Derinlik Tahmini)

Depth estimation (derinlik tahmini), bir yapay zeka modelinin tek veya çift kameralı iki boyutlu görüntülerden sahnedeki her noktanın kameraya olan uzaklığını otomatik olarak tahmin etmesidir. Çıktı olarak her pikselin mesafeye karşılık geldiği bir derinlik haritası (depth map) üretilir: yakın nesneler açık tonlarla, uzak nesneler koyu tonlarla temsil edilir. İnsan görme sistemi iki göz arasındaki parallax farkından derinlik algılar; ancak tek kameralı dijital görüntüler bu bilgiyi doğrudan içermez. Modeller gölge, perspektif, boyut ve odak bulanıklığı gibi görsel ipuçlarını öğrenerek ve büyük ölçekli derinlik veri setleri üzerinde eğitilerek bu eksikliği kapatır. Derinlik tahmini üç ana yaklaşımla gerçekleştirilir. Monoküler yöntemler tek bir RGB görüntüsünden derinlik çıkarır; denetimli eğitim için LiDAR etiketi, öz denetimli eğitim için video çerçeve çiftleri kullanılır ve en esnek yaklaşımdır. Stereo yöntemler iki paralel kameradan alınan görüntü çiftleri arasındaki piksel kaymasını (disparity) üçgenleme ile derinliğe dönüştürür; fabrika otomasyonu ve endüstriyel robotik için tercih edilir. LiDAR füzyon ise kamera görüntüsünü aktif sensör verisiyle birleştirerek en yüksek kesinliği sunar; ancak sensör maliyeti yüksektir. MiDaS ve Depth Anything v2 gibi transformer tabanlı modeller büyük ölçekli ve çok kaynaklı verilerle eğitilerek geniş ortam koşullarına genellenebilir hale gelmiştir. Apple Depth Pro tek görüntüden mutlak metrik derinlik değerleri üretebilmektedir. Otonom araçlar, artırılmış gerçeklik, robotik navigasyon ve üç boyutlu sahne yeniden yapılandırma başlıca uygulama alanlarıdır. Doğruluk için AbsRel, RMSE ve delta eşik doğruluğu (δ < 1.25) kullanılır. Gerçek zamanlı uygulamalarda NVIDIA Jetson ve Apple Neural Engine gibi özel donanım hızlandırıcılar tercih edilir. Derinlik haritaları ayrıca 3B nokta bulutu oluşturmak ve sanal nesneleri gerçek ortama yerleştirmek için de kullanılmaktadır.

arrow_forward
accessibility_new

Pose Estimation (Poz Tahmini)

Poz Tahmini (Pose Estimation), görüntü veya video karelerinden insan vücudunun anatomik eklem noktalarını (keypoints) otomatik olarak tespit eden ve bu noktalar arasındaki bağlantılarla iskelet yapısı oluşturan bir bilgisayarlı görü tekniğidir. Omuzlar, dirsekler, bilekler, kalçalar, dizler ve ayak bilekleri gibi 17 ila 133 arası değişen sayıda eklem noktası tahmin edilerek kişinin tüm vücut duruşu sayısal olarak modellenir. Teknoloji iki temel boyut üzerinde sınıflandırılır. İki Boyutlu (2B) Poz Tahmini, görüntüdeki piksel koordinatlarında x ve y değerleri olarak eklem noktalarını belirler; hesaplama yükü düşüktür ve gerçek zamanlı uygulamalarda öne çıkar. Üç Boyutlu (3B) Poz Tahmini ise derinlik (z) bilgisini de hesaba katarak gerçek dünya koordinatlarında iskelet çıkarır; bu yöntem biyomekanik analiz ve spor performansı ölçümü için tercih edilir. Mimari yaklaşımlar açısından iki temel strateji mevcuttur. Yukarıdan Aşağıya (Top-Down) yöntemde önce bir nesne tespiti modeliyle her kişi çerçevelenir, ardından her birey için poz ayrıca hesaplanır; bu yaklaşım doğruluk açısından üstündür. Aşağıdan Yukarıya (Bottom-Up) yöntemde ise görüntüdeki tüm eklem noktaları tek seferde tahmin edilip bireylere atanır; kalabalık sahnelerde daha verimli çalışır. Alandaki öncü araçlar şunlardır: Carnegie Mellon Üniversitesi'nin geliştirdiği OpenPose (2017) çok kişili poz tahmininde referans çalışma olmuştur; Google'ın MediaPipe BlazePose mimarisi 30 FPS'in üzerinde gerçek zamanlı mobil çalışma sağlar; transformer tabanlı ViTPose ve ViTPose++ ise COCO ve MPII başarım ölçütlerinde en yüksek sonuçları elinde tutmaktadır. Uygulama alanları son derece geniştir: spor performansı analizi ve koçluk, fizyoterapi ve rehabilitasyon takibi, artırılmış ve sanal gerçeklik etkileşimi, oyun kontrolü, güvenlik kamerasında davranış analizi, endüstriyel ergonomi denetimi ve insansız araç sistemlerinde insan algısı bu alanların başında gelir. Temel teknik zorluklar arasında örtülme (occlusion), kıyafet çeşitliliği nedeniyle görünüm değişkenliği, bakış açısı belirsizliği ve kaynakları sınırlı cihazlarda gerçek zamanlı işleme bulunmaktadır. Derin öğrenme yöntemleri ve büyük ölçekli veri setleri bu zorlukların büyük bölümünü aşmayı başarmıştır.

arrow_forward
🖼️

Image Captioning (Görüntü Altyazılama)

Image Captioning (Görüntü Altyazılama), bir görüntünün içeriğini otomatik olarak doğal dilde açıklayan çok modlu (multimodal) yapay zeka tekniğidir. Erişilebilirlik alt metni üretmekten e-ticaret ürün açıklamasına, güvenlik kamerası analizinden tıbbi görüntü raporlamasına uzanan geniş bir kullanım yelpazesine sahiptir. Teknik açıdan modern sistemler encoder-decoder çerçevesine dayanır. Görüntü encoder'ı (ViT, CNN veya bunların birleşimi), piksel matrisini yoğun bir özellik vektörüne sıkıştırır. Metin decoder'ı (genellikle transformer tabanlı bir dil modeli), bu vektörü koşul olarak alarak sözcük sözcük açıklamayı üretir. Eğitim için görüntü-metin çifti veri setleri kullanılır: MS-COCO (her görüntü için 5 farklı insan referansı), Flickr30K ve Conceptual Captions başlıca kaynaklardır. 2022'de Salesforce'un yayımladığı BLIP (Bootstrapping Language-Image Pre-Training), web'den derlenen gürültülü görüntü-altyazı çiftlerini kendi kendine filtreleyerek eğitim kalitesini artırdı. Microsoft'un GIT (Generative Image-to-Text) modeli, her decoder katmanına görsel özellik enjekte ederek metinsel bağlamı korur. Google DeepMind'ın Flamingo modeli büyük dil modelini görsel girdi ile koşullandırarak few-shot image captioning'de yeni referanslar belirledi. BLIP-2, LLaVA ve Qwen-VL gibi daha yeni sistemler ise görüntü altyazılamanın ötesine geçerek görsel soru yanıtlama (VQA) ve yönerge takibini tek mimaride birleştirmektedir. Değerlendirmede BLEU, METEOR ve ROUGE gibi metin benzerliği metrikleri yanı sıra, image captioning'e özgü CIDEr (Consensus-based Image Description Evaluation) ve SPICE metrikleri kullanılır. CIDEr, insan referans açıklamalarıyla konsensüse dayalı n-gram benzerliğini ölçer; SPICE ise sahne grafiği (scene graph) ayrıştırması yaparak anlamsal doğruluğu değerlendirir. Türkiye'de erişilebilirlik mevzuatı (Ekim 2023'ten itibaren kamu web sitelerinde WCAG 2.1 AA zorunluluğu) görüntü altyazılama teknolojisine kurumsal talebi artırmaktadır. E-ticaret platformları görsel ürün kataloğunu metin olarak indeksleyerek arama motorlarında görünürlük elde etmekte; medya ve yayın arşivleri tarihî fotoğrafları otomatik etiketlemek için bu teknikten yararlanmaktadır.

arrow_forward
code_blocks

Keypoint Detection (Anahtar Nokta Tespiti)

Anahtar nokta tespiti (keypoint detection), bir görüntü veya videodaki anlam taşıyan belirli nokta konumlarını tespit eden bilgisayarlı görü görevidir. Bu noktalar; insan vücudundaki eklem yerleri (dirsek, diz, omuz), yüz anatomisi (göz köşeleri, burun, ağız), ya da nesneler üzerindeki köşe ve kenar noktaları olabilir. Her anahtar nokta, bir koordinat çifti (x, y) ve isteğe bağlı görünürlük skoru ile temsil edilir. Klasik yöntemler arasında Harris köşe detektörü (1988), SIFT (Scale-Invariant Feature Transform, 2004) ve ORB (Oriented FAST and Rotated BRIEF) sayılabilir. Bu yöntemler, el ile tasarlanmış matematiksel özniteliklere dayanır ve ölçek ile döndürme değişmezliği sunar. Ancak derin öğrenme çağında, CNN tabanlı mimariler bu klasik yöntemlerin çok ötesine geçti. Modern derin öğrenme yaklaşımları ısı haritası (heatmap) stratejisi benimser: ağ, her olası anahtar nokta konumu için bir olasılık haritası üretir; haritanın doruk noktası ilgili eklem ya da anatomi konumuna karşılık gelir. HRNet (High-Resolution Network), StackedHourglass ve YOLO'nun poz başlığı bu anlayışla çalışan başlıca modellerdir. ViTPose gibi Transformer tabanlı mimariler ise küresel dikkat mekanizması ile bağlamı daha geniş bir alanda değerlendirir ve COCO kıyaslamalarında üstün başarı çıtaları koyar. Uygulamalar arasında insan poz tahmini, yüz tanıma, el takibi, artırılmış gerçeklik, spor video analitiği, tıbbi görüntüleme, otonom araç algısı ve robotik kavrama planlaması sayılabilir. Standart kıyaslama için COCO Keypoints veri kümesi ve OKS (Object Keypoint Similarity) metriği yaygın olarak kullanılır. Birden fazla kişinin bulunduğu sahnelerde top-down yaklaşım (önce kişi tespiti, ardından her kişi için nokta tahmini) ve bottom-up yaklaşım (tüm iskelet noktalarını bul, sonra kişilere ata) olmak üzere iki temel strateji uygulanır. MediaPipe, OpenPose ve Ultralytics YOLO-pose bu iki yaklaşımın popüler uygulamalarıdır. Video tabanlı uygulamalarda zamansal tutarlılık kritik öneme sahiptir; Kalman filtresi veya hareketli ortalama ile nokta yörüngesi düzeltilerek titreme azaltılır. 3D anahtar nokta tespitinde ise VideoPose3D gibi modeller, 2D tahminleri derinlik boyutuna kaldırarak üç boyutlu iskelet çıkarır. Türkiye'de spor bilimleri ve rehabilitasyon alanında keypoint detection tabanlı hareket analizi uygulamaları giderek yaygınlaşmaktadır.

arrow_forward
code_blocks

Sinirsel Stil Transferi (Sinirsel Stil Transferi)

Sinirsel stil transferi (Neural Style Transfer, NST), bir kaynak görüntünün fotografik içeriğini — nesneler, yapı, kompozisyon — korurken başka bir referans görüntünün sanatsal stilini — fırça darbeleri, renk paleti, doku — bu görüntüye aktaran derin öğrenme tekniğidir. 2015 yılında Leon Gatys, Alexander Ecker ve Matthias Bethge tarafından yayımlanan 'A Neural Algorithm of Artistic Style' başlıklı çalışmayla kamuoyuna tanıtılan bu yöntem, evrişimli sinir ağlarının (CNN) özellik çıkarma kapasitesini sanatsal bir amaca yöneltmiştir. Teknik; bir fotoğrafı Van Gogh'un Yıldızlı Gece tablosunun stiliyle yeniden işlemek ya da bir çizimi Monet empresyonizmi içinde canlandırmak gibi uygulamaları mümkün kılmıştır. NST, derin öğrenme ile yaratıcı görsel üretimin kesişim noktasındaki en erken ve en etkili örneklerden biri olmuştur. Teorik temeli, önceden eğitilmiş bir CNN ağının — genellikle ImageNet üzerinde eğitilmiş VGG-16 ya da VGG-19 — hem içerik hem de stil bilgisini katmansal özellikler aracılığıyla ayrıştırabilmesine dayanmaktadır. İçerik bilgisi, ağın derin katmanlarındaki yüksek seviyeli aktivasyonlarda kodlanırken; stil bilgisi farklı katmanlardaki özellik haritaları arasındaki istatistiksel korelasyonları temsil eden Gram matrisleriyle yakalanmaktadır. Optimizasyon süreci, rastgele gürültüden başlayan bir görüntüyü yüzlerce gradyan adımıyla hem içerik kaybını hem de stil kaybını eş zamanlı azaltacak biçimde şekillendirir. Bu kayıpların ağırlıklı toplamını minimize etmek, iki kaynaktan gelen bilgiyi dengeli biçimde harmanlayan son çıktıyı üretir. Johnson ve arkadaşlarının 2016'da geliştirdiği hızlı stil transferi, önceden eğitilmiş bir dönüştürücü ağ kullanarak işlemi gerçek zamanlı hıza taşımıştır. AdaIN (Adaptive Instance Normalization) yaklaşımı ise herhangi bir stil görüntüsünü tek bir modelle anlık uygulamanın yolunu açmış; bu fikir StyleGAN başta olmak üzere pek çok modern üretken mimarinin içine taşınmıştır. NST günümüzde akıllı telefon uygulamaları, sosyal medya filtreleri, oyun tasarımı ve film konsept sanatı gibi geniş bir alanda kullanılmakta; difüzyon modellerinin yükselişiyle birlikte ise daha semantik ve kontrol edilebilir stil aktarımının temeline ilham kaynağı olmayı sürdürmektedir.

arrow_forward
hd

Süper Çözünürlük (Süper Çözünürlük)

Süper çözünürlük (super-resolution), düşük çözünürlüklü (Low-Resolution / LR) bir görüntüden yüksek çözünürlüklü (High-Resolution / HR) bir görüntü elde etme işlemidir. Geleneksel bicubic enterpolasyon yöntemi yalnızca komşu piksel değerlerinin ağırlıklı ortalamasını alarak görüntüyü büyütür; bu süreç var olan bilginin yeniden dağıtılmasından ibarettir ve kenarları yumuşatıp bulanık bir sonuç üretir. Derin öğrenme tabanlı süper çözünürlük modelleri ise farklı bir strateji izler: milyonlarca LR–HR görüntü çiftinden öğrendikleri istatistiksel örüntüleri kullanarak görüntüde var olmayan piksel bilgisini halüsinasyon yoluyla üretirler. Bu 'halüsinasyon', kontrollü ve istatistiksel açıdan tutarlı olduğunda gerçek bir görsel zenginleşme yaratır; ancak yanlış öğrenilmiş bir modelde asıl görüntüde bulunmayan yapılar da eklenebilir. SRCNN (2014) alanın ilk derin öğrenme modelidir; üç konvolüsyon katmanıyla bile bicubic yöntemini PSNR metriğinde net biçimde geride bırakmıştır. SRGAN (2017) ise GAN çerçevesini devreye sokarak perceptual kaliteyi matematiksel metriklerden ayırdı: model daha düşük PSNR üretmesine rağmen insan gözüne çok daha doğal göründü. ESRGAN ve Real-ESRGAN gerçek dünya bozulmalarına (JPEG artefaktı, film tanesi, odak bulanıklığı) dayanıklı hale gelirken, SwinIR (2021) Swin Transformer mimarisiyle uzun menzilli bağımlılıkları yakalayarak referans model konumuna yükseldi. 2023'ten itibaren StableSR ve DiffBIR gibi difüzyon tabanlı modeller, gürültüyü kademeli olarak gidererek son derece gerçekçi dokular ve yüz detayları üretmeyi başardı. Uygulama alanları son derece geniştir: tıbbi görüntülemede MRI ve BT kesitlerinin netliği artırılırken, uydu görüntülerinde bina veya arazi örtüsü tespiti iyileştirilir. Dijital arşivlerde bozulmuş fotoğraflar restore edilir, video akışında düşük bant genişliği için sıkıştırılmış içerik yüksek çözünürlükte yeniden yapılandırılır. PSNR ve SSIM uzun süre temel metrikler olarak kullanılmış; ancak LPIPS ve DISTS gibi perceptual metrikler, insan algısıyla çok daha iyi örtüşen ölçümler sunmaktadır. Video süper çözünürlükte kareler arası tutarlılık ek bir zorluk oluşturur: optik akış hizalaması veya temporal attention mekanizmaları bu titreme (flickering) sorununu gidermek için kullanılır.

arrow_forward