tag computer-vision

Affective Computing (Duyuşsal Bilişim (Duygu YZ))

Bu sayfada computer-vision (Affective Computing (Duyuşsal Bilişim (Duygu YZ))) etiketi ile işaretlenmiş 6 yapay zeka kavramını bulabilirsiniz.

Affektif hesaplama (affective computing), bilgisayar sistemlerinin insan duygularini algilama, yorumlama, isleme ve uygun sekilde yanit verme yeteneklerini gelistirmeyi amaclayan disiplinlerarasi bir arastirma alanidur. Bilisim bilimi, psikoloji, bilissel bilim ve noro-bilim kesisiminde yer alir. Alanin kurucu metni, Rosalind Picard'in 1997 tarihli "Affective Computing" kitabidur. Picard, insan-bilgisayar etkilesiminin duygusal boyutunun ihmal edildigini one cikardi ve duygusal zeka gelistirilmis makinelerin hem verimli hem de insancil sistemlere yol acacagini savundu. Affektif hesaplama sistemleri farkli girdi modalitelerini kullanir. Goruntu isleme ile yuz ifade analizi; Facial Action Coding System (FACS) gibi standartlara dayali olarak mutluluk, kizginlik, uzuntu, korku, saskinlik, tiksinme ve notr duygulari siniflandirir. Ses analizi; konusma tonu, ritim ve ses yuksekligindeki degisimleri duygusal durum gostergesi olarak yorumlar. Fizyolojik sinyaller; EEG, elektrodermal aktivite (deri iletkenlik), kalp atim degiskenligi ve goz izleme bilincalti duygusal durumu icin guvenilir kanallar sunar. Metin duygu analizi ise yazili dilin duygusal polaritesini degerlendiren NLP teknikleridir. Uygulama alanlari son derece genistir. Egitim teknolojisinde ogrencinin anlasma veya hayal kirikligi duzeyini gercek zamanli izleyip ders icerigi ve hizini kisisellestirebilir. Saglik alanyında depresyon veya anksiyete izleme, demans hastalarinin duygusal refah takibi ve terapi destek sistemleri araştirma asamasindadir. Surucu guvenligi sistemleri yorgunluk veya dikkat dagiticilik tespiti icin kullanilmaktadir. Etik boyut onemlidir. Duygu tanima sistemleri irk, cinsiyet ve kultur kirilimlarinda sistemli yanlilık sergileyebilir. Bir is basvurusundaki adayin veya bir siniftaki ogrencinin duygularinin otomatik olarak izlenmesi, riza ve mahremiyet sorunlarini gundeme getirir. AB Yapay Zeka Yasasi bu endiselerle calisma ortami ve egitim gibi baglaamlardaki duygu tanima kullanimini yuksek riskli sinifta kategorize etmistir. **Sik Sorulan Sorular** **Duygu tanima guvenilir midir?** Arastirmalar yuz ifadesi bazli sistemlerin kucuk, cogunlukla homojen veri kumeleri uzerinde iyi calistigini; gercek dunya uygulamalarinda ise irk, cinsiyet ve kultur kirilimlarinda onemli hata oranlari sergiledigini gostermistir. **Affektif hesaplama ile duygu analizi arasindaki fark nedir?** Duygu analizi (sentiment analysis) genellikle metinden duygusal polarite (olumlu/olumsuz) cikarir. Affektif hesaplama daha genis bir kavramdir: ses, goruntu ve fizyolojik sinyalleri de kapsayan cok modalli bir yaklasim ve insan-bilgisayar etkilesimi perspektifini icermektedir. **AB Yapay Zeka Yasasi affektif hesaplamay nasil duzenliyor?** Calisma ortami, egitim ve hukuki baglamlarda duygu tanima yuksek riskli olarak siniflandirilmistir. Bu uygulamalar siki seffaflik, insan gozetimi ve uyumluluk gereksinimleri altindadir. **Affektif hesaplamanin gelecegi nedir?** Norolojik sinyaller ve cok modalli veri fusion'u ile daha guvenilir sistemler ongorulmektedir. Bununla birlikte etigin ve yasamin netlesmesi, alanin buyume yonunu belirleyici rol oynamaktadir.

psychology_alt

Affective Computing (Duyuşsal Bilişim (Duygu YZ))

Affektif hesaplama (affective computing), bilgisayar sistemlerinin insan duygularini algilama, yorumlama, isleme ve uygun sekilde yanit verme yeteneklerini gelistirmeyi amaclayan disiplinlerarasi bir arastirma alanidur. Bilisim bilimi, psikoloji, bilissel bilim ve noro-bilim kesisiminde yer alir. Alanin kurucu metni, Rosalind Picard'in 1997 tarihli "Affective Computing" kitabidur. Picard, insan-bilgisayar etkilesiminin duygusal boyutunun ihmal edildigini one cikardi ve duygusal zeka gelistirilmis makinelerin hem verimli hem de insancil sistemlere yol acacagini savundu. Affektif hesaplama sistemleri farkli girdi modalitelerini kullanir. Goruntu isleme ile yuz ifade analizi; Facial Action Coding System (FACS) gibi standartlara dayali olarak mutluluk, kizginlik, uzuntu, korku, saskinlik, tiksinme ve notr duygulari siniflandirir. Ses analizi; konusma tonu, ritim ve ses yuksekligindeki degisimleri duygusal durum gostergesi olarak yorumlar. Fizyolojik sinyaller; EEG, elektrodermal aktivite (deri iletkenlik), kalp atim degiskenligi ve goz izleme bilincalti duygusal durumu icin guvenilir kanallar sunar. Metin duygu analizi ise yazili dilin duygusal polaritesini degerlendiren NLP teknikleridir. Uygulama alanlari son derece genistir. Egitim teknolojisinde ogrencinin anlasma veya hayal kirikligi duzeyini gercek zamanli izleyip ders icerigi ve hizini kisisellestirebilir. Saglik alanyında depresyon veya anksiyete izleme, demans hastalarinin duygusal refah takibi ve terapi destek sistemleri araştirma asamasindadir. Surucu guvenligi sistemleri yorgunluk veya dikkat dagiticilik tespiti icin kullanilmaktadir. Etik boyut onemlidir. Duygu tanima sistemleri irk, cinsiyet ve kultur kirilimlarinda sistemli yanlilık sergileyebilir. Bir is basvurusundaki adayin veya bir siniftaki ogrencinin duygularinin otomatik olarak izlenmesi, riza ve mahremiyet sorunlarini gundeme getirir. AB Yapay Zeka Yasasi bu endiselerle calisma ortami ve egitim gibi baglaamlardaki duygu tanima kullanimini yuksek riskli sinifta kategorize etmistir. **Sik Sorulan Sorular** **Duygu tanima guvenilir midir?** Arastirmalar yuz ifadesi bazli sistemlerin kucuk, cogunlukla homojen veri kumeleri uzerinde iyi calistigini; gercek dunya uygulamalarinda ise irk, cinsiyet ve kultur kirilimlarinda onemli hata oranlari sergiledigini gostermistir. **Affektif hesaplama ile duygu analizi arasindaki fark nedir?** Duygu analizi (sentiment analysis) genellikle metinden duygusal polarite (olumlu/olumsuz) cikarir. Affektif hesaplama daha genis bir kavramdir: ses, goruntu ve fizyolojik sinyalleri de kapsayan cok modalli bir yaklasim ve insan-bilgisayar etkilesimi perspektifini icermektedir. **AB Yapay Zeka Yasasi affektif hesaplamay nasil duzenliyor?** Calisma ortami, egitim ve hukuki baglamlarda duygu tanima yuksek riskli olarak siniflandirilmistir. Bu uygulamalar siki seffaflik, insan gozetimi ve uyumluluk gereksinimleri altindadir. **Affektif hesaplamanin gelecegi nedir?** Norolojik sinyaller ve cok modalli veri fusion'u ile daha guvenilir sistemler ongorulmektedir. Bununla birlikte etigin ve yasamin netlesmesi, alanin buyume yonunu belirleyici rol oynamaktadir.

arrow_forward
panorama

Convolutional Neural Network (CNN) (Evrişimli Sinir Ağı)

CNN (Convolutional Neural Network - Evrisimsel Sinir Agi), goruntu ve uzamsal verilerden hiyerarsik ozellikler cikartan bir derin ogrenme mimarisidir. Evrisme islemi sayesinde modelin her neron'unun tum girdiyle degil yalnizca yerel bir bolgeyle baglantili olmasi, parametre sayisini drastik bicimde azaltir ve uzamsal kaliplari gormek icin idealize edilmis bir yapi olusturur. CNN'in temel yapi tasi evrisme katmanidir. Bu katmanda kucuk bir filtre (kernel), genellikle 3x3 veya 5x5 boyutunda, girdi haritasi uzerinde kayan pencereyle carpma islemi uygular. Her filtre, kenar, doku veya renk gecisi gibi belirli bir uzamsal kaliba duyarlidir. Derin bir CNN'de ilk katmanlar basit kenarlar ogrenirken sonraki katmanlar bu kenarlari birlesitirerek sekiller, nesneler ve nihayet tum nesne kategorileri ogrenir. Havuzlama (pooling) katmanlari evrisme ciktilarinin uzamsal boyutunu kucultmektedir. Max-pooling, belirli bir bolgedeki en buyuk aktivasyon degerini secer; bu sayede model konum degisimlerine karsi olcude direncli hale gelir. Kuculen ozellik haritalari sonraki evrisme katmanlarinin daha genis bir alani gormeyi mumkun kilar. Mimari tarihinde CNN'in yeri kritiktir. Yann LeCun 1989'da el yazisi rakam tanima icin LeNet'i tasarladi. 2012'de Alex Krizhevsky ve ekibi ImageNet yarismmasinda AlexNet ile o zamana kadar gorulmemis bir suc orani saglamasi, derin ogrenme alaninin patlamasini tetikledi. Ardından VGGNet, GoogLeNet, ResNet ve EfficientNet gibi mimariler gorunteden anlama icin yeni standartlar belirledi. Kalan baglantili (residual) katmanlar mimarilerin cok daha derin ancak egitimi kolay hale gelmesini mumkun kildi. CNN'ler goruntu siniflandirma, nesne tespiti (YOLO, SSD), semantik segmentasyon, yuz tanima ve tibbi goruntu analizi gibi alanlarda yayginca kullanilmaktadir. Dil modelleme icin transformer mimarisinin yukselisiyle CNN'in NLP'deki rolu azalmis olsa da gorsel veri icin hala temel mimari olma ozelligini korumaktadir. **Sik Sorulan Sorular** **CNN ile tam baglantili (dense) aglar arasindaki fark nedir?** Tam baglantili aglar her neuronu tum girdiyle baglar; bu parametre patlamasi ve uzamsal bilgi kaybi demektir. CNN yerel baglanti ve agirlik paylasimi ile parametre ekonomisi saglar ve uzamsal kaliplari verimli ogrenilir. **Kucuk veri kumesiyle CNN egitmek mumkun mudur?** Transfer ogrenme ile evet. ImageNet uzerinde onegitim gormis bir CNN'in son katmanlari, kucuk bir ozgun veri kumesiyle ince ayar yapilarak kullanilabilir; bu yaklasim ozelliklede gorsel siniflandirma gorevlerinde yaygindir. **CNN'ler metin icin de kullanilabilir mi?** 1D evrisme katmanlari metin siniflandirma ve sentiment analizinde kullanilmistir. Ancak Transformer mimarisi uzun mesafe bagimliklarini daha iyi modelledigi icin NLP'de CNN'lerin populerligini buyuk olcude assmistir. **GPU CNN egitimini neden bu kadar hizlandiriyor?** Evrisme islemi buyuk olcekli paralel matris carpimlarindan olusur; GPU'larin binden fazla islem cekirdegi bu tip isleri CPU'ya gore onlarca kat daha hizli yurutmek icin optimize edilmistir.

arrow_forward
crop_free

Object Detection (Nesne Tespiti / Nesne Tanıma)

Nesne tespiti (object detection), bir görüntüde veya videodaki nesnelerin hem varlığını hem de konumunu otomatik olarak belirleyen bilgisayarlı görü tekniğidir. Yalnızca görüntünün genelinde ne olduğunu söyleyen görüntü sınıflandırmasının aksine nesne tespiti her nesnenin çevresine bir sınır kutusu (bounding box) çizer ve nesneyi etiketler. Nesne tespiti sistemleri iki ana kategoride incelenir. İki aşamalı detektörler (two-stage detectors), önce potansiyel nesne bölgeleri önerir (Region Proposal Network), ardından bu bölgeleri sınıflandırır. Faster R-CNN bu kategorinin öncü modelidir. Tek aşamalı detektörler (one-stage detectors), tahmin ve sınıflandırmayı tek bir geçişte gerçekleştirir; YOLO serisi ve SSD bu kategorinin en bilinen modelleridir. YOLO'nun evrimi nesne tespitinin tarihini özetler: YOLOv1 (2016), YOLOv3, YOLOv5, YOLOv8 ve YOLOv11'e uzanan her sürümde hız/doğruluk dengesi iyileştirilmiştir. Ultralytics'in YOLOv8'i, kolay kullanım ve güçlü performanıyla topluluk standardı haline gelmiştir. Transformer tabanlı DETR (Detection Transformer), bounding box tahmini ile dikkat mekanizmasını birleştirerek alanı yenilemiş; anchor-free tasarımıyla geleneksel bileşenlere olan bağımlılığı azaltmıştır. Değerlendirme metriği olarak mAP (mean Average Precision) kullanılır; bu metrik, farklı IoU (Intersection over Union) eşiklerindeki precision-recall eğrisinin altındaki alan ortalamasını ölçür. COCO veri kümesi, nesne tespiti modellerinin karşılaştırılması için endüstri standardı haline gelmiştir. Gerçek zamanlı uygulamalarda (otonom araçlar, güvenlik kameraları, drone görüntü analizi) düşük gecikme kritik olduğundan tek aşamalı detektörler ön plana çıkar. Örnek olarak YOLOv8n (nano), CPU üzerinde 60+ FPS hızında çalışabilirken YOLOv8x (extra large) COCO'da daha yüksek mAP değerleri elde eder. Model seçimi, donanım kısıtları ve doğruluk gereksinimine göre yapılmalıdır; TensorRT ve ONNX optimizasyonu üretim dağıtımında gecikmeyi önemli ölçüde düşürür; bu sayede edge cihazlarda bile gerçek zamanlı çıkarım mümkün olur. Instance segmentation (YOLOv8-seg, Mask R-CNN) ve keypoint detection gibi türev görevler, nesne tespiti altyapısını piksel düzeyi veya iskelet bazlı analizle genişletir.

arrow_forward
code_blocks

SAM (SAM (Her Şeyi Segmentleyen Model))

SAM (Segment Anything Model — Her Şeyi Segmentleyen Model), Meta AI Research tarafından 2023'te yayımlanan ve görüntü segmentasyonunda sıfır-atış (zero-shot) genelleştirme yeteneği sunan temel bir bilgisayarlı görü modelidir. Geleneksel segmentasyon modelleri belirli nesne kategorileri için özel olarak eğitilirken SAM, yalnızca bir nokta, sınır kutusu veya metin istemi ile görüntüdeki herhangi bir nesneyi anında segmentleyebilir. Model, 11 milyondan fazla görüntü ve 1,1 milyardan fazla maske içeren SA-1B veri kümesiyle eğitilmiştir — segmentasyon alanındaki en büyük veri setlerinden biridir. SAM üç ana bileşenden oluşur: MAE ile önceden eğitilmiş ViT tabanlı bir görüntü kodlayıcısı, nokta, kutu veya metin girdileri için bir istem kodlayıcısı ve çakışan potansiyel maskeler üreten hafif bir maske dekoderi. Bu mimari, modelin bir görüntüdeki her nesneyi hiçbir kategori bilgisine gerek duymadan ayrıştırmasına imkân tanır. Meta, 2024'te SAM 2'yi yayımladı. SAM 2, SAM'ın video segmentasyonuna genişletilmiş versiyonudur; gerçek zamanlı nesne izleme ve kareler arası tutarlı maske üretimi sunar. Streaming memory mimarisi, daha önce görülmüş karelerin bilgisini saklar ve modelin nesneyi yeniden bulmasına olanak tanır. SAM ile klasik segmentasyon modelleri arasındaki temel ayrım zero-shot kapasitesidir: Mask R-CNN gibi modeller yalnızca eğitildikleri kategorileri tanırken SAM, hiç görmediği nesneleri bile isteme göre ayrıştırır. Bu özellik araştırmacılara ve geliştiricilere büyük esneklik kazandırır; özel veri etiketleme maliyeti olmadan yeni alanlara hızla uyum sağlanabilir. Kullanım alanları oldukça geniştir: tıbbi görüntülemede organ ve lezyon tespiti (MedSAM), otonom araçlarda sahne analizi, AR/VR içerik üretimi, uydu görüntülerinde arazi örtüsü haritalamas ve e-ticaret ürün görsellerinde arka plan kaldırma. Apache 2.0 lisansıyla açık kaynak olarak yayımlanan SAM, MobileSAM ve EfficientSAM gibi hafifletilmiş versiyonlarıyla kenar cihazlara da taşınabilir durumdadır.

arrow_forward
code_blocks

Vision Transformer (ViT) (Görüntü Transformer)

Vision Transformer (ViT), 2020 yılında Google Brain ekibi tarafından yayımlanan "An Image is Worth 16x16 Words" makalesiyle tanıtılan ve görüntü işleme alanında Transformer mimarisini merkeze alan çığır açıcı bir derin öğrenme modelidir. CNN'lerin (Evrişimli Sinir Ağları) onlarca yıl boyunca hâkim olduğu bilgisayarlı görü alanında ViT, bu paradigmayı kökten değiştirmiştir. ViT'in temel çalışma ilkesi görüntüyü sabit boyutlu yamalar (patch) dizisine bölmektir. Örneğin 224×224 piksellik bir görüntü, 16×16 boyutunda 196 yamaya ayrılır; her yama düzleştirilerek (flatten) doğrusal bir projeksiyon katmanından geçirilir ve D-boyutlu bir gömme vektörüne dönüştürülür. Sınıflandırma için öğrenilebilir bir [CLS] tokeni eklenir; tüm yamalara pozisyonel kodlama uygulanarak sıralamanın kaybolması önlenir. Bu vektör dizisi standart Transformer encoder bloklarına — çok başlı öz-dikkat ve ileri beslemeli ağ katmanlarına — beslenir. Çıkışta [CLS] tokeninin gömme vektörü bir MLP kafasına verilerek görüntü sınıfı tahmin edilir. CNN'lerden temel farkı, uzamsal tümevarımsal önyargı (inductive bias) taşımamasıdır. CNN yerel evrişimler ve paylaşımlı ağırlıklarla bu önyargıyı yapıya kodlarken ViT tüm bu örüntüleri veriden öğrenir; bu yüzden JFT-300M gibi çok büyük veri kümelerinde ön eğitim gerektirir. DeiT mimarisi öğretmen-öğrenci damıtma ile bu gereksinimi ImageNet ölçeğine indirmiştir. Başlıca varyantlar arasında Swin Transformer (kayan pencereli dikkat ile hiyerarşik özellik haritaları), BEiT ve MAE (maskeli ön eğitim), DINOv2 (öz-süpervizyon) ve SAM/SAM2 (evrensel segmentasyon) sayılabilir. Nesne tespitinde DETR, semantik segmentasyonda SegFormer, görsel-dilsel temel modellerde CLIP ve Flamingo ViT'i omurga olarak kullanmaktadır. ViT'in dikkat ısı haritaları yorumlanabilirliği artırır: hangi yamaların sınıflandırma kararını etkilediği görselleştirilebilir. Tıbbi görüntülemede, uydu görüntüsü analizinde, otonom araç algı sistemlerinde ve çok-kipli (multimodal) büyük modellerde ViT vazgeçilmez bir bileşen haline gelmiştir. 36.000'i aşkın atıf sayısıyla bu makale, bilgisayarlı görünün en etkili çalışmaları arasına girmiştir.

arrow_forward
code_blocks

Visual Question Answering (Görsel Soru Yanıtlama)

Visual Question Answering (VQA), bir yapay zeka sisteminin bir görüntü ve doğal dilde yazılmış bir soru alarak metin tabanlı yanıt ürettiği çok modaliteli (multimodal) yapay zeka görevidir. Bilgisayarlı görü (Computer Vision) ile doğal dil işlemenin (NLP) kesişiminde yer alan VQA, makinelerin görsel dünyayı anlamasını ve bu anlayışı dil aracılığıyla ifade etmesini gerektirir. Bir VQA sistemi üç temel bileşenden oluşur: görsel özellik çıkarıcı (vision encoder), dil modeli (text encoder) ve füzyon mekanizması. Görsel encoder — başlangıçta konvolüsyonel sinir ağları (CNN), günümüzde ise Vision Transformer (ViT) mimarileri — giriş görüntüsünü yüksek boyutlu özellik vektörlerine dönüştürür. Metin encoder ise soruyu token dizisine çevirir. Füzyon katmanı, çapraz dikkat (cross-attention) mekanizmasıyla iki modalite arasında bağlantı kurar; böylece model soruyla ilgili görüntü bölgelerine odaklanarak yanıt üretir. VQA'nın pratik uygulamaları geniş bir yelpazeye yayılır. Tıbbi görüntülemede radyoloji raporlarının otomasyonunda kullanılır; 'Bu BT görüntüsünde tümör var mı?' gibi sorulara yanıt üretebilir. Görsel engelli kullanıcılar için erişilebilirlik araçlarında, müze ve kültürel miras sitelerinde interaktif rehberlik sistemlerinde, otonom araçların çevre anlama modüllerinde ve endüstriyel görsel denetimde (kalite kontrol) da yaygın biçimde yer almaktadır. Öne çıkan VQA modelleri şunlardır: Salesforce'un BLIP ve BLIP-2 modelleri (129 milyon görüntü-metin çiftiyle önceden eğitildi), Meta'nın açık ağırlıklı LLaVA serisi, OpenAI'nin GPT-4o/GPT-4V modelleri ve Google'ın Gemini Vision ailesi. 2023-2026 yılları arasında bu modeller VQA2.0, GQA ve OK-VQA kıyaslama veri setlerinde insana yakın doğruluk oranlarına ulaşmış; bilgi tabanlı VQA (knowledge-based VQA), matematiksel akıl yürütme (MathVQA) ve tıbbi VQA gibi özelleşmiş alt alanlarda yeni değerlendirme serileri geliştirilmiştir. VQA'nın en kritik zorluğu dil önkestirimidir (language priors): modeller görüntüyü gerçekten analiz etmek yerine dil istatistiklerinden yanıt üretebilir; 'Gökyüzü hangi renk?' sorusuna görüntüye bakmaksızın 'mavi' yanıtı verebilir. Modern çözümler arasında Chain-of-Thought akıl yürütme, veri artırma teknikleri ve çoklu adım dikkat (multi-hop attention) mekanizmaları öne çıkar. Türkiye'deki kullanım senaryolarında VQA, sağlık, turizm ve e-ticaret sektörlerinde görüntü tabanlı arama ve erişilebilirlik çözümlerine entegre edilmektedir.

arrow_forward