tag CNN
Audio Classification (Ses Sınıflandırma)
Bu sayfada CNN (Audio Classification (Ses Sınıflandırma)) etiketi ile işaretlenmiş 11 yapay zeka kavramını bulabilirsiniz.
Ses sınıflandırma (Audio Classification), bir ses kaydını önceden tanımlanmış kategorilerden birine veya birkaçına atayan makine öğrenmesi görevidir. Konuşma tanıma, müzik türü tespiti, çevre sesi analizi, hayvan türü teşhisi ve sanayi makinelerinde arıza tespiti bu alanın tipik uygulama örnekleridir. Ses sınıflandırma sürecinde ham ses sinyali önce ön işlemden geçirilir. Kısa zamanlı Fourier dönüşümü (STFT) aracılığıyla zaman-frekans temsili elde edilir ve ardından insan kulağının frekans algısını taklit eden mel ölçeğine dönüştürülerek mel-spektrogram oluşturulur. Bu iki boyutlu görsel temsil, evrişimsel sinir ağlarının (CNN) doğrudan işleyebildiği bir formattır. Ek olarak MFCC (Mel Frekans Kepstrum Katsayıları) ve Chroma özellikleri, farklı görevlerde tamamlayıcı giriş temsilleri olarak kullanılır. Model eğitimi sırasında etiketlenmiş ses veri kümeleri kullanılarak ağ ağırlıkları optimize edilir. Tek etiketli problemlerde kategorik çapraz entropi kaybı yaygın seçimken, bir ses kaydında eş zamanlı birden fazla ses türü bulunabileceği çok etiketli problemlerde ikili çapraz entropi tercih edilir. Büyük ölçekli ön eğitimli modeller —YAMNet, PANN (Pre-trained Audio Neural Networks), BEATs ve Wav2Vec 2.0— transfer learning için güçlü başlangıç noktaları sunar; küçük veri kümelerinde bu modellerin son katmanları yeni kategorilere ince ayarla (fine-tuning) uyarlanır. Ses sınıflandırmanın pratik zorluklarını aşmak kritik öneme sahiptir: gürültülü ortam kayıtları, ses üstüste binmesi (polyphony), veri dengesizliği ve gerçek zamanlı çıkarım kısıtları öne çıkan sorunlardır. Veri artırma teknikleri —zaman kaydırma, perde değiştirme, arka plan gürültüsü ekleme ve SpecAugment— modelin genelleme kapasitesini artırmada etkili yöntemlerdir. Referans kıyaslamalar için AudioSet (632 kategori, yaklaşık iki milyon klip), ESC-50 (çevre sesleri), UrbanSound8K (kentsel sesler) ve FSD50K veri kümeleri yaygın olarak kullanılmaktadır. Bu görev, otomasyon, güvenlik sistemleri ve akıllı cihazlar gibi alanlarda ticari uygulamaların temelini oluşturmaktadır.
Audio Classification (Ses Sınıflandırma)
Ses sınıflandırma (Audio Classification), bir ses kaydını önceden tanımlanmış kategorilerden birine veya birkaçına atayan makine öğrenmesi görevidir. Konuşma tanıma, müzik türü tespiti, çevre sesi analizi, hayvan türü teşhisi ve sanayi makinelerinde arıza tespiti bu alanın tipik uygulama örnekleridir. Ses sınıflandırma sürecinde ham ses sinyali önce ön işlemden geçirilir. Kısa zamanlı Fourier dönüşümü (STFT) aracılığıyla zaman-frekans temsili elde edilir ve ardından insan kulağının frekans algısını taklit eden mel ölçeğine dönüştürülerek mel-spektrogram oluşturulur. Bu iki boyutlu görsel temsil, evrişimsel sinir ağlarının (CNN) doğrudan işleyebildiği bir formattır. Ek olarak MFCC (Mel Frekans Kepstrum Katsayıları) ve Chroma özellikleri, farklı görevlerde tamamlayıcı giriş temsilleri olarak kullanılır. Model eğitimi sırasında etiketlenmiş ses veri kümeleri kullanılarak ağ ağırlıkları optimize edilir. Tek etiketli problemlerde kategorik çapraz entropi kaybı yaygın seçimken, bir ses kaydında eş zamanlı birden fazla ses türü bulunabileceği çok etiketli problemlerde ikili çapraz entropi tercih edilir. Büyük ölçekli ön eğitimli modeller —YAMNet, PANN (Pre-trained Audio Neural Networks), BEATs ve Wav2Vec 2.0— transfer learning için güçlü başlangıç noktaları sunar; küçük veri kümelerinde bu modellerin son katmanları yeni kategorilere ince ayarla (fine-tuning) uyarlanır. Ses sınıflandırmanın pratik zorluklarını aşmak kritik öneme sahiptir: gürültülü ortam kayıtları, ses üstüste binmesi (polyphony), veri dengesizliği ve gerçek zamanlı çıkarım kısıtları öne çıkan sorunlardır. Veri artırma teknikleri —zaman kaydırma, perde değiştirme, arka plan gürültüsü ekleme ve SpecAugment— modelin genelleme kapasitesini artırmada etkili yöntemlerdir. Referans kıyaslamalar için AudioSet (632 kategori, yaklaşık iki milyon klip), ESC-50 (çevre sesleri), UrbanSound8K (kentsel sesler) ve FSD50K veri kümeleri yaygın olarak kullanılmaktadır. Bu görev, otomasyon, güvenlik sistemleri ve akıllı cihazlar gibi alanlarda ticari uygulamaların temelini oluşturmaktadır.
Computer Vision (Bilgisayarlı Görü)
Bilgisayarlı görü (Computer Vision), yapay zekanın dijital görüntü, video ve kameralardan gelen ham piksel verilerini anlayarak anlamlı kararlar üretmesini sağlayan dalıdır. İnsan görsel korteksinin nesne tanıma, derinlik algısı ve hareket takibi gibi yeteneklerini yazılım ve donanım kombinasyonuyla taklit etmeyi hedefler. Temel işlem hattı üç aşamada özetlenebilir: görüntü edinimi (kamera, uydu, tıbbi tarayıcı), özellik çıkarma (kenarlar, dokular, şekiller veya derin öğrenme ile öğrenilmiş gizli temsiller) ve karar verme (sınıflandırma, konumlama, segmentasyon). 2012'de AlexNet'in ImageNet yarışmasında hata oranını yüzde yirmi altıdan on altıya düşürmesi alandaki derin öğrenme devrimini başlattı. Modern bilgisayarlı görü iki ana mimari yoldan ilerler: ResNet ve EfficientNet gibi konvolüsyonel sinir ağları (CNN) görsel özellik çıkarmada standart haline gelirken, 2020'de Google Brain tarafından tanıtılan Vision Transformer (ViT) dikkat mekanizmasını görsel görevlere uyarlayarak büyük veri setlerinde CNN'lere rakip sonuçlar verdi. YOLO (You Only Look Once) serisi tek geçişli mimarisiyle gerçek zamanlı nesne tespitinde endüstri standardı konumundadır. 2023'te Meta'nın yayımladığı SAM (Segment Anything Model) sıfır atışlı segmentasyonla foundation model dönemini bilgisayarlı görüye taşıdı; CLIP (OpenAI, 2021) ise metin-görüntü çift eğitimiyle sıfır atışlı görüntü sınıflandırmasının önünü açtı. GPT-4V ve Gemini Vision gibi büyük dil modelleriyle entegre çok modlu sistemler 2024-2026 döneminde ana akıma girdi. 2026 itibarıyla SAM 2 video segmentasyonunu, Depth Anything v2 tek kamerayla piksel düzeyinde üç boyutlu derinlik çıkarmayı ve YOLO World açık-kelime nesne tespitini mümkün kılmaktadır. Pazar araştırmaları alanın 2030'a kadar yıllık yüzde yirmi beşi aşan bir büyüme oranıyla ilerleyeceğini öngörüyor. AB Yapay Zeka Yasası, kamuya açık alanlarda gerçek zamanlı biyometrik yüz tanımayı yüksek riskli yapay zeka olarak sınıflandırarak sektörde etik denetim çıtasını önemli ölçüde yükseltti.
Derin Öğrenme (Derin Öğrenme)
Derin öğrenme (Deep Learning), insan beyninin sinir ağı yapısından esinlenerek tasarlanmış, çok katmanlı yapay sinir ağlarını kullanan bir makine öğrenimi alt disiplinidir. "Derin" nitelemesi, girdi ile çıktı arasındaki gizli katman (hidden layer) sayısının fazlalığından gelir; bu katmanlar veriden hiyerarşik temsiller öğrenir. Alt katmanlar kenar ve doku gibi düşük düzey özellikleri yakalarken üst katmanlar nesne veya kavram gibi soyut özellikleri kodlar. Alanın dönüm noktası 2012'deki AlexNet'tir: GPU hızlandırma ve büyük veri birleşiminin derin ağları eğitilir kıldığını kanıtlayan bu model, ImageNet yarışmasında önceki rekorları kırarak derin öğrenmeyi ana akıma taşıdı. Temel yapı taşı olan yapay nöron, gelen değerleri ağırlıklı toplar ve ReLU, sigmoid gibi bir aktivasyon fonksiyonundan geçirir. Eğitimde geri yayılım (backpropagation) algoritması, çıktı hatasını katman katman geriye taşıyarak her ağırlığın güncellenmesini sağlar; gradyan inişi (gradient descent) ise bu güncellemeleri yönetir. Adam ve AdamW gibi uyarlamalı optimizatörler öğrenme hızını otomatik olarak ayarlar. Başlıca mimari aileler şunlardır: CNN (evrişimsel sinir ağları) görüntü ve video işlemede standarttır; Transformer 2017'den itibaren NLP'yi ve ardından çok modlu sistemleri domine etmektedir; RNN/LSTM zaman serisi modellemesinde kullanılır; Difüzyon Modelleri görüntü ve ses üretiminde devrim yaratmaktadır. Uygulama alanları geniştir: tıbbi görüntüleme (kanser tespiti), otonom araçlar (nesne algılama), doğal dil işleme (makine çevirisi, metin üretme), konuşma tanıma ve öneri sistemleri. Türkiye'de e-ticaret platformlarının kişiselleştirme motorları, bankacılık sektörünün dolandırıcılık tespit sistemleri ve Türkçe NLP projeleri derin öğrenmeye dayanmaktadır. Transfer öğrenme, milyonlarca örnekle önceden eğitilmiş modelleri yüzlerce ya da binlerce örnekle yeni görevlere uyarlar; bu yaklaşım derin öğrenmeyi küçük veri setlerinde de kullanılabilir kılmaktadır. PyTorch ve TensorFlow başlıca açık kaynak çerçevelerdir; Hugging Face ekosistemi binlerce hazır modele erişim sunar. Temel sınırlamalar arasında büyük veri ve yüksek hesaplama gereksinimi, yorumlanabilirlik eksikliği (kara kutu sorunu) ve dağılım kayması (distribution shift) yer almaktadır. Araştırmacılar bu sorunları ele almak için yorumlanabilir yapay zeka (XAI) teknikleri ve verimli mimari tasarımları geliştirmeyi sürdürmektedir.
Image Recognition (Görüntü Tanıma)
Image recognition (görüntü tanıma), bilgisayar sistemlerinin dijital görüntüler veya video karelerindeki nesneleri, yüzleri, sahneleri ve kalıpları otomatik olarak tanımlayıp sınıflandırma yeteneğidir. İnsan görsel korteksinin işlevini taklit etmeyi hedefleyen bu teknoloji, yapay zeka ve bilgisayarlı görünün (computer vision) en temel uygulamalarından biridir. Görüntü tanımanın kökleri 1960'lara uzanmakla birlikte, teknoloji 2012 yılında gerçek anlamda devrim yaşadı. Geoffrey Hinton liderliğindeki Toronto Üniversitesi ekibi, AlexNet adlı derin öğrenme modeliyle ImageNet görüntü sınıflandırma yarışmasını (ILSVRC) kazanarak hata oranını yüzde 26'dan yüzde 15'e düşürdü. Bu başarı, geleneksel el yapımı özelliklerin (SIFT, HOG) yerini derin sinir ağlarına bırakma sürecini başlattı. Modern görüntü tanıma sistemleri, Evrişimli Sinir Ağları (CNN) üzerine kuruludur. CNN mimarisi, görüntüdeki kenar ve köşeler gibi düşük seviyeli özelliklerden başlayarak giderek daha soyut gösterimlere —kulaklar, gözler, yüzler gibi— doğru ilerler. ResNet (derin kalıntı ağları), EfficientNet ve DenseNet farklı hız-doğruluk dengelerinde kullanılır. 2020'den itibaren Vision Transformer (ViT) mimarileri de rekabetçi sonuçlar vererek CNN'lerle yarışmaktadır. CLIP (Contrastive Language-Image Pre-training) ise metin-görüntü öğrenimini birleştirerek sıfır-atış tanıma kabiliyeti kazandırmaktadır. Görüntü tanıma genel bir çatı kavramdır; altında birkaç farklı görev bulunur: Görüntü sınıflandırma tüm görüntüye tek bir etiket atarken, nesne tespiti (object detection) birden fazla nesnenin sınıfını ve konumunu (bounding box) aynı anda belirler. Anlamsal bölütleme (semantic segmentation) her pikseli bir sınıfla etiketler, örnek bölütleme (instance segmentation) ise her nesne kopyasını ayrı ayrı maskeler. Uygulama alanları son derece geniştir: tıbbi görüntülemede kanser tespiti, otonom araçlarda trafik işareti ve yaya tanıma, e-ticarette görsel ürün arama, üretim hatlarında kalite kontrolü ve güvenlik sistemlerinde yüz doğrulama bunların başında gelir. Değerlendirme metrikleri arasında ImageNet'teki Top-1 ve Top-5 doğruluk oranları en yaygın kullanılanlarıdır; nesne tespiti görevlerinde ise ortalama hassasiyet (mAP) ve Birleşim Üzerinden Kesişim (IoU) tercih edilir.
Object Detection (Nesne Tespiti / Nesne Tanıma)
Nesne tespiti (object detection), bir görüntüde veya videodaki nesnelerin hem varlığını hem de konumunu otomatik olarak belirleyen bilgisayarlı görü tekniğidir. Yalnızca görüntünün genelinde ne olduğunu söyleyen görüntü sınıflandırmasının aksine nesne tespiti her nesnenin çevresine bir sınır kutusu (bounding box) çizer ve nesneyi etiketler. Nesne tespiti sistemleri iki ana kategoride incelenir. İki aşamalı detektörler (two-stage detectors), önce potansiyel nesne bölgeleri önerir (Region Proposal Network), ardından bu bölgeleri sınıflandırır. Faster R-CNN bu kategorinin öncü modelidir. Tek aşamalı detektörler (one-stage detectors), tahmin ve sınıflandırmayı tek bir geçişte gerçekleştirir; YOLO serisi ve SSD bu kategorinin en bilinen modelleridir. YOLO'nun evrimi nesne tespitinin tarihini özetler: YOLOv1 (2016), YOLOv3, YOLOv5, YOLOv8 ve YOLOv11'e uzanan her sürümde hız/doğruluk dengesi iyileştirilmiştir. Ultralytics'in YOLOv8'i, kolay kullanım ve güçlü performanıyla topluluk standardı haline gelmiştir. Transformer tabanlı DETR (Detection Transformer), bounding box tahmini ile dikkat mekanizmasını birleştirerek alanı yenilemiş; anchor-free tasarımıyla geleneksel bileşenlere olan bağımlılığı azaltmıştır. Değerlendirme metriği olarak mAP (mean Average Precision) kullanılır; bu metrik, farklı IoU (Intersection over Union) eşiklerindeki precision-recall eğrisinin altındaki alan ortalamasını ölçür. COCO veri kümesi, nesne tespiti modellerinin karşılaştırılması için endüstri standardı haline gelmiştir. Gerçek zamanlı uygulamalarda (otonom araçlar, güvenlik kameraları, drone görüntü analizi) düşük gecikme kritik olduğundan tek aşamalı detektörler ön plana çıkar. Örnek olarak YOLOv8n (nano), CPU üzerinde 60+ FPS hızında çalışabilirken YOLOv8x (extra large) COCO'da daha yüksek mAP değerleri elde eder. Model seçimi, donanım kısıtları ve doğruluk gereksinimine göre yapılmalıdır; TensorRT ve ONNX optimizasyonu üretim dağıtımında gecikmeyi önemli ölçüde düşürür; bu sayede edge cihazlarda bile gerçek zamanlı çıkarım mümkün olur. Instance segmentation (YOLOv8-seg, Mask R-CNN) ve keypoint detection gibi türev görevler, nesne tespiti altyapısını piksel düzeyi veya iskelet bazlı analizle genişletir.
Pooling (Havuzlama Katmanı)
Havuzlama (Pooling) katmanı, evrişimli sinir ağlarının (CNN) temel bileşenlerinden biridir; özellik haritalarının uzamsal boyutlarını sistematik biçimde küçülterek en önemli bilgilerin yoğunlaştırılmasını sağlar. Evrişim katmanlarından elde edilen yüksek boyutlu aktivasyon haritaları, belirli bir pencere (kernel) içindeki değerleri tek bir değere özetleyerek daha küçük bir temsile dönüştürülür. En yaygın kullanılan türü maksimum havuzlama (max pooling) dur. Bu yöntemde belirlenen pencere (genellikle 2×2) içindeki en yüksek değer alınır ve özellik haritasının boyutu küçültülür. Max pooling, keskin ve belirgin özellikleri ön plana çıkarır; nesne tanıma ve sınıflandırma görevlerinde uygulamaların yaklaşık yüzde 80-90 ında bu yöntem tercih edilir. Ortalama havuzlama (average pooling) ise penceredeki tüm değerlerin ortalamasını alarak daha yumuşak bir temsil oluşturur. Gürültüye karşı daha dirençli olmakla birlikte bazen belirgin özellikleri zayıflatabilir. Küresel ortalama havuzlama (Global Average Pooling, GAP), tüm özellik haritasını tek bir değere indirgeyen modern bir yaklaşımdır. Tam bağlantılı katmanların yerini alabilmesi, parametre sayısını dramatik biçimde azaltır. VGG mimarisinin 138 milyon parametresi ResNet te 25 milyona inmiş olup bu farkın büyük bölümü GAP kullanımından kaynaklanmaktadır. MobileNet ve EfficientNet gibi hafif mimarilerde GAP artık standart bir seçenek hâline gelmiştir. Havuzlama katmanları öğrenilemeyen işlemlerdir; hiçbir ağırlık içermez. Geri yayılım sırasında max pooling yalnızca maksimum değerin bulunduğu konuma gradyanı iletirken diğer konumlara sıfır aktarır (switch mekanizması). Average pooling ise gradyanı penceredeki tüm konumlara eşit biçimde dağıtır. Havuzlamanın kritik bir katkısı translasyon değişmezliği (translation invariance) dir: bir nesne görüntüde birkaç piksel kaymış olsa bile max pooling, bölgenin en güçlü aktivasyonunu yakaladığından benzer sonuçlar üretebilir. Tarihsel olarak AlexNet (2012) ve VGG (2014) gibi öncü mimariler havuzlamaya yoğun biçimde başvurmuştur. Günümüzde adımlı evrişim (strided convolution) ve dilate evrişim gibi öğrenilebilir alternatifler önem kazanmış; Vision Transformer (ViT) gibi dikkat tabanlı modeller ise uzamsal alt örnekleme için dikkat mekanizmalarını tercih etmiştir. Buna karşın, evrişimli tabanlı ve gömülü sistem uygulamalarında havuzlama vazgeçilmez bir bileşen olmayı sürdürmektedir.
Ses Parmak İzi (Audio Fingerprinting) (Ses Parmak İzi)
Ses parmak izi (audio fingerprinting), bir ses kaydinin akustik ozelliklerinden cikarilan kompakt, esise ve saglam bir dijital imzadır. Ayni sarki veya ses iceriginin farkli kayitlarda, yayinlarda veya platformlarda tespitini mumkun kilar; farkli bit hizlarinda kodlanmis, farkli gürültuyle karistirilmis veya kısmi bir sekilde kesilmis kayitlarda bile buyuk dogrulukla esleme yapilabilir. Bu alanin en populer tuketu uygulamasi Shazam'dir. 2002 yilında gelistirilen Shazam, bir garsinin gida yakaladigi ambient sesten muzigi tanimlar. Teknik olarak konusursak Shazam, spektrogram uzerindeki frekans tepe noktalarini isaretleyip bu noktalarin koordinatlarini (zaman, frekans) ve ikili combinasyonlarini bir parmak izi veritabanina kiyaslar. Bu yaklasim gurultu karmasiklığına direncli olup milyonlarca sarkiyi iceren bir veritabaninda milisaniyeler icinde esleme yapabilir. Ticari duzlemde ses parmak izi telif hakki izlemenin temel teknolojisidir. YouTube'un Content ID sistemi, yuklenen videolardaki muzikleri milyonlarca kayitli eserlerin parmak izleriyle karsilastirir; esleme bulundugunda video engellenir veya geliri hak sahibine yonlendirilir. Radyo yayinlarinin izlenmesi, icerik moderasyonu ve dijital muzik dagitim platformlarindaki kopya tespiti diger buyuk kullanim alanlarindan biridir. Ses parmak izi sistemleri tipik olarak iki asamadan olusur: parmak izi cikarma (feature extraction) ve esleme (matching). Feature extraction asamasinda melspectrogram veya STFT uzerinde derin ogrenme yontemleri veya geleneksel akustik ozellik cikarimi (tepe noktasi haritasi) kullanilir. Matching asamasinda hizli yakin komsu arama (LSH - Locality Sensitive Hashing, FAISS gibi vektör veritabanlari) ile milyonlarca parmak izine karsi saniyeler icinde sorgu yapilir. **Sik Sorulan Sorular** **Ses parmak izi ile ses tanima (speech recognition) arasindaki fark nedir?** Ses tanima konusmayi metne donusturur. Ses parmak izi ise sesin icerigi ne oldugunu analiz etmez; yalnizca o sesin daha once gorulup gorulmedigini tespit eder. **Shazam nasil bu kadar hizli calisir?** Shazam'in mimari bulut tarafli bir veritabani ile cihaz tarafindan cikarilan kompakt parmak izini eslesitirir. Parmak izi veritabani ikili hash tabanlari ile sorgulanir ve bu neden milyonlarca eserde saniyeler icinde esleme mumkun olur. **Ses parmak izi copyright infringement icin gercek zamanli kullanilabilir mi?** Evet. YouTube Content ID, Spotify ve Apple Music gibi platformlar yuklenen icerigini anlik parmak izi veritabaniyla karsilastirmak icin gercek zamanli boru hatlari kullanir. **Ses parmak izi AI ile nasil evrimlesimektedir?** Derin ogrenme tabanli parmak izi sistemleri geleneksel spektral tepe nokta yaklasimina kiyasla daha az bilgi ile daha guvenilir esleme sagliyor; kisa snippet'lardan, bozulmus ses kayitlarindan veya karma dil icerikten esleme konusunda daha guclu olduklarini gosteriyor.
Sinirsel Stil Transferi (Sinirsel Stil Transferi)
Sinirsel stil transferi (Neural Style Transfer, NST), bir kaynak görüntünün fotografik içeriğini — nesneler, yapı, kompozisyon — korurken başka bir referans görüntünün sanatsal stilini — fırça darbeleri, renk paleti, doku — bu görüntüye aktaran derin öğrenme tekniğidir. 2015 yılında Leon Gatys, Alexander Ecker ve Matthias Bethge tarafından yayımlanan 'A Neural Algorithm of Artistic Style' başlıklı çalışmayla kamuoyuna tanıtılan bu yöntem, evrişimli sinir ağlarının (CNN) özellik çıkarma kapasitesini sanatsal bir amaca yöneltmiştir. Teknik; bir fotoğrafı Van Gogh'un Yıldızlı Gece tablosunun stiliyle yeniden işlemek ya da bir çizimi Monet empresyonizmi içinde canlandırmak gibi uygulamaları mümkün kılmıştır. NST, derin öğrenme ile yaratıcı görsel üretimin kesişim noktasındaki en erken ve en etkili örneklerden biri olmuştur. Teorik temeli, önceden eğitilmiş bir CNN ağının — genellikle ImageNet üzerinde eğitilmiş VGG-16 ya da VGG-19 — hem içerik hem de stil bilgisini katmansal özellikler aracılığıyla ayrıştırabilmesine dayanmaktadır. İçerik bilgisi, ağın derin katmanlarındaki yüksek seviyeli aktivasyonlarda kodlanırken; stil bilgisi farklı katmanlardaki özellik haritaları arasındaki istatistiksel korelasyonları temsil eden Gram matrisleriyle yakalanmaktadır. Optimizasyon süreci, rastgele gürültüden başlayan bir görüntüyü yüzlerce gradyan adımıyla hem içerik kaybını hem de stil kaybını eş zamanlı azaltacak biçimde şekillendirir. Bu kayıpların ağırlıklı toplamını minimize etmek, iki kaynaktan gelen bilgiyi dengeli biçimde harmanlayan son çıktıyı üretir. Johnson ve arkadaşlarının 2016'da geliştirdiği hızlı stil transferi, önceden eğitilmiş bir dönüştürücü ağ kullanarak işlemi gerçek zamanlı hıza taşımıştır. AdaIN (Adaptive Instance Normalization) yaklaşımı ise herhangi bir stil görüntüsünü tek bir modelle anlık uygulamanın yolunu açmış; bu fikir StyleGAN başta olmak üzere pek çok modern üretken mimarinin içine taşınmıştır. NST günümüzde akıllı telefon uygulamaları, sosyal medya filtreleri, oyun tasarımı ve film konsept sanatı gibi geniş bir alanda kullanılmakta; difüzyon modellerinin yükselişiyle birlikte ise daha semantik ve kontrol edilebilir stil aktarımının temeline ilham kaynağı olmayı sürdürmektedir.
U-Net (U-Net Mimarisi)
U-Net, Olaf Ronneberger ve arkadaşları tarafından 2015 yılında tıbbi görüntü segmentasyonu için geliştirilen, encoder-decoder yapısını simetrik atlama bağlantılarıyla (skip connections) birleştiren bir evrişimli sinir ağı mimarisidir. "U-Net: Convolutional Networks for Biomedical Image Segmentation" adlı makaleyle MICCAI 2015'te sunulan bu mimari, tek bir GPU'da saatler içinde eğitilebilmesi ve az etiketli veriyle çalışabilmesiyle dikkat çekti. Bugün hem tıbbi görüntü analizinin hem de difüzyon tabanlı görüntü üretiminin standart bileşeni hâline gelmiştir. Mimari iki simetrik koldan oluşur ve U harfi şeklindeki diyagramından adını alır. Encoder (daralma yolu), bir dizi konvolüsyon bloğu ve max-pooling katmanıyla görüntüden giderek soyutlanan özellikler çıkarır; her katmanda uzamsal boyut yarıya iner, kanal sayısı iki katına çıkar (ör. 64→128→256→512). Decoder (genişleme yolu), transposed convolution veya bilinear upsampling ile uzamsal boyutu kademeli olarak geri kazanır. Her çözünürlük seviyesinde encoder çıkışı, decoder girişiyle kanala göre birleştirilerek (concatenate) hem ince mekânsal ayrıntılar hem de derin anlambilimsel bilgi eş zamanlı korunur — bu skip connections mimarinin temel yeniliğidir. U-Net'in kritik özelliklerinden biri az etiketli veriyle güçlü sonuçlar üretebilmesidir. Orijinal çalışmada yalnızca 30 eğitim görüntüsüyle rekabetçi segmentasyon başarısı elde edildi; elastic deformation ve ağır veri artırma (data augmentation) bu başarıda belirleyici rol oynadı. Mimari her piksel için sınıf etiketi ürettiğinden "tam evrişimli" (fully convolutional) kategorisine girer; sabit boyutlu giriş kısıtı yoktur ve farklı çözünürlüklerdeki görüntülere doğrudan uygulanabilir. Zaman içinde birçok türev mimari geliştirildi: Attention U-Net gürültülü bağlamlarda yalnızca ilgili özellikleri vurgulayan dikkat kapıları ekler; nnU-Net medikal veri kümelerini otomatik yapılandırır; 3D U-Net hacimsel MRI ve BT verilerini işler; Swin-UNet transformatör bloklarını U şekliyle birleştirir. 2020'den itibaren DDPM ve Stable Diffusion gibi difüzyon modellerinin gürültü tahmin ağı (ε-network) olarak U-Net'i benimsemesi, mimarinin görüntü üretimi alanındaki önemini de pekiştirdi.
Image Classification (Görüntü Sınıflandırma)
Görüntü sınıflandırma (image classification), bir bilgisayar görü görevidir ve modelin girdi görüntüsünü önceden tanımlanmış kategorilerden birine atamasını gerektirir. Nesne tespiti bölge koordinatları, bölütleme piksel maskeleri çıkarırken sınıflandırma yalnızca "bu görüntüde ne var?" sorusunu yanıtlar. 2012 yılında AlexNet'in ImageNet Large Scale Visual Recognition Challenge (ILSVRC) yarışmasında derin evrişimli sinir ağlarını kullanarak top-5 hata oranını %26'dan %17'ye indirmesi alanın dönüm noktasıdır. Bunu VGGNet, GoogLeNet (Inception) ve 2015'te ResNet izledi; ResNet'in artık bağlantıları (residual connections) gradyan kaybını çözerek 152 katmanlı ağların eğitimini olanaklı kıldı. Bu gelişmeyle insan düzeyi doğruluğun (~%5 top-5 hata) altına inildi. Modern görüntü sınıflandırma ardışık düzeni şu adımları izler: ham pikseller evrişimli katmanlar aracılığıyla özellik haritalarına dönüştürülür; global havuzlama ile sabit boyutlu vektöre indirgenir; son katmanda Softmax fonksiyonu her sınıf için olasılık dağılımı üretir. Top-1 doğruluk (en yüksek olasılıklı sınıf) ve top-5 doğruluk (ilk beş tahmin içinde gerçek sınıfın bulunması) temel değerlendirme metrikleridir. Transfer öğrenme uygulamalarda belirleyici hâle gelmiştir: ImageNet'te ön eğitilmiş bir model alınarak son katmanları hedefe özgü sınıflar için ince ayar yapılır. Bu yöntem veri gereksinimini ve eğitim süresini önemli ölçüde azaltır. EfficientNet, bileşik ölçeklendirme ile doğruluk ve hesaplama verimliliğini birlikte optimize eden bir yaklaşım sunarken Vision Transformer (ViT), 2020'den itibaren saf dikkat mekanizmasıyla CNN tabanlı modellere kıyaslanabilir performans elde etmiştir. ConvNeXt ise Transformer tasarım ilkelerini CNN mimarisine taşıyarak 2022'de kıyaslama tablolarında üst sıralara yerleşmiştir. Tıbbi görüntüleme (radyoloji, patoloji), tarımsal zararlı ve hastalık tespiti, kalite kontrol sistemleri ve uydu görüntüsü analizi başlıca uygulama alanlarını oluşturmaktadır. Öte yandan, eğitim dağılımından farklı verilerle performansın dramatik düşmesi (dağılım kayması) ve önyargılı eğitim kümelerinden kaynaklanan adalet sorunları, uygulamalarda dikkat edilmesi gereken kritik kısıtlamalardır.
ReLU (Doğrultulmuş Doğrusal Birim)
ReLU, yapay sinir ağlarında nöronların çıktısını belirleyen bir aktivasyon fonksiyonudur. Formülü basittir: girdi sıfırdan büyükse olduğu gibi geçer, sıfır veya altındaysa sıfır döner. Bu basitlik, derin ağlarda on yıl boyunca hâkim olan sigmoid ve tanh fonksiyonlarının yerini almasının asıl nedenidir. Sigmoid ve tanh, girdi değerleri çok büyüdüğünde ya da çok küçüldüğünde gradyanları neredeyse sıfıra yaklaştırır. Geri yayılım sırasında bu küçük gradyanlar katman katman çarpılır; on, yirmi katmanlı bir ağda en baştaki katmanlara ulaşan gradyan fiilen yokolur. Ağırlıklar güncellenemez, ağ öğrenemez. Bu soruna kaybolan gradyan problemi denir ve 1990'larda derin ağ araştırmalarının önündeki en büyük engellerden biriydi. ReLU bu problemi doğrudan çözer. Pozitif girdiler için gradyan her zaman 1'dir; çarpma işlemi değeri küçültmez. Bunun yanı sıra üs veya üstel fonksiyon gerektirmediğinden hesaplaması sigmoid ve tanh'a göre çok daha hızlıdır. GPU'larda paralel işlem yapıldığında bu fark büyük ağlarda ciddi zaman tasarrufuna dönüşür. Pratikteki etkisi 2012 AlexNet modeliyle belgelenmiştir. Krizhevsky ve ekibi, aynı mimaride sigmoid yerine ReLU kullanarak eğitim süresini altıda bire indirmiştir. O tarihten bu yana derin öğrenmede gizli katman aktivasyonu denildiğinde varsayılan seçenek ReLU olmuştur. Ancak ReLU kusursuz değildir. Negatif girdi alan nöronlar sürekli sıfır çıktısı üretir ve gradyanları sıfır olduğundan bir daha güncellenemezler. Buna ölü ReLU problemi denir. Yüksek öğrenme hızı kullanıldığında veya ağırlıklar olumsuz başlatıldığında ağdaki nöronların önemli bir kısmı bu duruma düşebilir. Bu soruna karşı geliştirilen varyantlar mevcuttur: Leaky ReLU negatif girdiler için küçük bir eğim (genellikle 0,01) kullanır. PReLU bu eğimi öğrenilebilir bir parametre haline getirir. ELU negatif bölgede üstel bir eğri kullanarak ortalama aktivasyonu sıfıra yaklaştırır. GELU ise girdiyi bir olasılık ağırlığıyla çarpar ve özellikle dil modellerinde (BERT, GPT) tercih edilir. ReLU bugün evrişimli sinir ağlarında, derin tam bağlantılı ağlarda ve görüntü sınıflandırma modellerinin büyük çoğunluğunda gizli katman aktivasyonu olarak kullanılmaktadır.