tag GAN
Generative Adversarial Networks (Üretici Çekişmeli Ağlar)
Bu sayfada GAN (Generative Adversarial Networks (Üretici Çekişmeli Ağlar)) etiketi ile işaretlenmiş 5 yapay zeka kavramını bulabilirsiniz.
GAN (Generative Adversarial Networks — Üretici Çekişmeli Ağlar), 2014 yılında Ian Goodfellow ve ekibi tarafından Montréal Üniversitesi'nde geliştirilen devrimsel bir derin öğrenme mimarisidir. Sistem, birbirine rakip iki yapay sinir ağından oluşur: Üretici (Generator) ve Ayırt Edici (Discriminator). Bu iki ağın rekabeti, gerçeğinden ayırt edilemeyen görüntü, ses ve video içeriklerinin üretilebilmesini sağlar. Üretici ağ, rastgele gürültüden yola çıkarak gerçekçi görünümlü içerik sentezler. Ayırt Edici ağ ise kendisine sunulan içeriğin gerçek mi yoksa üretici tarafından yaratılmış mı olduğunu belirlemeye çalışır. Bu süreç, oyun teorisindeki sıfır-toplam oyununa benzer: Üretici, Ayırt Ediciyi kandırmaya; Ayırt Edici de sahtekarlığı yakalamaya çalışır. İki ağ binlerce iterasyon boyunca birlikte eğitildikçe her ikisi de gelişir; son noktada Üretici öyle gerçekçi çıktılar üretir ki Ayırt Edici artık gerçeği sahteden ayırt edemez. GAN mimarisinin en çarpıcı uygulaması ThisPersonDoesNotExist.com sitesindeki hiper-gerçekçi yüzlerdir; bu yüzlerin sahibi gerçek bir insan değildir. Bunun yanı sıra GAN'lar; düşük çözünürlüklü görüntüleri 4K'ya yükseltme (süper çözünürlük), stil transferi, tıbbi görüntü veri setlerini yapay örneklerle büyütme ve deepfake video üretimi gibi alanlarda yaygın biçimde kullanılır. En bilinen GAN varyantları arasında foto-gerçekçi yüz sentezi için NVIDIA'nın StyleGAN2/3'ü, eşleştirilmemiş veri setleriyle at-zebra dönüşümü gibi görevler için CycleGAN ve uydu-harita çevirisi gibi eşleştirilmiş dönüşümler için Pix2Pix sayılabilir. GAN'ların en büyük zayıflığı eğitim sürecindeki istikrarsızlıktır. Mode collapse sorunu, Üreticinin çeşitliliği kaybedip yalnızca birkaç tipik örnek üretmesiyle ortaya çıkar. 2022'den itibaren Stable Diffusion ve DALL-E 2 gibi difüzyon modelleri, genel görüntü üretiminde GAN'ın yerini büyük ölçüde almıştır. Bununla birlikte gerçek zamanlı video sentezi ve düşük gecikme gerektiren edge uygulamalarında GAN mimarisi hâlâ önemli konumunu korumaktadır.
Deepfake (Derin Sahtelik)
Deepfake, yapay zeka kullanılarak gerçekçi biçimde sahte görüntü, ses veya video içeriği üretme tekniğidir. Terim, "deep learning" (derin öğrenme) ve "fake" (sahte) sözcüklerinin birleşiminden oluşur ve ilk olarak 2017'de Reddit platformunda ünlülerin yüzlerini başka videolara yerleştiren bir kullanıcı tarafından popülerleştirildi. Teknik açıdan deepfake üretiminin iki ana yaklaşımı vardır: **GAN tabanlı yöntemler**, üretici ve ayrıştırıcı ağların rekabeti yoluyla orijinalden ayırt edilmesi güç yüz değiştirme (face swap) ve yüz canlandırma (face reenactment) üretir; FaceSwap, DeepFaceLab bu kategoridedir. **Difüzyon modeli tabanlı yöntemler**, daha yüksek kalite ve kontrol sunar; Stable Diffusion ve DALL-E 3 tabanlı araçlar giderek bu alanda da kullanılmaktadır. Ses klonlama (voice cloning) tarafında ElevenLabs ve RVC (Retrieval-based Voice Conversion) kısa örneklerden ikna edici ses taklidi üretebilmektedir. Kötüye kullanım riskleri ciddi boyutlara ulaşmıştır: siyasetçilerin ve ünlülerin manipüle edilerek seçimler öncesi dezenformasyon yaratılması; rıza dışı müstehcen içerik (NCII) üretimi; kurumsal dolandırıcılık (CEO'nun sesini taklit eden sahte talimatlara itaatle yapılan banka transferleri). 2024'te Tayvan ve Ukrayna seçimlerinde deepfake kampanyaları belgelendi. Tespit teknolojileri de hızla gelişmektedir: BlinkDetection, frekans analizi ve sinir ağı tabanlı sınıflandırıcılar (FaceForensics++ veri setinde eğitilmiş) yaygın araçlar arasındadır. C2PA (Coalition for Content Provenance and Authenticity) standardı, içerik üreticilerini kriptografik imzayla kayıt altına alarak sahtecilikle mücadele eder. Hukuki düzenlemeler açısından ABD'de bazı eyaletler rıza dışı deepfake'i suç olarak tanımladı; AB'nin AI Act'i deepfake içeriklerin "yapay zeka üretimi" olduğunun açıkça belirtilmesini zorunlu kılmaktadır. Türkiye'de TCK kapsamında "kişilik haklarına saldırı" hükümleri uygulanmakla birlikte deepfake'e ��zgü bir yasal düzenleme henüz mevcut değildir. Deepfake tespiti bir endüstri koluna dönüştü: Intel'in FakeCatcher sistemi, Microsoft'un Video Authenticator aracı ve Adobe'nin Content Authenticity Initiative bu alana yatırım yapan kurumlar arasındadır. Tespit yarışının üretim teknolojisini yakalamak için sürekli güncelleme gerektirdiği genel kabul görmektedir.
Generative Adversarial Networks (Üretici Çekişmeli Ağlar)
GAN (Generative Adversarial Networks — Üretici Çekişmeli Ağlar), 2014 yılında Ian Goodfellow ve ekibi tarafından Montréal Üniversitesi'nde geliştirilen devrimsel bir derin öğrenme mimarisidir. Sistem, birbirine rakip iki yapay sinir ağından oluşur: Üretici (Generator) ve Ayırt Edici (Discriminator). Bu iki ağın rekabeti, gerçeğinden ayırt edilemeyen görüntü, ses ve video içeriklerinin üretilebilmesini sağlar. Üretici ağ, rastgele gürültüden yola çıkarak gerçekçi görünümlü içerik sentezler. Ayırt Edici ağ ise kendisine sunulan içeriğin gerçek mi yoksa üretici tarafından yaratılmış mı olduğunu belirlemeye çalışır. Bu süreç, oyun teorisindeki sıfır-toplam oyununa benzer: Üretici, Ayırt Ediciyi kandırmaya; Ayırt Edici de sahtekarlığı yakalamaya çalışır. İki ağ binlerce iterasyon boyunca birlikte eğitildikçe her ikisi de gelişir; son noktada Üretici öyle gerçekçi çıktılar üretir ki Ayırt Edici artık gerçeği sahteden ayırt edemez. GAN mimarisinin en çarpıcı uygulaması ThisPersonDoesNotExist.com sitesindeki hiper-gerçekçi yüzlerdir; bu yüzlerin sahibi gerçek bir insan değildir. Bunun yanı sıra GAN'lar; düşük çözünürlüklü görüntüleri 4K'ya yükseltme (süper çözünürlük), stil transferi, tıbbi görüntü veri setlerini yapay örneklerle büyütme ve deepfake video üretimi gibi alanlarda yaygın biçimde kullanılır. En bilinen GAN varyantları arasında foto-gerçekçi yüz sentezi için NVIDIA'nın StyleGAN2/3'ü, eşleştirilmemiş veri setleriyle at-zebra dönüşümü gibi görevler için CycleGAN ve uydu-harita çevirisi gibi eşleştirilmiş dönüşümler için Pix2Pix sayılabilir. GAN'ların en büyük zayıflığı eğitim sürecindeki istikrarsızlıktır. Mode collapse sorunu, Üreticinin çeşitliliği kaybedip yalnızca birkaç tipik örnek üretmesiyle ortaya çıkar. 2022'den itibaren Stable Diffusion ve DALL-E 2 gibi difüzyon modelleri, genel görüntü üretiminde GAN'ın yerini büyük ölçüde almıştır. Bununla birlikte gerçek zamanlı video sentezi ve düşük gecikme gerektiren edge uygulamalarında GAN mimarisi hâlâ önemli konumunu korumaktadır.
Mode Collapse (Mod Çöküşü)
Mod çöküşü (mode collapse), Üretici Çekişmeli Ağlar (GAN) eğitiminde sıkça karşılaşılan kritik bir sorundur. Üretecin (generator), gerçek veri dağılımının tamamını öğrenmek yerine yalnızca belirli bir alt kümesini — tek bir "mod"u — taklit etmeye başlaması durumunda ortaya çıkar. Adından da anlaşılacağı üzere model, olası çıktıların çeşitli dağılımı yerine tek bir noktaya ya da küçük bir kümeye "çöker". GAN mimarisinde üreteci (G) ve ayırt edici (D) ağ birbirine karşı eğitilir: G gerçekçi veriler üretmeye, D ise gerçek ile üretilmiş verileri ayırt etmeye çalışır. Mod çöküşü, bu rekabetçi dengenin bozulmasıyla tetiklenir. Üreteci, ayırt ediciyi kandırabilen birkaç örnek keşfettiğinde aynı kalıpları tekrar üretmeyi öğrenir; farklı girdi gürültüsü vektörleri giderek benzer çıktılara eşlenir. Bunun temel nedeni, standart GAN kayıp fonksiyonunun (Jensen-Shannon ıraksama tabanlı) gradyan sinyallerinin zayıfladığı veya kaybolduğu bölgelere — "vanishing gradient" durumuna — yatkın olmasıdır. Mod çöküşü iki biçimde gözlemlenir. Tam mod çöküşü (complete mode collapse) durumunda üreteci, girdi gürültüsünden bağımsız olarak hep aynı tek bir çıktıyı üretir. Kısmi mod çöküşü (partial mode collapse) durumunda ise üreteci gerçek dağılımdaki modların yalnızca bir kısmını öğrenir; örneğin MNIST rakamları veri kümesinde yalnızca 3, 5 ve 8 rakamlarını üretebilir. Her iki durumda da çıktı çeşitliliği (diversity) ciddi biçimde düşer ve modelin nicel kalite ölçütleri yanıltıcı biçimde yüksek görünebilir. Bu sorunla başa çıkmak için araştırmacılar farklı yaklaşımlar geliştirmiştir. Wasserstein GAN (WGAN), kayıp fonksiyonunu Wasserstein mesafesine dayandırarak daha kararlı gradyanlar üretir ve mod çöküşü riskini belirgin biçimde düşürür. Mini-batch discrimination, ayırt edicinin birden fazla örneği aynı anda değerlendirmesini sağlayarak üretecin çeşitsizliğini cezalandırır. Spektral normalizasyon ise ağırlık matrislerinin Lipschitz koşulunu koruyacak biçimde normalize edilmesini zorunlu kılar. Diffusion modelleri, akış eşleştirme (flow matching) ve VAE gibi alternatif üretici mimari paradigmaları ise mod çöküşüne yapısal olarak daha az eğilimlidir; bu nedenle görsel içerik üretiminde GAN'ların yerini büyük ölçüde almıştır.
Süper Çözünürlük (Süper Çözünürlük)
Süper çözünürlük (super-resolution), düşük çözünürlüklü (Low-Resolution / LR) bir görüntüden yüksek çözünürlüklü (High-Resolution / HR) bir görüntü elde etme işlemidir. Geleneksel bicubic enterpolasyon yöntemi yalnızca komşu piksel değerlerinin ağırlıklı ortalamasını alarak görüntüyü büyütür; bu süreç var olan bilginin yeniden dağıtılmasından ibarettir ve kenarları yumuşatıp bulanık bir sonuç üretir. Derin öğrenme tabanlı süper çözünürlük modelleri ise farklı bir strateji izler: milyonlarca LR–HR görüntü çiftinden öğrendikleri istatistiksel örüntüleri kullanarak görüntüde var olmayan piksel bilgisini halüsinasyon yoluyla üretirler. Bu 'halüsinasyon', kontrollü ve istatistiksel açıdan tutarlı olduğunda gerçek bir görsel zenginleşme yaratır; ancak yanlış öğrenilmiş bir modelde asıl görüntüde bulunmayan yapılar da eklenebilir. SRCNN (2014) alanın ilk derin öğrenme modelidir; üç konvolüsyon katmanıyla bile bicubic yöntemini PSNR metriğinde net biçimde geride bırakmıştır. SRGAN (2017) ise GAN çerçevesini devreye sokarak perceptual kaliteyi matematiksel metriklerden ayırdı: model daha düşük PSNR üretmesine rağmen insan gözüne çok daha doğal göründü. ESRGAN ve Real-ESRGAN gerçek dünya bozulmalarına (JPEG artefaktı, film tanesi, odak bulanıklığı) dayanıklı hale gelirken, SwinIR (2021) Swin Transformer mimarisiyle uzun menzilli bağımlılıkları yakalayarak referans model konumuna yükseldi. 2023'ten itibaren StableSR ve DiffBIR gibi difüzyon tabanlı modeller, gürültüyü kademeli olarak gidererek son derece gerçekçi dokular ve yüz detayları üretmeyi başardı. Uygulama alanları son derece geniştir: tıbbi görüntülemede MRI ve BT kesitlerinin netliği artırılırken, uydu görüntülerinde bina veya arazi örtüsü tespiti iyileştirilir. Dijital arşivlerde bozulmuş fotoğraflar restore edilir, video akışında düşük bant genişliği için sıkıştırılmış içerik yüksek çözünürlükte yeniden yapılandırılır. PSNR ve SSIM uzun süre temel metrikler olarak kullanılmış; ancak LPIPS ve DISTS gibi perceptual metrikler, insan algısıyla çok daha iyi örtüşen ölçümler sunmaktadır. Video süper çözünürlükte kareler arası tutarlılık ek bir zorluk oluşturur: optik akış hizalaması veya temporal attention mekanizmaları bu titreme (flickering) sorununu gidermek için kullanılır.
Synthetic Data (Sentetik Veri)
Sentetik veri (synthetic data), gerçek dünya olaylarını gözlemleyerek değil, algoritmalar, istatistiksel modeller veya üretken yapay zeka aracılığıyla yapay olarak üretilen veridir. Gerçek verinin sahip olduğu gizlilik risklerini taşımaksızın makine öğrenmesi modellerini eğitmek, test etmek ve doğrulamak için kullanılır. Sentetik veri üretiminin temel yöntemleri arasında istatistiksel simülasyon, kural tabanlı üretim ve üretken modeller yer alır. GAN (Generative Adversarial Network) tabanlı yaklaşımlar, ayırt edici bir ağın denetiminde üretici ağ gerçekçi sentetik örnekler oluştururken özellikle görüntü verisi üretiminde yüksek kaliteye ulaşmaktadır. Difüzyon modelleri ise gürültüden aşamalı geri dönüşümle yüksek çeşitlilikte sentetik örnekler üretir; bu yöntem 2023 sonrasında görüntü ve metin alanında GAN'ın yerini almaya başlamıştır. Tablolar ve yapılandırılmış veri için CTGAN (Conditional Tabular GAN) ve SDV (Synthetic Data Vault) kütüphaneleri geniş çapta kullanılmaktadır. Bu araçlar, orijinal verinin sütunlar arası korelasyonlarını, kategorik değer dağılımlarını ve istatistiksel özelliklerini öğrenerek yeni satırlar üretir; böylece gerçeğe yakın ama gerçek olmayan kayıtlar oluşturulur. Sentetik verinin en kritik kullanım alanı gizlilik korumasıdır. Tıbbi kayıtlar veya finansal işlemler gibi hassas veri içeren yapay zeka projelerinde GDPR ve HIPAA gibi düzenlemeler gerçek veri paylaşımını kısıtlar; sentetik veri bu kısıtları aşarken modelin öğreneceği temsili örnekler sunar. Az temsil edilen sınıfları dengelemek için de kullanılır. Dengesiz veri setlerinde nadir sınıf örnekleri sentetik yollarla çoğaltılarak model bu sınıfları daha iyi öğrenir. Otonom araç, robotik ve oyun yapay zekası gibi alanlarda gerçek dünya verisi toplamak tehlikeli veya pahalı olduğunda simülasyon ortamlarından üretilen sentetik veri birincil eğitim kaynağı olarak kullanılır. Microsoft'un Phi serisi ve Meta'nın bazı küçük modelleri, büyük ölçüde sentetik veriyle eğitilerek gerçek veriye olan bağımlılığı azaltmanın mümkün olduğunu kanıtlamıştır.