tag generative ai

Bu sayfada generative ai etiketi ile işaretlenmiş 7 yapay zeka kavramını bulabilirsiniz.

DDPM (Denoising Diffusion Probabilistic Models), Jonathan Ho ve arkadaşları tarafından 2020 yılında yayımlanan, modern difüzyon modellerinin temelini atan çığır açıcı bir üretici yapay zeka modelidir. "Denoising Diffusion Probabilistic Models" (NeurIPS 2020) makalesiyle tanıtılan DDPM, GAN ile kıyaslanabilir görüntü kalitesi sunarken çok daha kararlı bir eğitim sürecine sahip olduğunu kanıtlamıştır. DDPM iki süreçten oluşur. İleri süreçte (forward process, q) temiz veri x₀'a kademeli olarak T adım boyunca Gaussian gürültü eklenir. Her adımda gürültü miktarı, β_t olarak adlandırılan küçük sabit bir değerle kontrol edilir. T adım sonunda (genellikle T=1.000) veri tamamen bir Gaussian dağılımına (saf gürültüye) dönüşür. Ters süreçte (reverse process, p_θ) model, gürültülü bir örnekten başlayarak gerçek veri dağılımını adım adım kurtarmayı öğrenir. Her adımda bir sinir ağı (genellikle U-Net), o adımdaki gürültüyü tahmin eder. Kayıp fonksiyonu sadeleştirilerek "gürültüyü tahmin etmek"e (epsilon prediction) indirgenir. DDPM, sonraki tüm büyük gelişmelerin (DDIM, LDM, Stable Diffusion, DALL-E 2/3) çıkış noktası olmuştur.

noise_aware

DDPM (Gürültü Giderme Difüzyon Olasılık Modeli)

DDPM (Denoising Diffusion Probabilistic Models), Jonathan Ho ve arkadaşları tarafından 2020 yılında yayımlanan, modern difüzyon modellerinin temelini atan çığır açıcı bir üretici yapay zeka modelidir. "Denoising Diffusion Probabilistic Models" (NeurIPS 2020) makalesiyle tanıtılan DDPM, GAN ile kıyaslanabilir görüntü kalitesi sunarken çok daha kararlı bir eğitim sürecine sahip olduğunu kanıtlamıştır. DDPM iki süreçten oluşur. İleri süreçte (forward process, q) temiz veri x₀'a kademeli olarak T adım boyunca Gaussian gürültü eklenir. Her adımda gürültü miktarı, β_t olarak adlandırılan küçük sabit bir değerle kontrol edilir. T adım sonunda (genellikle T=1.000) veri tamamen bir Gaussian dağılımına (saf gürültüye) dönüşür. Ters süreçte (reverse process, p_θ) model, gürültülü bir örnekten başlayarak gerçek veri dağılımını adım adım kurtarmayı öğrenir. Her adımda bir sinir ağı (genellikle U-Net), o adımdaki gürültüyü tahmin eder. Kayıp fonksiyonu sadeleştirilerek "gürültüyü tahmin etmek"e (epsilon prediction) indirgenir. DDPM, sonraki tüm büyük gelişmelerin (DDIM, LDM, Stable Diffusion, DALL-E 2/3) çıkış noktası olmuştur.

arrow_forward
blur_on

Diffusion Model (Yayılım Modeli (Diffusion Modeli))

Diffusion modeli, veriye kademeli olarak gürültü ekleyen (ileri süreç) ve ardından bu gürültüden orijinal veriyi adım adım yeniden oluşturmayı öğrenen (ters süreç) bir üretici yapay zeka mimarisidir. Stable Diffusion, DALL-E 3, Midjourney ve Imagen gibi günümüzün en güçlü görüntü üretim sistemleri difüzyon modeline dayanmaktadır. İleri süreçte (forward process) modele verilen temiz görüntüye T adım boyunca Gaussian gürültü eklenir; sonunda görüntü tamamen gürültüye dönüşür. Bu süreç deterministik ve önceden tanımlanmıştır — öğrenme gerektirmez. Ters süreçte (reverse process) model, tamamen gürültülü bir görüntüden başlayarak her adımda biraz daha temizleyerek orijinale yakın bir görüntü üretir. Model bu ters süreci veriden öğrenir. Eğitim sırasında model, belirli bir gürültü seviyesindeki görüntüden hangi gürültünün çıkarılması gerektiğini tahmin etmeyi öğrenir. Çıkarım sırasında tamamen rastgele gürültüden başlanır ve model bu tahmin sürecini T adım boyunca tekrarlayarak yeni, gerçekçi bir görüntü üretir. Metin koşullandırması (text conditioning) ise CLIP gibi bir metin kodlayıcısından gelen vektörün dikkat mekanizmasına (cross-attention) enjekte edilmesiyle sağlanır.

arrow_forward
auto_awesome

Generative AI (Üretken (Generatif) Yapay Zeka)

Generatif Yapay Zeka (Üretken Yapay Zeka), var olan verilerden kalıpları öğrenerek daha önce hiç görülmemiş özgün içerikler üretebilen yapay zeka sistemleri ailesinin genel adıdır. Geleneksel yapay zeka modelleri yalnızca veriyi sınıflandırır ya da tahminler üretir; buna karşın generatif modeller metin, görüntü, ses, video, 3D model ve kod gibi çok çeşitli formatlarda tamamen yeni içerik sentezleyebilir. Bu alanın iki temel mimarisi bulunur. Birincisi Transformer tabanlı büyük dil modelleridir (LLM). GPT-4o, Gemini ve Claude gibi modeller trilyonlarca metin tokenından öğrenerek insan düzeyinde metin üretir; soru yanıtlar, özetler ve kod yazar. İkincisi ise Yayılım (Diffusion) modellerdir: DALL-E 3, Midjourney ve Stable Diffusion, rastgele gürültüden başlayarak katman katman anlamlı görüntüler oluşturur. Bu süreç, gürültü ekleme adımlarını tersten işleterek gerçekleştirilir. Generatif yapay zekanın tarihsel dönüm noktaları incelendiğinde, 2014 yılında Ian Goodfellow tarafından geliştirilen Üretici Çekişmeli Ağlar (GAN) bu alanın temel taşlarından biri olarak öne çıkar. 2017'de Google'ın "Attention Is All You Need" makalesiyle duyurduğu Transformer mimarisi dil modellemedeki paradigmayı kökten dönüştürdü. 2022'de kamuoyuna açılan ChatGPT, teknolojinin ana akıma taşınmasını sağladı: ilk iki ayda 100 milyonu aşkın kullanıcıya ulaşarak tarihin en hızlı büyüyen tüketici uygulaması oldu. 2024-2025 döneminde alan çok modlu (multimodal) yapıya kavuştu. GPT-4o, Claude 3.7 ve Gemini 2.0 gibi modeller artık metin, görüntü, ses ve videoyu tek bir çatı altında bütünleşik biçimde işleyebilmektedir. Bu gelişme, tıbbi görüntü analizi, erişilebilirlik çözümleri ve gerçek zamanlı çeviri gibi alanlarda yeni kapılar araladı. Küçük ama güçlü modeller (SLM) de öne çıktı: Phi-4 ve Llama 3.2 gibi sistemler, bulut bağımlılığı olmadan edge cihazlarda yerel biçimde çalışabilmektedir. Generatif modellerin eğitiminde RLHF (İnsan Geri Bildirimiyle Pekiştirmeli Öğrenme) belirleyici bir rol oynar. Modelden elde edilen çıktılar insan değerlendiriciler tarafından sıralanır; bu sıralamadan öğrenen bir ödül modeli, ana modelin daha yararlı ve güvenli yanıtlar vermesi için rehberlik eder. Büyük modeller aynı zamanda ince ayar (fine-tuning) ve bağlam içi öğrenme (in-context learning) yöntemleriyle belirli görevlere uyarlanabilir. Uygulama alanları son derece geniştir: müşteri hizmetleri chatbotları, kişiselleştirilmiş eğitim, pazarlama içeriği üretimi, ilaç molekülü tasarımı, oyun içi grafik yaratma ve yazılım geliştirme asistanlığı bunların başında gelir. Hallüsinasyon (yanlış bilgi üretme), telif hakkı ihlalleri ve dezenformasyon riski ise alanın güncel başlıca tartışma konularıdır.

arrow_forward
layers

Latent Diffusion Model (Gizil Uzay Difüzyon Modeli (Latent Diffusion))

Latent Diffusion Model (LDM), difüzyon işlemini piksel uzayı yerine sıkıştırılmış bir gizil (latent) uzayda gerçekleştiren verimli bir üretici yapay zeka mimarisidir. Robin Rombach ve arkadaşları tarafından 2022 yılında yayımlanan "High-Resolution Image Synthesis with Latent Diffusion Models" makalesiyle tanıtılan bu mimari, Stable Diffusion'ın temelini oluşturur. Geleneksel piksel uzayı difüzyon modellerinde (DDPM gibi) tüm hesaplama, görüntünün tam boyutunda (örn. 512×512×3 = 786.432 boyut) yapılır. Bu son derece hesaplama yoğundur. LDM'de ise önce bir Varyasyonel Otoenkoder (VAE) görüntüyü çok daha küçük bir gizil temsile sıkıştırır (örn. 64×64×4 = 16.384 boyut); difüzyon süreci bu küçük uzayda çalışır; sonunda VAE dekoderi gizil uzay çıktısını tam boyutlu görüntüye dönüştürür. Bu yaklaşım, hesaplama maliyetini piksel tabanlı difüzyona kıyasla yaklaşık 48 kat azaltır. Metin koşullandırması, CLIP veya OpenCLIP metin kodlayıcısından gelen vektörlerin U-Net'in cross-attention katmanlarına enjekte edilmesiyle sağlanır. Sıkıştırma ve kalite arasındaki denge, VAE'nin yeniden yapılandırma başarısına bağlıdır.

arrow_forward
🎹

MIDI Sentezi (MIDI Sentezi)

MIDI sentezi, yapay zeka modellerinin büyük MIDI veri kümelerinden müzikal desenleri öğrenerek orijinal sembolik müzik dizileri oluşturduğu bir üretken AI teknolojisidir. Geleneksel MIDI sentezinden farklı olarak, AI tabanlı MIDI sentezi insan besteciliği veya sabit kural setleri yerine derin öğrenme mimarileri kullanarak melodi, armoni, ritim ve çok enstrümanlı düzenlemeleri otomatik olarak üretir. Bu sistemler, müzikal yapı, stil ve kompozisyon prensiplerini istatistiksel kalıplar aracılığıyla kavrar; klasikten elektronik müziğe kadar geniş bir yelpazede tutarlı ve özgün parçalar üretebilir.

arrow_forward
🎵

Müzik Üretimi (AI) (Müzik Üretimi)

Müzik üretimi (AI), yapay zeka modellerinin metin açıklamaları, melodi parçaları veya tarz referanslarından özgün müzik eserleri oluşturmasını sağlayan teknolojidir. Büyük miktarda müzik verisi üzerinde eğitilen bu modeller, ses dalgaları, nota dizileri veya MIDI çıktısı üretebilir. Derin öğrenme tabanlı sistemler —özellikle Transformer, Diffusion ve GAN mimarileri— artık insanla ayırt edilmesi güç düzeyde besteler üretebilmektedir. Google MusicLM, Meta MusicGen ve Suno gibi modeller, metinden müziğe dönüşümü ana akım kullanıma taşımıştır.

arrow_forward
🎬

Video Üretimi (AI Video Generation) (Video Üretimi)

Video üretimi (AI Video Generation), derin öğrenme modellerinin metin açıklamaları, görüntüler veya kısa video girdilerinden gerçekçi, hareketli ve tutarlı video klipleri sentezlediği üretken yapay zeka alt alanıdır. Günümüzde baskın mimari Diffusion Transformer (DiT) modelidir: video kareler önce bir Variational Autoencoder (VAE) ile sıkıştırılmış latent uzaya kodlanır, ardından bir transformer ağı uzamsal ve zamansal yamalar üzerinde iteratif gürültü giderme (denoising) yaparak tutarlı video dizileri üretir. Öne çıkan sistemler arasında OpenAI Sora, Google Veo, Runway Gen-2, Kling ve açık kaynak Stable Video Diffusion sayılabilir.

arrow_forward