Görüntü Tamamlama Nedir?
Görüntü tamamlama, bir dijital görüntüdeki eksik, hasar görmüş veya kaldırılmak istenen piksel bölgelerini, sahnenin geri kalanıyla anlam ve görünüm açısından tutarlı yeni içerikle dolduran hesaplamalı bir süreçtir. Geleneksel sanat restorasyonundan ödünç alınan bu kavram dijital ortamda piksel düzeyinde uyum, doku sürekliliği ve semantik tutarlılık gibi birden fazla kısıtı aynı anda karşılamayı gerektirir. Modele verilen giriş tipik olarak iki bileşenden oluşur: tamamlanacak bölgeyi gösteren ikili bir maske (beyaz = eksik, siyah = bilinen) ve maskelenmemiş orijinal görüntü. Görevin zorluğu maske boyutuyla doğru orantılı olarak artar: küçük çizikler için yerel doku yayması yeterliyken geniş boşluklar için nesne geometrisi ve sahne düzenlemesi hakkında küresel bir kavrayış gereklidir. Görüntü tamamlama, görüntü üretimi ve görüntü düzenleme görevleriyle yakın ilişkili olmakla birlikte onlardan ayrışır: üretimde sıfırdan içerik yaratılırken tamamlamada mevcut bağlamla uyum zorunludur.
Klasik Yöntemler: PDE Difüzyonu ve Yama Tabanlı Arama
Derin öğrenme öncesi dönemin iki hâkim yaklaşımı farklı güçlü taraflara sahip olmakla birlikte ortak bir sınırlılığı paylaşır: anlam bilgisinden yoksundurlar. Difüzyon tabanlı (PDE) yöntemler, Bertalmio ve arkadaşlarının 2000 yılındaki öncü çalışmasına dayanır. Bu yaklaşımda görüntü yoğunlukları, maskenin sınır pikselleri boyunca türetilen kısmi diferansiyel denklemlerle eksik bölgenin içine yayılır. Gürültü azaltma ve ince çizgi onarımı için güçlüdür; ancak büyük boşluklarda bulanıklık kaçınılmaz olur. Yama tabanlı yöntemler, en bilineni PatchMatch (Barnes ve ark., 2009) olmak üzere görüntünün bilinen bölgelerinde benzer yamalar arar ve bunları eksik alana yapıştırır. Adobe Photoshop'un "Content-Aware Fill" özelliği PatchMatch motoruna dayanmaktaydı. Bu yöntemler tekrarlayan doku içeren arka planlarda tatmin edici sonuçlar verse de nesne tamamlama ve anlam gerektiren bağlamlarda başarısız olur.
Derin Öğrenme ile Tamamlama: CNN, GAN ve Transformer
Derin öğrenme tabanlı inpainting, sınırlı alım alanı sorununu ve anlam bilgisi eksikliğini adım adım aştı. Context Encoder (Pathak ve ark., 2016, CVPR) ilk GAN tabanlı tamamlama sistemi olarak bir kodlayıcı-kod çözücü mimarisini adversarial kayıpla birleştirdi. DeepFill (Yu ve ark., CVPR 2018) bağlamsal dikkat mekanizmasıyla görüntünün uzak bölgelerindeki yama benzerliklerini hesaplayarak küresel tutarlılığı artırdı. LaMa (2021/WACV 2022), Hızlı Fourier Konvolüsiyonu (FFC) kullanarak her katmanda görüntü genelinde alım alanı kazandırdı. Büyük maskelerde ve 2K+ çözünürlüklerde gürbüz performansıyla mobil fotoğraf uygulamalarında yaygın kullanım buldu; Samsung ve Google'ın nesne kaldırma araçlarının temelini oluşturmaktadır. MAT (Mask-Aware Transformer, CVPR 2022), transformatör dikkat mekanizmasını dinamik maske belirteçlerine göre uyarlar; maskelenmiş konumlardan gelen dikkat katkısını bastırarak yalnızca bilinen piksellerden anlamlı bağlam toplar.
Difüzyon Modelleriyle Yeni Nesil Tamamlama (2022–2025)
Gizil difüzyon modelleri görüntü tamamlama alanını kökten dönüştürdü. Bu modeller piksel uzayında çalışmak yerine görüntüleri sıkıştırılmış gizil uzayda temsil eder ve yinelemeli gürültü giderme süreciyle yeni içerik üretir. Stable Diffusion Inpainting, SD 2.0 ile ince ayarlı bir checkpoint sunarken Blended Latent Diffusion (SIGGRAPH 2023) ek eğitim gerektirmeksizin metin güdümlü yerel düzenlemeyi olanaklı kıldı. DALL-E 3 ve Adobe Firefly (Photoshop Generative Fill) bu teknolojiyi milyonlarca kullanıcıya ulaştırdı. FLUX.1 (Black Forest Labs, Ağustos 2024) akış eşleştirme tabanlı mimarisiyle tipografik doğruluk ve istem bağlılığında yeni bir ölçüt belirledi. 2025'te RETHINED (WACV 2025), mevcut difüzyon modellerinden 100 kat daha hızlı çalışan hafif bir CNN-yama hibriti sunarak kenar cihazlarda gerçek zamanlı yüksek çözünürlüklü tamamlamayı mümkün kıldı.
Kullanım Alanları ve Pratik Uygulamalar
- check_circle Fotoğraf restorasyonu: Taranmış eski fotoğraflardaki çizikler, lekeler ve fiziksel hasarlar LaMa gibi modellerle otomatik onarılır; kültürel miras kurumları bu tekniği dijitalleştirme projelerinde kullanmaktadır.
- check_circle Nesne kaldırma: Turistik fotoğraflardaki kalabalıkları, altyazıları veya istenmeyen nesneleri kaldırmak için en yaygın tüketici kullanımıdır. Photoshop Generative Fill ve Samsung Galaxy AI bu işlevi milyonlarca kullanıcıya sunmaktadır.
- check_circle İçerik duyarlı dolgu (Content-Aware Fill): Görüntü kırpma veya genişletme sırasında oluşan boş kenarlıkları çevresine uyumlu içerikle doldurur; Adobe'nin Generative Expand özelliği bu kategoriye girer.
- check_circle Sanal kıyafet deneme (Virtual Try-On): E-ticaret platformlarında manken görüntüleri üzerinde ürün tamamlama, müşterinin kıyafeti üzerinde nasıl görüneceğini simüle eden bir tamamlama alt görevi olarak modellenir.
- check_circle Tıbbi görüntüleme ve video: MRI ve BT taramalarındaki artefaktların giderilmesi; video inpainting ile film restorasyonu ve nesne kaldırma için tamamlama zaman boyutuna genişletilir.
Sık Sorulan Sorular
- check_circle Görüntü tamamlama ile görüntü üretimi arasındaki fark nedir?: Görüntü üretimi sıfırdan yeni içerik yaratırken tamamlama bir bağlam kısıtı altında çalışır: maskelenmiş bölgeyi dolduran içeriğin mevcut görüntüyle piksel, renk ve anlam düzeyinde uyum içinde olması gerekir.
- check_circle LaMa neden hâlâ yaygın olarak kullanılmaktadır?: LaMa, Hızlı Fourier Konvolüsiyonları aracılığıyla her katmanda görüntü genelinde alım alanı kazanır; bu özellik büyük maske bölgelerinde ve 2K+ çözünürlüklerde yapısal tutarlılığı korur. Düşük parametre sayısı ve hızlı çıkarım süresiyle üretim ortamlarında tercih edilmektedir.
- check_circle Difüzyon tabanlı ve GAN tabanlı tamamlama arasındaki pratik fark nedir?: GAN modelleri tek ileri geçişte sonuç ürettiğinden daha hızlıdır; ancak çeşitlilik sınırlı kalabilir. Difüzyon modelleri daha yavaş çalışır (20–50 adım) fakat çok daha zengin ve semantik açıdan tutarlı çıktılar üretir, metin yönlendirmesini doğal biçimde destekler.
- check_circle Adobe Firefly Generative Fill hangi teknolojiyi kullanıyor?: Adobe Firefly, şirkete özel bir difüzyon modeli mimarisi (Firefly Image 3) üzerine inşa edilmiştir. Kullanıcının seçtiği maskeyi ve isteğe bağlı metin komutunu alarak koşullu difüzyon süreciyle tamamlama gerçekleştirir; Adobe Stock görüntüleriyle eğitildiğinden ticari kullanıma uygun olduğu belirtilmektedir.
- check_circle Görüntü tamamlama deepfake tespitini nasıl etkiliyor?: Araştırmalar, inpainting tabanlı manipülasyonların tespit edilmesinin giderek güçleştiğini ortaya koymaktadır. COCO-Inpaint (2025) gibi yeni kıyaslama veri kümeleri, difüzyon tabanlı tamamlama modellerinin bıraktığı iz örüntülerini inceleyerek manipülasyon tespiti için özel dedektör modeller geliştirmeyi hedeflemektedir.