CLIP (Karşıtlıklı Dil-Görüntü Ön Eğitimi)

CLIP, görüntü ve metni aynı anlambilimsel uzayda birleştiren, sıfır-shot görsel anlama sağlayan OpenAI'ın çok modlu modelidir.

CLIP (Contrastive Language-Image Pre-Training), OpenAI tarafından 2021 yılında geliştirilen ve doğal dil metinleri ile görüntüleri aynı anlambilimsel uzayda temsil etmeyi öğrenen çok modlu bir yapay zeka modelidir. Alec Radford ve arkadaşları tarafından "Learning Transferable Visual Models From Natural Language Supervision" başlıklı ICML 2021 makalesiyle tanıtılmıştır. Modelin eğitimi iki paralel kodlayıcı üzerine kuruludur: bir görüntü kodlayıcısı (ViT veya ResNet) ve bir metin kodlayıcısı (GPT-2 tabanlı Transformer). Her eğitim adımında N görüntü-metin çifti içeren bir mini-batch oluşturulur; N×N kosinüs benzerlik matrisi hesaplanır. Amaç, diyagonal elemanları (eşleşen çiftler) yakınlaştırırken diyagonal dışı elemanları (eşleşmeyen çiftler) uzaklaştırmaktır. Bu optimizasyon InfoNCE kayıp fonksiyonuyla yürütülür. 400 milyon görüntü-metin çifti içeren WebImageText (WIT) veri kümesi ve 32.768'lik büyük batch boyutu, modeli günümüz çok modlu yapay zekasının temel taşına dönüştürmüştür. CLIP'in en kritik yetkinliği sıfır-atış (zero-shot) transfer öğrenmesidir: modele hiç gösterilmemiş bir kategoriye ait görüntüler, yalnızca o kategorinin metin açıklaması aracılığıyla doğru biçimde sınıflandırılabilir. ImageNet'te herhangi ek eğitim yapılmadan %76,2 doğruluk elde edilmesi bu gücün somut kanıtıdır. Sınıflandırma sırasında potansiyel kategorilerin metin gömmeleri oluşturulur, görüntü gömüsüyle kosinüs benzerliği karşılaştırılır ve en yüksek skorlu kategori tahmin edilir. Uygulama alanları son derece geniştir. Stable Diffusion ve DALL-E gibi metin-görüntü üretim modellerinde CLIP metin kodlayıcısı görevini üstlenir; kullanıcının yazılı ifadesinin görsel üretimi nasıl yönlendireceğini belirler. Unsplash, Google Lens ve pek çok görsel arama motoru CLIP tabanlı anlamsal arama yürütür. Sosyal medya platformları zararlı içerik tespitinde CLIP'ten yararlanmaktadır. Ekosistem açısından OpenCLIP (LAION-2B ile eğitilmiş açık kaynak), SigLIP (sigmoid kayıp, küçük batch ile verimli eğitim), EVA-CLIP ve MetaCLIP öne çıkan türevlerdir. Bununla birlikte CLIP; nesne sayma, mekânsal ilişki anlama ve Türkçe gibi düşük kaynaklı dillerde görece sınırlı kalır. WinoGround ve ARO kıyaslamaları bu bileşimsel akıl yürütme açıklarını belgelemektedir.

model_training CLIP Nasıl Eğitilir?

CLIP eğitimi bir mini-batch'te N görüntü-metin çiftini kullanır. Görüntü kodlayıcısı N görüntüyü, metin kodlayıcısı N metni gömme vektörlerine dönüştürür. Normalizasyon sonrası N×N boyutunda bir kosinüs benzerlik matrisi oluşturulur. Amaç: diyagonal elemanları (eşleşen çiftler) maksimize et, diyagonal dışı elemanları (eşleşmeyen çiftler) minimize et. Bu amaç InfoNCE veya cross-entropy kaybıyla optimize edilir. Büyük batch boyutu (N) karşıtlıklı öğrenmenin kalitesini artırır; 400M veri ile 32.768 batch boyutu kullanılmıştır. Eğitim tamamlandığında model, görüntü ve metin için evrensel semantik gömmeleri üretebilir hale gelir.

CLIP Kullanım Alanları

image_search Metin-to-Görüntü

Stable Diffusion ve DALL-E'nin metin kodlayıcısı. Prompt'tan görüntüye köprü kurar; CLIP skoru üretilen görüntünün prompt'a uygunluğunu ölçer.

category Zero-Shot Sınıflandırma

Görüntüyü ve potansiyel sınıf açıklamalarını karşılaştırarak en yakın sınıfı bulur. Yeni kategoriler için etiketlenmiş veri gerekmez.

search Görüntü Arama

Metin sorgusuna göre büyük görüntü koleksiyonlarında anlambilimsel arama. Unsplash, Getty ve Google Lens bu yaklaşımı kullanır.

shield İçerik Moderasyonu

Zararlı görsel içeriği metin açıklamalarına göre tespit eder. Sosyal medya platformları CLIP tabanlı sınıflandırıcıları moderasyon akışına entegre etmektedir.

CLIP'in Teknik Mimarisi ve Eğitim Yaklaşımı

  • check_circle Çift Enkoder Yapısı: Görüntü enkoderi (ViT veya ResNet) ve metin enkoderi (Transformer) paralel olarak çalışır. Her modalite bağımsız vektöre dönüştürülür; bu vektörler ortak gömme uzayında karşılaştırılır.
  • check_circle Kontrast Kayıp Fonksiyonu: Eşleşen görüntü-metin çiftleri yaklaştırılır, eşleşmeyen çiftler uzaklaştırılır. InfoNCE kaybı ile simetrik çapraz entropi; büyük batch boyutu (32K+) kritik önem taşır.
  • check_circle 400 Milyon Görüntü-Metin Çifti: WebImageText (WIT) veritabanı; internet'ten toplanan görüntü-alt yazı çiftleri. Büyük ölçekli gürültülü veri etiket düzenlemeye ihtiyaç duymadan güçlü sıfır-atış öğrenimi sağladı.
  • check_circle Sıfır-Atış Görüntü Sınıflandırma: Sınıf adlarından metin gömüleri oluşturulur; görüntü gömüsüne en yakın metin gömüsüne ait sınıf tahmin edilir. Yeni sınıflar için ek eğitim gerektirmez.
  • check_circle OpenCLIP ve Türevler: LAION-2B veri setiyle eğitilen açık kaynak CLIP uygulaması. SigLIP (sigmoid kayıp), EVA-CLIP ve MetaCLIP öne çıkan türevler; her biri farklı boyut-performans-maliyet dengesi sunar.

CLIP'in Downstream Görevlerdeki Rolü ve Sınırlamaları

CLIP'in temel katkısı, görsel ve dilsel temsillerin aynı vektör uzayında hizalanmasıdır. Bu hizalama son derece güçlü transfer öğrenmesi sağlar. Stable Diffusion ve DALL-E gibi görüntü üretim modellerinde CLIP metin koşullaması için kullanılır; metin açıklamasının görüntüyü nasıl yönlendireceğini belirler. CLIP gömüleri anlamsal görüntü aramasında da kritiktir: 'plajda çocuk' metni yazıldığında CLIP görüntü vektörlerine benzer içerik araması yapılabilir; bu EXIF metadata gerektirmez. Sınırlamalar: Sayma ve mekânsal ilişkiler (solda/sağda/üstünde) CLIP için hâlâ zordur. İnce ayrımlar yüksek benzerlik skoru üretebilir. Türkçe dahil düşük kaynaklı dillerde performans İngilizce'nin gerisinde kalır. WinoGround ve ARO kıyaslamaları bu bileşimsel akıl yürütme zayıflıklarını ortaya koymuştur.

quiz Sık Sorulan Sorular

  • check_circle CLIP nedir?: OpenAI'ın 2021'de geliştirdiği, görüntü ve metni aynı vektör uzayına hizalayan kontrast öğrenme modelidir. Sıfır-atış görüntü sınıflandırma, anlamsal arama ve görüntü üretim modellerinde temel bileşendir.
  • check_circle CLIP bir görüntü üretici midir?: Hayır, CLIP yalnızca kodlayıcıdır — görüntü ve metin gömmeleri üretir ama yeni içerik üretmez. Görüntü üretimi için Stable Diffusion veya DALL-E gibi ayrı üretici modeller gerekir. CLIP bu modellerde 'bridge' rolü oynar.
  • check_circle CLIP sıfır-atış sınıflandırma nasıl yapar?: Sınıf adlarından metin gömüleri oluşturulur, görüntü gömüsüyle kosinüs benzerliği hesaplanır; en yüksek skorlu sınıf seçilir. Yeni sınıflar için yeniden eğitim gerekmez.
  • check_circle CLIP Stable Diffusion'da nasıl kullanılır?: CLIP metin enkoderi, kullanıcının metin açıklamasını vektöre dönüştürür. Bu vektör diffusion modelinin koşullaması olarak kullanılır; hangi görüntünün üretileceğini yönlendirir.
  • check_circle CLIP'in başlıca sınırlamaları nelerdir?: Nesne sayma, mekânsal ilişkiler (sol/sağ/üst/alt) ve ince görsel ayrımlar CLIP'in zayıf olduğu alanlardır. Türkçe gibi düşük kaynaklı dillerde İngilizce'ye kıyasla performans düşer.