tag CLIP
Bu sayfada CLIP etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.
CLIP (Contrastive Language-Image Pre-Training), OpenAI tarafından 2021 yılında geliştirilen ve doğal dil metinleri ile görüntüleri aynı anlambilimsel uzayda temsil etmeyi öğrenen çok modlu bir yapay zeka modelidir. Alec Radford ve arkadaşları tarafından "Learning Transferable Visual Models From Natural Language Supervision" başlıklı ICML 2021 makalesiyle tanıtılmıştır. Modelin eğitimi iki paralel kodlayıcı üzerine kuruludur: bir görüntü kodlayıcısı (ViT veya ResNet) ve bir metin kodlayıcısı (GPT-2 tabanlı Transformer). Her eğitim adımında N görüntü-metin çifti içeren bir mini-batch oluşturulur; N×N kosinüs benzerlik matrisi hesaplanır. Amaç, diyagonal elemanları (eşleşen çiftler) yakınlaştırırken diyagonal dışı elemanları (eşleşmeyen çiftler) uzaklaştırmaktır. Bu optimizasyon InfoNCE kayıp fonksiyonuyla yürütülür. 400 milyon görüntü-metin çifti içeren WebImageText (WIT) veri kümesi ve 32.768'lik büyük batch boyutu, modeli günümüz çok modlu yapay zekasının temel taşına dönüştürmüştür. CLIP'in en kritik yetkinliği sıfır-atış (zero-shot) transfer öğrenmesidir: modele hiç gösterilmemiş bir kategoriye ait görüntüler, yalnızca o kategorinin metin açıklaması aracılığıyla doğru biçimde sınıflandırılabilir. ImageNet'te herhangi ek eğitim yapılmadan %76,2 doğruluk elde edilmesi bu gücün somut kanıtıdır. Sınıflandırma sırasında potansiyel kategorilerin metin gömmeleri oluşturulur, görüntü gömüsüyle kosinüs benzerliği karşılaştırılır ve en yüksek skorlu kategori tahmin edilir. Uygulama alanları son derece geniştir. Stable Diffusion ve DALL-E gibi metin-görüntü üretim modellerinde CLIP metin kodlayıcısı görevini üstlenir; kullanıcının yazılı ifadesinin görsel üretimi nasıl yönlendireceğini belirler. Unsplash, Google Lens ve pek çok görsel arama motoru CLIP tabanlı anlamsal arama yürütür. Sosyal medya platformları zararlı içerik tespitinde CLIP'ten yararlanmaktadır. Ekosistem açısından OpenCLIP (LAION-2B ile eğitilmiş açık kaynak), SigLIP (sigmoid kayıp, küçük batch ile verimli eğitim), EVA-CLIP ve MetaCLIP öne çıkan türevlerdir. Bununla birlikte CLIP; nesne sayma, mekânsal ilişki anlama ve Türkçe gibi düşük kaynaklı dillerde görece sınırlı kalır. WinoGround ve ARO kıyaslamaları bu bileşimsel akıl yürütme açıklarını belgelemektedir.
CLIP (Karşıtlıklı Dil-Görüntü Ön Eğitimi)
CLIP (Contrastive Language-Image Pre-Training), OpenAI tarafından 2021 yılında geliştirilen ve doğal dil metinleri ile görüntüleri aynı anlambilimsel uzayda temsil etmeyi öğrenen çok modlu bir yapay zeka modelidir. Alec Radford ve arkadaşları tarafından "Learning Transferable Visual Models From Natural Language Supervision" başlıklı ICML 2021 makalesiyle tanıtılmıştır. Modelin eğitimi iki paralel kodlayıcı üzerine kuruludur: bir görüntü kodlayıcısı (ViT veya ResNet) ve bir metin kodlayıcısı (GPT-2 tabanlı Transformer). Her eğitim adımında N görüntü-metin çifti içeren bir mini-batch oluşturulur; N×N kosinüs benzerlik matrisi hesaplanır. Amaç, diyagonal elemanları (eşleşen çiftler) yakınlaştırırken diyagonal dışı elemanları (eşleşmeyen çiftler) uzaklaştırmaktır. Bu optimizasyon InfoNCE kayıp fonksiyonuyla yürütülür. 400 milyon görüntü-metin çifti içeren WebImageText (WIT) veri kümesi ve 32.768'lik büyük batch boyutu, modeli günümüz çok modlu yapay zekasının temel taşına dönüştürmüştür. CLIP'in en kritik yetkinliği sıfır-atış (zero-shot) transfer öğrenmesidir: modele hiç gösterilmemiş bir kategoriye ait görüntüler, yalnızca o kategorinin metin açıklaması aracılığıyla doğru biçimde sınıflandırılabilir. ImageNet'te herhangi ek eğitim yapılmadan %76,2 doğruluk elde edilmesi bu gücün somut kanıtıdır. Sınıflandırma sırasında potansiyel kategorilerin metin gömmeleri oluşturulur, görüntü gömüsüyle kosinüs benzerliği karşılaştırılır ve en yüksek skorlu kategori tahmin edilir. Uygulama alanları son derece geniştir. Stable Diffusion ve DALL-E gibi metin-görüntü üretim modellerinde CLIP metin kodlayıcısı görevini üstlenir; kullanıcının yazılı ifadesinin görsel üretimi nasıl yönlendireceğini belirler. Unsplash, Google Lens ve pek çok görsel arama motoru CLIP tabanlı anlamsal arama yürütür. Sosyal medya platformları zararlı içerik tespitinde CLIP'ten yararlanmaktadır. Ekosistem açısından OpenCLIP (LAION-2B ile eğitilmiş açık kaynak), SigLIP (sigmoid kayıp, küçük batch ile verimli eğitim), EVA-CLIP ve MetaCLIP öne çıkan türevlerdir. Bununla birlikte CLIP; nesne sayma, mekânsal ilişki anlama ve Türkçe gibi düşük kaynaklı dillerde görece sınırlı kalır. WinoGround ve ARO kıyaslamaları bu bileşimsel akıl yürütme açıklarını belgelemektedir.
Contrastive Learning (Karşıtlıklı Öğrenme)
Karşıtlıklı öğrenme, bir modelin benzer örnekleri birbirine yakın, farklı örnekleri ise birbirinden uzak temsil etmeyi öğrendiği bir öz-denetimli makine öğrenimi paradigmasıdır. Temel fikir, aynı verinin farklı görünümlerini (augmentasyonlarını) pozitif çift olarak, rastgele seçilen farklı örnekleri ise negatif çift olarak kullanmaktır. Model, pozitif çiftlerin gömme vektörlerini uzayda birbirine yaklaştırırken negatif çiftleri uzaklaştıracak şekilde eğitilir. Bu yöntem, etiketli veriye olan bağımlılığı azaltarak büyük miktarda etiketsiz veriden anlamlı özellikler öğrenmeyi mümkün kılar. Kayıp fonksiyonu olarak genellikle InfoNCE veya NT-Xent kullanılır; bu formüller pozitif çiftin benzerliğini maksimize ederken negatif çiftlerin benzerliğini minimize eder. Sıcaklık (temperature) parametresi, öğrenmenin ne kadar sert veya yumuşak olacağını kontrol eder. Büyük batch boyutu kullanmak daha fazla negatif örnek anlamına geldiğinden doğrudan performansı etkiler. Önde gelen çerçeveler farklı yöntemler kullanır. SimCLR, büyük batch boyutu ve projeksiyon başlığıyla yüksek performans elde eder. MoCo, momentum kontrast yöntemi ve hafıza kuyruğuyla daha küçük batch boyutlarında çalışır. BYOL negatif örneklere gerek duymadan online ve target ağ mimarisini kullanır; bu yaklaşım negatif çift seçimindeki önyargıdan kaynaklanan hataları ortadan kaldırır. CLIP, görüntü-metin çiftleriyle eğitilerek sıfır-atımlı sınıflandırma ve çapraz modal arama görevlerinde çığır açmıştır. Uygulama alanları son derece geniştir: tıbbi görüntü analizi, ses tanıma, moleküler biyoloji, öneri sistemleri ve grafik verileri üzerinde çalışan modeller karşıtlıklı öğrenme tekniklerinden yararlanır. Büyük dil modellerinin ve görüntü-dil modellerinin ön-eğitiminde kritik bir rol oynamaktadır. Negatif çift sayısı modelin ayırt edici özellikler öğrenme kalitesini doğrudan etkiler; daha fazla negatif örnek genellikle daha iyi temsil öğrenimiyle sonuçlanır. Karşıtlıklı öğrenme, etiketleme maliyeti yüksek alanlarda yarı-denetimli öğrenmeyle birleştirildiğinde güçlü sonuçlar üretmektedir. Bu yöntemin gücü, modelin veri içindeki yapıyı ve anlam ilişkilerini insan etiketlemesi gerektirmeden keşfedebilmesinden kaynaklanmaktadır.
Zero-Shot Learning (Sıfır-Çekim Öğrenme)
Zero-Shot Learning (ZSL / Sıfır-Çekim Öğrenme), bir yapay zeka modelinin eğitim aşamasında hiç karşılaşmadığı sınıf veya görevler üzerinde başarılı tahminler yapabilmesi yeteneğidir. Klasik denetimli öğrenmede model, her sınıf için etiketli örneklerle eğitilir; zero-shot öğrenmede ise bu sınıfların örnekleri yoktur — model, sınıflar arasındaki kavramsal ilişkileri anlayarak bilinmeyen kategorilere genelleme yapar. Bu genellemeyi mümkün kılan temel mekanizma semantik bilgidir. Model, görünür (seen) sınıflar üzerinde eğitilirken bunların özelliklerini öğrenir — tüyler, gaga, kanat gibi nitelikleri. Test aşamasında, daha önce hiç görmediği bir kuş türü (görünmez sınıf) için model, "tüyü var + uzun gaga + su birikintisinde yaşar" gibi özelliklerin semantik kılavuzuyla doğru sınıflandırma yapar. Bu özellikler metin açıklamaları, özellik vektörleri veya bilgi grafları biçiminde sağlanabilir. Büyük dil modelleri (GPT, Claude, Gemini), zero-shot yeteneğini farklı bir mekanizma üzerinden gerçekleştirir. Ön eğitim sırasında petabaytlarca metin üzerinde öğrenilen geniş bilgi tabanı, modelin görev açıklamasını okuyarak görevi anlık olarak yürütmesine olanak tanır. "Bu metnin duygu tonunu belirle ve JSON formatında döndür" gibi bir yönerge, herhangi bir fine-tuning gerekmeksizin çalışır. Zero-shot öğrenme üç temel varyanta ayrılır. Standart zero-shot, tamamen yeni sınıflar üzerinde çalışır. Generalized zero-shot, hem görünür hem de görünmez sınıfları bir arada değerlendirerek daha gerçekçi bir senaryo sunar; bu durumda model, bilinen sınıflara aşırı eğilim gösterme (seen class bias) riski taşır. Few-shot learning ise her yeni sınıf için yalnızca birkaç örnek (1-5) kullanır; zero-shot'un doğrudan genellemesiyle kıyaslanınca tipik olarak daha yüksek doğruluk sağlar. CLIP (OpenAI, 2021) zero-shot öğrenmenin çığır açan örneğidir: görüntü ve metin eşleştirmesiyle önceden eğitilen bu model, ImageNet gibi veri setlerinde hiç fine-tuning yapmaksızın rekabetçi sonuçlar elde etmiştir. Benzer şekilde GPT-4 ve Claude, daha önce görmedikleri görevleri (kod çevirme, format dönüştürme, alan terminolojisi) sıfır örneğe dayanarak yürütebilmektedir. Bu yetenek, veri etiketlemenin pahalı veya imkânsız olduğu tıbbi teşhis, az-kaynaklı dil işleme ve endüstriyel anomali tespiti gibi alanlarda kritik pratik değer taşır.