Zero-Shot Learning (Sıfır-Çekim Öğrenme)

Zero-Shot Learning, bir modelin hiç görmediği sınıf veya görevler üzerinde, yalnızca kavramsal bilgiyi aktararak doğru tahmin yapabilme yeteneğidir.

Zero-Shot Learning (ZSL / Sıfır-Çekim Öğrenme), bir yapay zeka modelinin eğitim aşamasında hiç karşılaşmadığı sınıf veya görevler üzerinde başarılı tahminler yapabilmesi yeteneğidir. Klasik denetimli öğrenmede model, her sınıf için etiketli örneklerle eğitilir; zero-shot öğrenmede ise bu sınıfların örnekleri yoktur — model, sınıflar arasındaki kavramsal ilişkileri anlayarak bilinmeyen kategorilere genelleme yapar. Bu genellemeyi mümkün kılan temel mekanizma semantik bilgidir. Model, görünür (seen) sınıflar üzerinde eğitilirken bunların özelliklerini öğrenir — tüyler, gaga, kanat gibi nitelikleri. Test aşamasında, daha önce hiç görmediği bir kuş türü (görünmez sınıf) için model, "tüyü var + uzun gaga + su birikintisinde yaşar" gibi özelliklerin semantik kılavuzuyla doğru sınıflandırma yapar. Bu özellikler metin açıklamaları, özellik vektörleri veya bilgi grafları biçiminde sağlanabilir. Büyük dil modelleri (GPT, Claude, Gemini), zero-shot yeteneğini farklı bir mekanizma üzerinden gerçekleştirir. Ön eğitim sırasında petabaytlarca metin üzerinde öğrenilen geniş bilgi tabanı, modelin görev açıklamasını okuyarak görevi anlık olarak yürütmesine olanak tanır. "Bu metnin duygu tonunu belirle ve JSON formatında döndür" gibi bir yönerge, herhangi bir fine-tuning gerekmeksizin çalışır. Zero-shot öğrenme üç temel varyanta ayrılır. Standart zero-shot, tamamen yeni sınıflar üzerinde çalışır. Generalized zero-shot, hem görünür hem de görünmez sınıfları bir arada değerlendirerek daha gerçekçi bir senaryo sunar; bu durumda model, bilinen sınıflara aşırı eğilim gösterme (seen class bias) riski taşır. Few-shot learning ise her yeni sınıf için yalnızca birkaç örnek (1-5) kullanır; zero-shot'un doğrudan genellemesiyle kıyaslanınca tipik olarak daha yüksek doğruluk sağlar. CLIP (OpenAI, 2021) zero-shot öğrenmenin çığır açan örneğidir: görüntü ve metin eşleştirmesiyle önceden eğitilen bu model, ImageNet gibi veri setlerinde hiç fine-tuning yapmaksızın rekabetçi sonuçlar elde etmiştir. Benzer şekilde GPT-4 ve Claude, daha önce görmedikleri görevleri (kod çevirme, format dönüştürme, alan terminolojisi) sıfır örneğe dayanarak yürütebilmektedir. Bu yetenek, veri etiketlemenin pahalı veya imkânsız olduğu tıbbi teşhis, az-kaynaklı dil işleme ve endüstriyel anomali tespiti gibi alanlarda kritik pratik değer taşır.

Zero-Shot Learning Nasıl Çalışır?

Zero-shot öğrenme, iki temel bileşene dayanır: görünür sınıflar üzerinde öğrenilen bir özellik uzayı ve her sınıfı tanımlayan semantik bilgi. Eğitim aşamasında model, etiketli verisi olan sınıfları öğrenirken bunların özelliklerini (nitelik vektörü, metin açıklaması veya bilgi grafı yerleşimi) da kodlar. Test aşamasında, hiç görmediği bir sınıf için bu semantik bilgi köprüsü aracılığıyla tahmin yapar: görüntü özellik vektörü ile sınıf tanımlama vektörü karşılaştırılır, en yakın semantik eşleşme seçilir.

Büyük dil modellerinde zero-shot farklı çalışır: model, görev yönergesi (prompt) okunarak hangi işlemin gerekeceğini bağlamdan çıkarır. Sınıflar arası ilişki yerine dil anlama ve dünya bilgisi devreye girer.

Zero-Shot, Few-Shot ve Fine-Tuning Farkı

Zero-shot: Hiç görmeden — model yalnızca görev açıklamasını okuyarak çalışır. Veri gerektirmez, en esnek yaklaşımdır; doğruluk tipik olarak en düşüktür.

One-shot: Her sınıf için tek bir örnek. Modelin örnek kalıplarını hızla kavramasını test eder; dil modellerinde bağlam penceresine bir örnek koymak yeterlidir.

Few-shot: Her sınıf için 2-10 örnek. Zero-shot'a kıyasla belirgin doğruluk kazanımı sağlar; bağlam içi öğrenme (in-context learning) olarak da adlandırılır.

Fine-tuning: Hedefe özgü büyük veri setiyle tüm parametrelerin güncellenmesi. En yüksek doğruluğu verir ama veri, zaman ve hesaplama maliyeti gerektirir.

Semantik Bilgi Kaynakları

Zero-shot öğrenmenin kalitesi büyük ölçüde semantik bilgi kaynağının zenginliğine bağlıdır.

Nitelik Vektörleri (Attribute Vectors): Her sınıf, insan tanımlı ikili veya sürekli özelliklerle temsil edilir. Yorumlanabilirliği yüksektir ancak alan uzmanı gerektirir.

Kelime Gömmeleri (Word Embeddings): Word2Vec, GloVe veya FastText gibi modeller sınıf isimlerini yoğun vektörlere dönüştürür. İnsan müdahalesi gerektirmez; anlam ilişkileri otomatik kodlanır.

Dil Modeli Açıklamaları: GPT veya T5 gibi modeller sınıf açıklamalarını anlık oluşturabilir; bu açıklamalar semantik köprü işlevi görür.

Bilgi Grafları (Knowledge Graphs): WordNet, Wikidata gibi yapılandırılmış bilgi tabanları sınıflar arası hiyerarşik ve ilişkisel bağları kodlar.

Başlıca Uygulama Alanları

Az-Kaynaklı Dil İşleme: Türkçe, Swahili veya Kazakça gibi etiketli verisi kıt diller için zero-shot transfer, kaynak dildeki modelden bilgi köprüsüyle tahmin yapar.

Tıbbi Görüntü Analizi: Nadir hastalıklar için vaka sayısı çok azdır. Zero-shot öğrenme, klinik metin açıklamalarını kullanarak yeni patolojileri tanıyabilir.

Endüstriyel Anomali Tespiti: Fabrika hattında her arıza türü için önceden etiket toplamak olanaksızdır; zero-shot yöntemi, arıza açıklamalarıyla yeni hata türlerini yakalar.

LLM Görev Yönlendirme: GPT, Claude ve Gemini gibi modeller, kod çevirme, format dönüştürme ve mantık yürütme gibi görevleri sıfır örnekle yürütür. Bu, modern LLM tabanlı üretim uygulamalarının temel prensibidir.

CLIP ve Çok-Modlu Zero-Shot

OpenAI'ın 2021'de yayımladığı CLIP (Contrastive Language-Image Pretraining), zero-shot öğrenmenin en çarpıcı başarılarından birini sergiledi. 400 milyon görüntü-metin çiftiyle eğitilen CLIP, ImageNet'te hiç fine-tuning yapmaksızın %76,2 top-1 doğruluğa ulaştı. Test sırasında her sınıf için 'a photo of a {class}' şablonlu metin yerleşimi oluşturulur ve görüntü özellikleriyle en yakın metin yerleşimi eşleştirilir.

CLIP'in açtığı yolda SAM (Segment Anything Model), ALIGN ve Florence-2 gibi modeller de çok-modlu zero-shot yeteneğini daha ileri taşımış; 2026 itibarıyla çok-modlu zero-shot, görüntü-metin-ses üçgeninde standart bir yaklaşım hâline gelmiştir.

Sınırlılıklar ve Aktif Araştırma

Zero-shot öğrenmenin en kritik sorunu görünür sınıf önyargısı (seen class bias)dır: genelleştirilmiş zero-shot senaryosunda model, hem bilinen hem bilinmeyen sınıfları değerlendirdiğinde eğitimde gördüğü sınıflara fazla eğilim gösterir. Kalibreli örnekleme ve entropi tabanlı düzeltme yöntemleri bu sorunu azaltmaya çalışır.

Semantik uçurum (semantic gap) ikinci büyük sorundur: görsel özellik uzayı ile semantik tanımlama uzayı arasındaki mesafe, genelleme kalitesini doğrudan etkiler. Transduktif zero-shot ve sınıf-üretici yaklaşımlar (VAE/GAN ile görünmez sınıflar için görsel özellik sentezi) bu boşluğu kapatmaya yönelik aktif araştırma alanlarıdır.

Sık Sorulan Sorular

Zero-shot learning nedir, kısaca açıklar mısınız? Bir modelin hiç eğitim örneği görmediği sınıflar veya görevler üzerinde, kavramsal bilgi köprüsüyle doğru tahmin yapabilmesidir. Örneğin 'zebra' sınıfı hiç gösterilmeden, 'çizgili at' tanımıyla doğru sınıflandırma yapabilmek.

ChatGPT de zero-shot öğrenme mi kullanıyor? Evet. ChatGPT, Claude ve Gemini gibi büyük dil modelleri, kullanıcının prompt'undaki görev açıklamasını okuyarak fine-tuning olmaksızın görev yürütür. Bu, zero-shot yeteneğinin LLM uygulamasıdır.

Zero-shot mu, few-shot mu tercih edilmeli? Veri varsa few-shot hemen hemen her zaman daha yüksek doğruluk sağlar. Zero-shot, veri toplama maliyetinin yüksek olduğu veya sınıf kümesinin çok sık değiştiği senaryolarda tercih edilir.

CLIP neden zero-shot'ta bu kadar başarılı? CLIP, görüntü ve metin temsillerini aynı gömme uzayında eğittiği için sınıf isimlerini doğal dil şablonlarıyla ifade edip görüntü özellikleriyle doğrudan karşılaştırabilir.

Zero-shot Türkçe NLP projelerinde kullanılabilir mi? Evet. mBERT, XLM-R ve çok-dilli GPT/Llama modelleri, İngilizce fine-tuning'dan Türkçe'ye çapraz dil zero-shot transferi yapabilir.