tag Few-Shot

Few-Shot Learning (Az Örnekle Öğrenme)

Bu sayfada Few-Shot (Few-Shot Learning (Az Örnekle Öğrenme)) etiketi ile işaretlenmiş 5 yapay zeka kavramını bulabilirsiniz.

Few-Shot Learning (Az Örnekle Öğrenme), bir yapay zeka modelinin çok az sayıda etiketli örnek kullanarak yeni bir görevi başarıyla öğrenebilme yeteneğini inceleyen makine öğrenimi paradigmasıdır. Geleneksel denetimli öğrenme algoritmaları güvenilir sonuçlar üretmek için binlerce hatta milyonlarca etiketli veri örneğine ihtiyaç duyarken, few-shot learning yalnızca birkaç örnekle (genellikle 2-10 arası) doğru tahminler yapabilmeyi hedefler. Bu yaklaşım özellikle etiketli veri toplamak için uzman insan emeği gerektiren tıbbi görüntü analizi, nadir dil çiftleri için otomatik çeviri ve yeni ürün kategorizasyonu gibi alanlarda kritik öneme sahiptir. Few-shot learning; model-agnostik meta-öğrenme (MAML), prototipal ağlar, ilişkisel ağlar ve eşleşme ağları gibi tekniklerle hayata geçirilir. Modern büyük dil modellerinde (LLM) few-shot yaklaşım, prompt içine birkaç girdi-çıktı çifti yerleştirerek modelin görevi bağlamdan çıkarmasını sağlar; bu tekniğe in-context few-shot prompting adı verilir. GPT-4, Claude ve Gemini gibi modeller, herhangi bir parametre güncellemesi gerektirmeden yalnızca birkaç örnek ile yeni görevlerde yüksek başarı oranlarına ulaşabilmektedir. Few-shot learning paradigmaları genellikle N-way K-shot formatında tanımlanır: N farklı sınıf, her sınıftan K eğitim örneği. 5-way 1-shot sınıflandırması, 5 yeni kategoriden her birinde yalnızca 1 örnek görerek doğru sınıflandırma yapmak demektir. Bu format, modelin genelleştirme kapasitesini standart ve ölçülebilir biçimde değerlendirmek için yaygın bir kıyaslama standardı hâline gelmiştir. Episodic training (bölümlü eğitim) yaklaşımında her eğitim döngüsü, destek kümesi ve sorgu kümesinden oluşan küçük bir mini görev simüle eder; bu yapı modelin görülmemiş sınıflara hızlı uyum becerisini doğrudan pekiştirir. Pratik kullanımda destek örneklerinin seçim kalitesi, sınıf temsili dengesi ve veri kaynaklı gürültü, few-shot sistem başarısını doğrudan etkileyen başlıca faktörler arasında yer alır. Kavram; hiç örnek gerektirmeyen zero-shot learning ile yüzlerce-binlerce örneğe ihtiyaç duyan fine-tuning arasında pratik bir orta yol sunar. Büyük ön-eğitimli modellerin yaygınlaşmasıyla birlikte few-shot yetenekler giderek artan önem kazanmaktadır.

psychology

In-Context Learning (Bağlam İçi Öğrenme)

In-context learning (bağlam içerisinde öğrenme), büyük dil modellerinin ağ ağırlıklarını hiçbir şekilde güncellemeksizin, yalnızca prompt içerisine yerleştirilen girdi-çıktı örneklerinden görevi anlayıp yeni bir girdi için doğru çıktı üretme yetenektir. Geleneksel makine öğrenmesinden kökten farklı bu yetenekte gradient hesaplama, geri yayılım veya ağırlık güncelleme yoktur; model, dikkat mekanizması aracılığıyla prompt'taki örnekleri bir tür acil hafıza gibi kullanır. In-context learning üç alt kategoride incelenir. Zero-shot learning, hiç örnek verilmeden yalnızca görev tanımı veya talimatla çalışır. One-shot learning, tek bir girdi-çıktı örneği ile görevi anlama girişimidir. Few-shot learning ise genellikle üç ila on arasında örnek kullanır ve GPT-3 makalesinin odaklandığı asıl yaklaşımdır. Bu üç durum aslında aynı mekanizmanın örnek sayısına göre özel halleridir. 2020 yılında yayınlanan GPT-3 makalesi, in-context learning'i yapay zeka araştırmasının odak noktalarından birine dönüştürdü. Makale, 175 milyar parametreli GPT-3'ün onlarca görevi örnek görmeksizin veya yalnızca birkaç örnekle gerçekleştirebildiğini sistematik olarak göstermiş; bu sonuç dil modellerinin yetenekleri konusundaki beklentileri kökten değiştirmiştir. Mekanizma sorusu hala tartışmalıdır. Bir yaklaşım, in-context learning'in gizli bir gradient descent gerçekleştirdiğini öne sürer: dikkat mekanizması, örneklerden üstkalık doğrusallık gibi temel kalıpları çıkartmak için fonksiyonel olarak gradyan hesaplamaya benzeyen bir süreç yürütmektedir. Alternatif yorum ise modelin eğitim sırasında on milyarlarca belgede gördüğünden benzer görevlerin farklı biçimlerini öğrenip bunları prompt'taki sinyal üzerine yeniden etkinleştirdiğini öne sürer. Uygulamada in-context learning prompt mühendisliği ile doğrudan bağlantılıdır. Hangi örneklerin seçildiğini, örneklerin sırası, örnek sayısı ve talimatın formatı model performansını onlu ölçekte etkiler. Chain-of-Thought prompting gibi teknikler, bu mekanizma üzerine akıl yürütme adımlarını yerleştirir. **Sık Sorulan Sorular** **In-context learning ile fine-tuning arasındaki fark nedir?** Fine-tuning ağ ağırlıklarını gerçekten günceller ve sürekli öğrenmeyi temsil eder. In-context learning ağırlıksız, çıkarım sırasında gerçekleşir; daha esnek ama daha az kalıcı öğrenme demektir. **Hangi modeller in-context learning'i iyi yapar?** Genel olarak büyük modeller daha iyidir; GPT-4, Claude ve Gemini gibi frontier modeller küçük modellerden belirgin şekilde üst performans gösterir. Model büyüklüğü ile in-context yetenek arasındaki ilişki yaklaşık log-doğrusaldır. **Örnek sırası önemli midir?** Evet, araştırmalar örnek sırasının performansı onlu yüzde kadar etkileyebildiğini göstermiştir. Optimal sıra veri kümesine ve göreve bağımlıdır; genel kural yoktur. **In-context learning'in sınırları nelerdir?** Bağlam penceresi sınırı, örnek sayısını küçük tutar. Çok adımlı akıl yürütme gerektiren veya sık güncellenen veri gerektiren görevlerde fine-tuning tipik olarak daha iyi sonuç verir.

arrow_forward
psychology_alt

Few-Shot Learning (Az Örnekle Öğrenme)

Few-Shot Learning (Az Örnekle Öğrenme), bir yapay zeka modelinin çok az sayıda etiketli örnek kullanarak yeni bir görevi başarıyla öğrenebilme yeteneğini inceleyen makine öğrenimi paradigmasıdır. Geleneksel denetimli öğrenme algoritmaları güvenilir sonuçlar üretmek için binlerce hatta milyonlarca etiketli veri örneğine ihtiyaç duyarken, few-shot learning yalnızca birkaç örnekle (genellikle 2-10 arası) doğru tahminler yapabilmeyi hedefler. Bu yaklaşım özellikle etiketli veri toplamak için uzman insan emeği gerektiren tıbbi görüntü analizi, nadir dil çiftleri için otomatik çeviri ve yeni ürün kategorizasyonu gibi alanlarda kritik öneme sahiptir. Few-shot learning; model-agnostik meta-öğrenme (MAML), prototipal ağlar, ilişkisel ağlar ve eşleşme ağları gibi tekniklerle hayata geçirilir. Modern büyük dil modellerinde (LLM) few-shot yaklaşım, prompt içine birkaç girdi-çıktı çifti yerleştirerek modelin görevi bağlamdan çıkarmasını sağlar; bu tekniğe in-context few-shot prompting adı verilir. GPT-4, Claude ve Gemini gibi modeller, herhangi bir parametre güncellemesi gerektirmeden yalnızca birkaç örnek ile yeni görevlerde yüksek başarı oranlarına ulaşabilmektedir. Few-shot learning paradigmaları genellikle N-way K-shot formatında tanımlanır: N farklı sınıf, her sınıftan K eğitim örneği. 5-way 1-shot sınıflandırması, 5 yeni kategoriden her birinde yalnızca 1 örnek görerek doğru sınıflandırma yapmak demektir. Bu format, modelin genelleştirme kapasitesini standart ve ölçülebilir biçimde değerlendirmek için yaygın bir kıyaslama standardı hâline gelmiştir. Episodic training (bölümlü eğitim) yaklaşımında her eğitim döngüsü, destek kümesi ve sorgu kümesinden oluşan küçük bir mini görev simüle eder; bu yapı modelin görülmemiş sınıflara hızlı uyum becerisini doğrudan pekiştirir. Pratik kullanımda destek örneklerinin seçim kalitesi, sınıf temsili dengesi ve veri kaynaklı gürültü, few-shot sistem başarısını doğrudan etkileyen başlıca faktörler arasında yer alır. Kavram; hiç örnek gerektirmeyen zero-shot learning ile yüzlerce-binlerce örneğe ihtiyaç duyan fine-tuning arasında pratik bir orta yol sunar. Büyük ön-eğitimli modellerin yaygınlaşmasıyla birlikte few-shot yetenekler giderek artan önem kazanmaktadır.

arrow_forward
engineering

Prompt Engineering (Prompt Mühendisliği)

Prompt mühendisliği (Prompt Engineering), büyük dil modellerinden (LLM) istenen çıktıyı elde etmek için girdi talimatlarını sistematik biçimde tasarlama ve optimize etme disiplinidir. Modelin parametrelerini değiştirmeden, yalnızca metin girdisini biçimlendirerek model davranışını yönlendirmek bu disiplinin özünü oluşturur. Etkili bir prompt; görevin net tanımını, bağlamı, format yönergelerini ve gerekiyorsa örnek girdi-çıktı çiftlerini içerir. "Bana bir e-posta yaz" ile "Müşteriye sipariş gecikmesini özür dileyerek açıklayan, profesyonel, 3 paragraftan oluşan bir e-posta yaz" arasındaki fark, bu disiplinin temel mantığını yansıtır. Temel teknikler şunlardır: Zero-shot prompting modelden önceki örnek göstermeksizin görev yapmasını ister. Few-shot prompting 2-5 örnek göstererek modeli yönlendirir ve çıktı formatını öğretir. Chain-of-Thought (CoT), "adım adım düşün" talimatıyla modelin akıl yürütme zincirini görünür kılar; karmaşık matematik ve mantık problemlerinde başarıyı önemli ölçüde artırır. Tree-of-Thoughts ise birden fazla akıl yürütme yolunu paralel değerlendirir. Sistem promptu, modelin rol ve davranış çerçevesini belirleyen kalıcı bir talimat katmanıdır; kullanıcı girdisinden önce işlenir. Güvenlik açısından kritik olan prompt injection saldırıları, kötü niyetli kullanıcı girdilerinin sistem promptunu geçersiz kılmaya çalıştığı bir tehdit vektörüdür. Koruma için girdi sanitizasyonu ve güvenilir içerik etiketleme uygulanır. Araçlar ekosistemi hızla genişlemektedir: LangChain ve LlamaIndex RAG pipeline'larında prompt yönetimi sunarken, PromptLayer prompt sürümleme imkânı tanır. DSPy (Stanford) ise promptları insanlar yerine algoritmaların optimize ettiği otomatik prompt optimizasyonu yaklaşımıdır. Türkiye'de prompt mühendisliği becerisi; müşteri hizmetleri otomasyonu, hukuki metin analizi ve yazılım geliştirme iş akışlarında giderek daha fazla aranmaktadır. Türkçe promptlarda dil yapısına özgü dikkat noktaları (SOV söz dizimi, eylem çekimi, soru ekleri) model çıktı kalitesini doğrudan etkiler; teknik terimlerin İngilizce karşılığını parantez içinde eklemek belirsizliği azaltır. GPT-4o ve Claude gibi güçlü modellerde Türkçe few-shot örnekler çıktı kalitesini belirgin biçimde artırır.

arrow_forward
code_blocks

Siamese Network (Siyam Ağı)

Siyam Ağı (Siamese Network), ağırlık paylaşan iki veya daha fazla özdeş alt ağ (branch) kullanarak girdi çiftleri ya da üçlüleri arasındaki benzerliği öğrenen derin öğrenme mimarisidir. Adını 19. yüzyılda yaşamış Chang ve Eng Bunker isimli siyam ikizlerinden alan bu yapı, her iki dalda da tamamen aynı ağırlıkların kullanılmasını zorunlu kılar; bu durum iki girdinin aynı özellik uzayında karşılaştırılabilmesini güvence altına alır. Çalışma mekanizması şu biçimde özetlenebilir: her girdi kendi dalından geçerek sabit boyutlu bir özellik vektörüne (embedding) dönüştürülür. Ardından iki vektör arasındaki Öklid ya da kosinüs uzaklığı hesaplanır. Eğitim sırasında model, benzer çiftlerin gömülü vektörlerini birbirine yaklaştırırken farklı çiftlerin vektörlerini birbirinden uzaklaştıracak şekilde güncellenir. Bu öğrenme süreci contrastive loss veya triplet loss işlevleriyle yönlendirilir. Contrastive loss, benzer çiftlerin uzaklığını minimize ederken farklı çiftlerin uzaklığını belirli bir marjin üstüne iter ve ikili etiket gerektirir. Triplet loss ise bir çapa (anchor), bir pozitif (benzer) ve bir negatif (farklı) örnek üçlüsüyle çalışır; FaceNet ve modern yüz tanıma sistemlerinin büyük çoğunluğu bu yaklaşımı kullanır. Siyam ağlarının en güçlü özelliği, one-shot öğrenmedir. Klasik sınıflandırıcılar bir sınıfı tanımak için yüzlerce veya binlerce etiketli örnek isterken siyam ağları benzerlik ölçümünü doğrudan öğrendiğinden, test sırasında yeni bir sınıfın tek bir örneği verilse bile bu sınıfı diğerlerinden ayırt edebilir. Bu özellik etiketleme maliyetinin yüksek olduğu tıbbi görüntüleme ve adli bilişim gibi alanlarda büyük değer taşır. Öne çıkan uygulamalar şunlardır: Google FaceNet yüz doğrulama ve tanıma, imza doğrulama sistemleri, yazı karakter tanıma (Omniglot veri seti) ve tıbbi görüntülemede nadir hastalıkların tespiti. Siyam ağları, sınırlı veriyle yüksek doğruluk gerektiren her senaryoda tercih edilen bir mimari olmayı sürdürmektedir.

arrow_forward
travel_explore

Zero-Shot Learning (Sıfır-Çekim Öğrenme)

Zero-Shot Learning (ZSL / Sıfır-Çekim Öğrenme), bir yapay zeka modelinin eğitim aşamasında hiç karşılaşmadığı sınıf veya görevler üzerinde başarılı tahminler yapabilmesi yeteneğidir. Klasik denetimli öğrenmede model, her sınıf için etiketli örneklerle eğitilir; zero-shot öğrenmede ise bu sınıfların örnekleri yoktur — model, sınıflar arasındaki kavramsal ilişkileri anlayarak bilinmeyen kategorilere genelleme yapar. Bu genellemeyi mümkün kılan temel mekanizma semantik bilgidir. Model, görünür (seen) sınıflar üzerinde eğitilirken bunların özelliklerini öğrenir — tüyler, gaga, kanat gibi nitelikleri. Test aşamasında, daha önce hiç görmediği bir kuş türü (görünmez sınıf) için model, "tüyü var + uzun gaga + su birikintisinde yaşar" gibi özelliklerin semantik kılavuzuyla doğru sınıflandırma yapar. Bu özellikler metin açıklamaları, özellik vektörleri veya bilgi grafları biçiminde sağlanabilir. Büyük dil modelleri (GPT, Claude, Gemini), zero-shot yeteneğini farklı bir mekanizma üzerinden gerçekleştirir. Ön eğitim sırasında petabaytlarca metin üzerinde öğrenilen geniş bilgi tabanı, modelin görev açıklamasını okuyarak görevi anlık olarak yürütmesine olanak tanır. "Bu metnin duygu tonunu belirle ve JSON formatında döndür" gibi bir yönerge, herhangi bir fine-tuning gerekmeksizin çalışır. Zero-shot öğrenme üç temel varyanta ayrılır. Standart zero-shot, tamamen yeni sınıflar üzerinde çalışır. Generalized zero-shot, hem görünür hem de görünmez sınıfları bir arada değerlendirerek daha gerçekçi bir senaryo sunar; bu durumda model, bilinen sınıflara aşırı eğilim gösterme (seen class bias) riski taşır. Few-shot learning ise her yeni sınıf için yalnızca birkaç örnek (1-5) kullanır; zero-shot'un doğrudan genellemesiyle kıyaslanınca tipik olarak daha yüksek doğruluk sağlar. CLIP (OpenAI, 2021) zero-shot öğrenmenin çığır açan örneğidir: görüntü ve metin eşleştirmesiyle önceden eğitilen bu model, ImageNet gibi veri setlerinde hiç fine-tuning yapmaksızın rekabetçi sonuçlar elde etmiştir. Benzer şekilde GPT-4 ve Claude, daha önce görmedikleri görevleri (kod çevirme, format dönüştürme, alan terminolojisi) sıfır örneğe dayanarak yürütebilmektedir. Bu yetenek, veri etiketlemenin pahalı veya imkânsız olduğu tıbbi teşhis, az-kaynaklı dil işleme ve endüstriyel anomali tespiti gibi alanlarda kritik pratik değer taşır.

arrow_forward