tag In-Context Learning

Bu sayfada In-Context Learning etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

In-context learning (bağlam içerisinde öğrenme), büyük dil modellerinin ağ ağırlıklarını hiçbir şekilde güncellemeksizin, yalnızca prompt içerisine yerleştirilen girdi-çıktı örneklerinden görevi anlayıp yeni bir girdi için doğru çıktı üretme yetenektir. Geleneksel makine öğrenmesinden kökten farklı bu yetenekte gradient hesaplama, geri yayılım veya ağırlık güncelleme yoktur; model, dikkat mekanizması aracılığıyla prompt'taki örnekleri bir tür acil hafıza gibi kullanır. In-context learning üç alt kategoride incelenir. Zero-shot learning, hiç örnek verilmeden yalnızca görev tanımı veya talimatla çalışır. One-shot learning, tek bir girdi-çıktı örneği ile görevi anlama girişimidir. Few-shot learning ise genellikle üç ila on arasında örnek kullanır ve GPT-3 makalesinin odaklandığı asıl yaklaşımdır. Bu üç durum aslında aynı mekanizmanın örnek sayısına göre özel halleridir. 2020 yılında yayınlanan GPT-3 makalesi, in-context learning'i yapay zeka araştırmasının odak noktalarından birine dönüştürdü. Makale, 175 milyar parametreli GPT-3'ün onlarca görevi örnek görmeksizin veya yalnızca birkaç örnekle gerçekleştirebildiğini sistematik olarak göstermiş; bu sonuç dil modellerinin yetenekleri konusundaki beklentileri kökten değiştirmiştir. Mekanizma sorusu hala tartışmalıdır. Bir yaklaşım, in-context learning'in gizli bir gradient descent gerçekleştirdiğini öne sürer: dikkat mekanizması, örneklerden üstkalık doğrusallık gibi temel kalıpları çıkartmak için fonksiyonel olarak gradyan hesaplamaya benzeyen bir süreç yürütmektedir. Alternatif yorum ise modelin eğitim sırasında on milyarlarca belgede gördüğünden benzer görevlerin farklı biçimlerini öğrenip bunları prompt'taki sinyal üzerine yeniden etkinleştirdiğini öne sürer. Uygulamada in-context learning prompt mühendisliği ile doğrudan bağlantılıdır. Hangi örneklerin seçildiğini, örneklerin sırası, örnek sayısı ve talimatın formatı model performansını onlu ölçekte etkiler. Chain-of-Thought prompting gibi teknikler, bu mekanizma üzerine akıl yürütme adımlarını yerleştirir. **Sık Sorulan Sorular** **In-context learning ile fine-tuning arasındaki fark nedir?** Fine-tuning ağ ağırlıklarını gerçekten günceller ve sürekli öğrenmeyi temsil eder. In-context learning ağırlıksız, çıkarım sırasında gerçekleşir; daha esnek ama daha az kalıcı öğrenme demektir. **Hangi modeller in-context learning'i iyi yapar?** Genel olarak büyük modeller daha iyidir; GPT-4, Claude ve Gemini gibi frontier modeller küçük modellerden belirgin şekilde üst performans gösterir. Model büyüklüğü ile in-context yetenek arasındaki ilişki yaklaşık log-doğrusaldır. **Örnek sırası önemli midir?** Evet, araştırmalar örnek sırasının performansı onlu yüzde kadar etkileyebildiğini göstermiştir. Optimal sıra veri kümesine ve göreve bağımlıdır; genel kural yoktur. **In-context learning'in sınırları nelerdir?** Bağlam penceresi sınırı, örnek sayısını küçük tutar. Çok adımlı akıl yürütme gerektiren veya sık güncellenen veri gerektiren görevlerde fine-tuning tipik olarak daha iyi sonuç verir.

psychology

In-Context Learning (Bağlam İçi Öğrenme)

In-context learning (bağlam içerisinde öğrenme), büyük dil modellerinin ağ ağırlıklarını hiçbir şekilde güncellemeksizin, yalnızca prompt içerisine yerleştirilen girdi-çıktı örneklerinden görevi anlayıp yeni bir girdi için doğru çıktı üretme yetenektir. Geleneksel makine öğrenmesinden kökten farklı bu yetenekte gradient hesaplama, geri yayılım veya ağırlık güncelleme yoktur; model, dikkat mekanizması aracılığıyla prompt'taki örnekleri bir tür acil hafıza gibi kullanır. In-context learning üç alt kategoride incelenir. Zero-shot learning, hiç örnek verilmeden yalnızca görev tanımı veya talimatla çalışır. One-shot learning, tek bir girdi-çıktı örneği ile görevi anlama girişimidir. Few-shot learning ise genellikle üç ila on arasında örnek kullanır ve GPT-3 makalesinin odaklandığı asıl yaklaşımdır. Bu üç durum aslında aynı mekanizmanın örnek sayısına göre özel halleridir. 2020 yılında yayınlanan GPT-3 makalesi, in-context learning'i yapay zeka araştırmasının odak noktalarından birine dönüştürdü. Makale, 175 milyar parametreli GPT-3'ün onlarca görevi örnek görmeksizin veya yalnızca birkaç örnekle gerçekleştirebildiğini sistematik olarak göstermiş; bu sonuç dil modellerinin yetenekleri konusundaki beklentileri kökten değiştirmiştir. Mekanizma sorusu hala tartışmalıdır. Bir yaklaşım, in-context learning'in gizli bir gradient descent gerçekleştirdiğini öne sürer: dikkat mekanizması, örneklerden üstkalık doğrusallık gibi temel kalıpları çıkartmak için fonksiyonel olarak gradyan hesaplamaya benzeyen bir süreç yürütmektedir. Alternatif yorum ise modelin eğitim sırasında on milyarlarca belgede gördüğünden benzer görevlerin farklı biçimlerini öğrenip bunları prompt'taki sinyal üzerine yeniden etkinleştirdiğini öne sürer. Uygulamada in-context learning prompt mühendisliği ile doğrudan bağlantılıdır. Hangi örneklerin seçildiğini, örneklerin sırası, örnek sayısı ve talimatın formatı model performansını onlu ölçekte etkiler. Chain-of-Thought prompting gibi teknikler, bu mekanizma üzerine akıl yürütme adımlarını yerleştirir. **Sık Sorulan Sorular** **In-context learning ile fine-tuning arasındaki fark nedir?** Fine-tuning ağ ağırlıklarını gerçekten günceller ve sürekli öğrenmeyi temsil eder. In-context learning ağırlıksız, çıkarım sırasında gerçekleşir; daha esnek ama daha az kalıcı öğrenme demektir. **Hangi modeller in-context learning'i iyi yapar?** Genel olarak büyük modeller daha iyidir; GPT-4, Claude ve Gemini gibi frontier modeller küçük modellerden belirgin şekilde üst performans gösterir. Model büyüklüğü ile in-context yetenek arasındaki ilişki yaklaşık log-doğrusaldır. **Örnek sırası önemli midir?** Evet, araştırmalar örnek sırasının performansı onlu yüzde kadar etkileyebildiğini göstermiştir. Optimal sıra veri kümesine ve göreve bağımlıdır; genel kural yoktur. **In-context learning'in sınırları nelerdir?** Bağlam penceresi sınırı, örnek sayısını küçük tutar. Çok adımlı akıl yürütme gerektiren veya sık güncellenen veri gerektiren görevlerde fine-tuning tipik olarak daha iyi sonuç verir.

arrow_forward
code_blocks

Az-Atışlı İstem (Az-Atışlı İstem (Few-Shot Prompting))

Az-Atışlı İstem (Few-Shot Prompting), büyük dil modellerine (LLM) görevi açıklamadan önce birkaç örnek girdi-çıktı çifti göstererek modelin istenen davranışı örneklerden çıkarsamasını sağlayan bir bağlam içi öğrenme (in-context learning) tekniğidir. GPT-3'ün 2020'deki tanıtımıyla popülerleşen bu yaklaşım, herhangi bir ağırlık güncellemesi gerektirmez; model yalnızca bağlamı (promptu) okuyarak örüntüyü genelleştirir. Zero-shot prompting'de model yalnızca talimatla yönlendirilirken, few-shot'ta 2-10 arası somut örnek sağlanır: girdi → beklenen çıktı formatında. Bu örnekler modelin ton, format ve muhakeme stilini hızla yakalamasını sağlar. Örneğin duygu analizi için "Bu yorum olumsuz: 'Berbat bir ürün' → Negatif. Bu yorum olumlu: 'Harika deneyim!' → Pozitif. Bu yorum nedir: 'İdare eder'?" şeklinde bir prompt, etiket tanımı gerektirmeden doğru sınıflandırma yapmasını mümkün kılar. Few-shot prompting özellikle etiketli eğitim verisi oluşturmanın pahalı veya yavaş olduğu alanlarda, hızlı prototipleme aşamalarında ve model ince ayarı (fine-tuning) için yeterli veri bulunmadığında güçlü bir alternatif sunar. Örnek seçimi kritik öneme sahiptir: temsili, çeşitli ve doğru etiketlenmiş örnekler modelin genelleştirme kapasitesini artırırken hatalı veya tekrarlayan örnekler performansı düşürür. Çoklu örnek formatı dışında Chain-of-Thought (CoT) few-shot tekniği, her örneğe adım adım akıl yürütme süreci eklenerek modelin karmaşık matematiksel veya mantıksal problemleri çözmesini güçlü biçimde destekler. Google DeepMind'ın araştırmaları (2022), CoT few-shot kombinasyonunun aritmetik akıl yürütmede yalnızca standart few-shot'a kıyasla iki kata varan doğruluk artışı sağladığını göstermiştir. Ancak dikkat edilmesi gereken sınırlamalar vardır: bağlam penceresinin kapasitesi sınırlıdır; çok fazla örnek pencereyi doldurarak hem maliyeti artırır hem de performansı düşürebilir. Son konumlanan örnekler recency bias nedeniyle daha fazla etki yaratır. Brown ve arkadaşlarının GPT-3 makalesi (2020), few-shot ICL'nin ölçek büyüdükçe dramatik biçimde iyileştiğini ortaya koymuş ve "ölçek yasası"nı destekleyen kanıtlar sunmuştur. Günümüzde Gemini 1.5 Pro gibi milyonlarca token bağlam penceresi sunan modeller "many-shot" öğrenmeyi mümkün kılmakta; bu, fine-tuning'e yakın performans sunarken eğitim maliyetini sıfıra indirmektedir.

arrow_forward