In-Context Learning (Bağlam İçi Öğrenme)

Büyük dil modellerinin ağ ağırlıklarını güncellemeksizin, prompt içerisine yerleştirilen örneklerden görevi çıkarıp doğru çıktı üretme yeteneği.

In-context learning (bağlam içerisinde öğrenme), büyük dil modellerinin ağ ağırlıklarını hiçbir şekilde güncellemeksizin, yalnızca prompt içerisine yerleştirilen girdi-çıktı örneklerinden görevi anlayıp yeni bir girdi için doğru çıktı üretme yetenektir. Geleneksel makine öğrenmesinden kökten farklı bu yetenekte gradient hesaplama, geri yayılım veya ağırlık güncelleme yoktur; model, dikkat mekanizması aracılığıyla prompt'taki örnekleri bir tür acil hafıza gibi kullanır. In-context learning üç alt kategoride incelenir. Zero-shot learning, hiç örnek verilmeden yalnızca görev tanımı veya talimatla çalışır. One-shot learning, tek bir girdi-çıktı örneği ile görevi anlama girişimidir. Few-shot learning ise genellikle üç ila on arasında örnek kullanır ve GPT-3 makalesinin odaklandığı asıl yaklaşımdır. Bu üç durum aslında aynı mekanizmanın örnek sayısına göre özel halleridir. 2020 yılında yayınlanan GPT-3 makalesi, in-context learning'i yapay zeka araştırmasının odak noktalarından birine dönüştürdü. Makale, 175 milyar parametreli GPT-3'ün onlarca görevi örnek görmeksizin veya yalnızca birkaç örnekle gerçekleştirebildiğini sistematik olarak göstermiş; bu sonuç dil modellerinin yetenekleri konusundaki beklentileri kökten değiştirmiştir. Mekanizma sorusu hala tartışmalıdır. Bir yaklaşım, in-context learning'in gizli bir gradient descent gerçekleştirdiğini öne sürer: dikkat mekanizması, örneklerden üstkalık doğrusallık gibi temel kalıpları çıkartmak için fonksiyonel olarak gradyan hesaplamaya benzeyen bir süreç yürütmektedir. Alternatif yorum ise modelin eğitim sırasında on milyarlarca belgede gördüğünden benzer görevlerin farklı biçimlerini öğrenip bunları prompt'taki sinyal üzerine yeniden etkinleştirdiğini öne sürer. Uygulamada in-context learning prompt mühendisliği ile doğrudan bağlantılıdır. Hangi örneklerin seçildiğini, örneklerin sırası, örnek sayısı ve talimatın formatı model performansını onlu ölçekte etkiler. Chain-of-Thought prompting gibi teknikler, bu mekanizma üzerine akıl yürütme adımlarını yerleştirir. **Sık Sorulan Sorular** **In-context learning ile fine-tuning arasındaki fark nedir?** Fine-tuning ağ ağırlıklarını gerçekten günceller ve sürekli öğrenmeyi temsil eder. In-context learning ağırlıksız, çıkarım sırasında gerçekleşir; daha esnek ama daha az kalıcı öğrenme demektir. **Hangi modeller in-context learning'i iyi yapar?** Genel olarak büyük modeller daha iyidir; GPT-4, Claude ve Gemini gibi frontier modeller küçük modellerden belirgin şekilde üst performans gösterir. Model büyüklüğü ile in-context yetenek arasındaki ilişki yaklaşık log-doğrusaldır. **Örnek sırası önemli midir?** Evet, araştırmalar örnek sırasının performansı onlu yüzde kadar etkileyebildiğini göstermiştir. Optimal sıra veri kümesine ve göreve bağımlıdır; genel kural yoktur. **In-context learning'in sınırları nelerdir?** Bağlam penceresi sınırı, örnek sayısını küçük tutar. Çok adımlı akıl yürütme gerektiren veya sık güncellenen veri gerektiren görevlerde fine-tuning tipik olarak daha iyi sonuç verir.

In-Context Learning Nedir?

In-context learning, büyük dil modellerinin ağ ağırlıklarını hiçbir şekilde güncellemeksizin yalnızca prompt içerisindeki girdi-çıktı örneklerinden görevi anlayıp doğru çıktı üretme yetenektir. Gradient hesaplama veya geri yayılım yoktur; model dikkat mekanizmasını bir tür acil hafıza olarak kullanır. Bu yetenek, modeli yeniden eğitmeye gerek kalmadan yüzlerce farklı görevi birkaç örnekle hemen gerçekleştirmeyi mümkün kılar ve prompt mühendisliğinin temel mekanizmasını oluşturur.

Zero-Shot, One-Shot ve Few-Shot

In-context learning üç alt kategoride gözlemlenir. Zero-shot learning, hiç örnek vermeksizin görev tanımını anlayıp çıktı üretmektir. One-shot learning, tek bir örnek ile gerçekleşir. Few-shot learning, genellikle üç ila on örnekle çalışır ve GPT-3 makalesinin sistematik olarak ölçtüğü yetenektir. Bu üç durum aynı dikkat mekanizmasının örnek sayısına göre özel halleridir; hangisinin yeterli olduğu göreve, model büyüklüğüne ve örnek kalitesine bağlıdır.

Mekanizma: Nasıl Çalışır?

In-context learning'in mekanizması hala aktif bir araştırma sorusudur. Bir yorum, dikkat mekanizmasının gizli bir gradient descent gerçekleştirdiğini öne sürer: örneklerdeki kalıpları çıkartan dikkat heads, fonksiyonel olarak gradyan hesaplamaya benzer bir süreç yürütmektedir. Alternatif yorum ise modelin öneğitim sırasında benzer görev formatlarıyla yüzleşmiş olmasını vurgular; in-context örnekler bu eski bilgiyi yeniden etkinleştirir. Her iki açıklama da deneysel kanıtı kapsamlıdır.

Prompt Mühendisliği Bağlantısı

In-context learning, pratik prompt mühendisliğinin doğası gereğidir. Örnek seçimi, sırası, sayısı ve talimat formatı model performansını onlu yüzde kadar etkiler. Chain-of-Thought prompting, akıl yürütme adımlarını açıkça örneklere ekleyerek modelin daha karmaşık görevlerde daha doğru çıktılar üretmesini sağlar. Bu mekanizma anlaşıldıkça, hangi görevlerin in-context learning'le yönetilebileceği hangilerinin fine-tuning veya RAG gerektirdiği daha net hale gelir.

ICL Optimizasyonu İçin Pratik İpuçları

Örnek Seçimi

Rastgele seçim yerine sorguya semantik olarak benzer örnekler seçin; kNN tabanlı örnek arama ICL doğruluğunu 10-20% artırabilir.

Örnek Sırası

Son yerleştirilen örnek en güçlü etkiye sahiptir (recency bias); güçlü positif örnekleri prompt sonuna yerleştirmek çıktı kalitesini artırır.

Format Tutarlılığı

Tüm örneklerin aynı giriş-çıkış formatını izlemesi kritik; format tutarsızlığı performansı önemli ölçüde düşürür.

Örnek Sayısı Optimizasyonu

Daha fazla örnek her zaman daha iyi değil - token maliyeti ve bağlam sınırıyla dengeleme; çoğu görev için 4-8 örnek optimum aralıktadır.

help Sık Sorulan Sorular

  • check_circle In-context learning ile fine-tuning arasındaki fark nedir? Fine-tuning ağ ağırlıklarını gerçekten günceller ve sürekli öğrenmeyi temsil eder. In-context learning ağırlıksız, çıkarım sırasında gerçekleşir; daha esnek ama daha az kalıcı öğrenme demektir.
  • check_circle Hangi modeller in-context learning'i iyi yapar? Büyük modeller daha iyidir; GPT-4, Claude ve Gemini gibi frontier modeller küçük modellerden belirgin şekilde üst performans gösterir. Model büyüklüğü ile yetenek arasındaki ilişki yaklaşık log-doğrusaldır.
  • check_circle Örnek sırası önemli midir? Evet, araştırmalar örnek sırasının performansı onlu yüzde kadar etkileyebildiğini göstermiştir. Optimal sıra veri kümesine ve göreve bağımlıdır.
  • check_circle In-context learning'in sınırları nelerdir? Bağlam penceresi sınırı örnek sayısını küçük tutar. Çok adımlı akıl yürütme veya sık güncellenen veri gerektiren görevlerde fine-tuning tipik olarak daha iyi sonuç verir.