In-Context Learning Nedir?
In-context learning, büyük dil modellerinin ağ ağırlıklarını hiçbir şekilde güncellemeksizin yalnızca prompt içerisindeki girdi-çıktı örneklerinden görevi anlayıp doğru çıktı üretme yetenektir. Gradient hesaplama veya geri yayılım yoktur; model dikkat mekanizmasını bir tür acil hafıza olarak kullanır. Bu yetenek, modeli yeniden eğitmeye gerek kalmadan yüzlerce farklı görevi birkaç örnekle hemen gerçekleştirmeyi mümkün kılar ve prompt mühendisliğinin temel mekanizmasını oluşturur.
Zero-Shot, One-Shot ve Few-Shot
In-context learning üç alt kategoride gözlemlenir. Zero-shot learning, hiç örnek vermeksizin görev tanımını anlayıp çıktı üretmektir. One-shot learning, tek bir örnek ile gerçekleşir. Few-shot learning, genellikle üç ila on örnekle çalışır ve GPT-3 makalesinin sistematik olarak ölçtüğü yetenektir. Bu üç durum aynı dikkat mekanizmasının örnek sayısına göre özel halleridir; hangisinin yeterli olduğu göreve, model büyüklüğüne ve örnek kalitesine bağlıdır.
Mekanizma: Nasıl Çalışır?
In-context learning'in mekanizması hala aktif bir araştırma sorusudur. Bir yorum, dikkat mekanizmasının gizli bir gradient descent gerçekleştirdiğini öne sürer: örneklerdeki kalıpları çıkartan dikkat heads, fonksiyonel olarak gradyan hesaplamaya benzer bir süreç yürütmektedir. Alternatif yorum ise modelin öneğitim sırasında benzer görev formatlarıyla yüzleşmiş olmasını vurgular; in-context örnekler bu eski bilgiyi yeniden etkinleştirir. Her iki açıklama da deneysel kanıtı kapsamlıdır.
Prompt Mühendisliği Bağlantısı
In-context learning, pratik prompt mühendisliğinin doğası gereğidir. Örnek seçimi, sırası, sayısı ve talimat formatı model performansını onlu yüzde kadar etkiler. Chain-of-Thought prompting, akıl yürütme adımlarını açıkça örneklere ekleyerek modelin daha karmaşık görevlerde daha doğru çıktılar üretmesini sağlar. Bu mekanizma anlaşıldıkça, hangi görevlerin in-context learning'le yönetilebileceği hangilerinin fine-tuning veya RAG gerektirdiği daha net hale gelir.
ICL Optimizasyonu İçin Pratik İpuçları
Örnek Seçimi
Rastgele seçim yerine sorguya semantik olarak benzer örnekler seçin; kNN tabanlı örnek arama ICL doğruluğunu 10-20% artırabilir.
Örnek Sırası
Son yerleştirilen örnek en güçlü etkiye sahiptir (recency bias); güçlü positif örnekleri prompt sonuna yerleştirmek çıktı kalitesini artırır.
Format Tutarlılığı
Tüm örneklerin aynı giriş-çıkış formatını izlemesi kritik; format tutarsızlığı performansı önemli ölçüde düşürür.
Örnek Sayısı Optimizasyonu
Daha fazla örnek her zaman daha iyi değil - token maliyeti ve bağlam sınırıyla dengeleme; çoğu görev için 4-8 örnek optimum aralıktadır.
help Sık Sorulan Sorular
- check_circle In-context learning ile fine-tuning arasındaki fark nedir? Fine-tuning ağ ağırlıklarını gerçekten günceller ve sürekli öğrenmeyi temsil eder. In-context learning ağırlıksız, çıkarım sırasında gerçekleşir; daha esnek ama daha az kalıcı öğrenme demektir.
- check_circle Hangi modeller in-context learning'i iyi yapar? Büyük modeller daha iyidir; GPT-4, Claude ve Gemini gibi frontier modeller küçük modellerden belirgin şekilde üst performans gösterir. Model büyüklüğü ile yetenek arasındaki ilişki yaklaşık log-doğrusaldır.
- check_circle Örnek sırası önemli midir? Evet, araştırmalar örnek sırasının performansı onlu yüzde kadar etkileyebildiğini göstermiştir. Optimal sıra veri kümesine ve göreve bağımlıdır.
- check_circle In-context learning'in sınırları nelerdir? Bağlam penceresi sınırı örnek sayısını küçük tutar. Çok adımlı akıl yürütme veya sık güncellenen veri gerektiren görevlerde fine-tuning tipik olarak daha iyi sonuç verir.