tag Alpaca
Instruction Tuning (Komut Ayarı)
Bu sayfada Alpaca (Instruction Tuning (Komut Ayarı)) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.
Instruction Tuning (Komut Ayarı veya Talimat İnce Ayarı), önceden eğitilmiş dil modellerini insan yazılı talimat-yanıt çiftleriyle ince ayar yaparak modelin çeşitli görevleri takip etme becerisini geliştiren bir eğitim yöntemidir. 2021'de Google'ın FLAN modeli ve Stanford'un Alpaca çalışmasıyla popülerleşen bu teknik, bugün neredeyse tüm kullanıcıya dönük LLM'lerin eğitim süreçlerinin temel ve ayrılmaz bir parçasıdır. Instruction tuning'den önce dil modelleri yalnızca sonraki tokeni tahmin etmek üzere eğitilirdi; bu modeller doğrudan kullanıcı talimatlarını takip etmekte yetersiz kalırdı. Instruction tuning, çok sayıda ve çeşitli görevleri kapsayan veri setiyle modeli fine-tune eder: özetleme, soru yanıtlama, çeviri, sınıflandırma, kod yazma. Böylece model yeni, görülmemiş görevleri sıfır-atış (zero-shot) veya az-atış (few-shot) biçiminde takip edebilir hâle gelir. Bu yetenek, bir asistan ile ham bir dil modeli arasındaki en temel farkı oluşturur; eğitim maliyetinin küçük bir kesimiyle büyük kullanılabilirlik artışı sağlar. Kaliteli instruction tuning için veri kalitesi, çeşitliliği ve talimat-yanıt uyumluluğu kritiktir. LIMA çalışması, 1000 yüksek kaliteli örnek bile yeterince çeşitliyse güçlü instruction following sağlayabileceğini göstermiştir. Günümüzde büyük ölçekli modeller için hem insan yazılı hem de LLM ile sentetik olarak üretilmiş instruction veri setleri kullanılmaktadır. WizardLM, ShareGPT ve OpenAssistant gibi açık veri setleri topluluğun bu tekniği demokratikleştirmesine önemli katkılar sunmaktadır. Instruction tuning sonrası RLHF (İnsan Geri Bildiriminden Pekiştirme Öğrenmesi) veya DPO (Doğrudan Tercih Optimizasyonu) ile pekiştirme, modeli daha güvenli ve kullanıcı dostu hâle getirir. Multitask instruction tuning ise modelin tek bir görev yerine onlarca farklı talimat türünü öğrenmesini sağlayarak genel amaçlı asistan yeteneklerini pekiştirir. GPT-4, Claude ve Gemini gibi modern sohbet modellerinin temelinde bu çok katmanlı fine-tuning hattı yatmaktadır.
Instruction Tuning (Komut Ayarı)
Instruction Tuning (Komut Ayarı veya Talimat İnce Ayarı), önceden eğitilmiş dil modellerini insan yazılı talimat-yanıt çiftleriyle ince ayar yaparak modelin çeşitli görevleri takip etme becerisini geliştiren bir eğitim yöntemidir. 2021'de Google'ın FLAN modeli ve Stanford'un Alpaca çalışmasıyla popülerleşen bu teknik, bugün neredeyse tüm kullanıcıya dönük LLM'lerin eğitim süreçlerinin temel ve ayrılmaz bir parçasıdır. Instruction tuning'den önce dil modelleri yalnızca sonraki tokeni tahmin etmek üzere eğitilirdi; bu modeller doğrudan kullanıcı talimatlarını takip etmekte yetersiz kalırdı. Instruction tuning, çok sayıda ve çeşitli görevleri kapsayan veri setiyle modeli fine-tune eder: özetleme, soru yanıtlama, çeviri, sınıflandırma, kod yazma. Böylece model yeni, görülmemiş görevleri sıfır-atış (zero-shot) veya az-atış (few-shot) biçiminde takip edebilir hâle gelir. Bu yetenek, bir asistan ile ham bir dil modeli arasındaki en temel farkı oluşturur; eğitim maliyetinin küçük bir kesimiyle büyük kullanılabilirlik artışı sağlar. Kaliteli instruction tuning için veri kalitesi, çeşitliliği ve talimat-yanıt uyumluluğu kritiktir. LIMA çalışması, 1000 yüksek kaliteli örnek bile yeterince çeşitliyse güçlü instruction following sağlayabileceğini göstermiştir. Günümüzde büyük ölçekli modeller için hem insan yazılı hem de LLM ile sentetik olarak üretilmiş instruction veri setleri kullanılmaktadır. WizardLM, ShareGPT ve OpenAssistant gibi açık veri setleri topluluğun bu tekniği demokratikleştirmesine önemli katkılar sunmaktadır. Instruction tuning sonrası RLHF (İnsan Geri Bildiriminden Pekiştirme Öğrenmesi) veya DPO (Doğrudan Tercih Optimizasyonu) ile pekiştirme, modeli daha güvenli ve kullanıcı dostu hâle getirir. Multitask instruction tuning ise modelin tek bir görev yerine onlarca farklı talimat türünü öğrenmesini sağlayarak genel amaçlı asistan yeteneklerini pekiştirir. GPT-4, Claude ve Gemini gibi modern sohbet modellerinin temelinde bu çok katmanlı fine-tuning hattı yatmaktadır.
SFT (Supervised Fine-Tuning (Denetimli İnce Ayar))
SFT (Supervised Fine-Tuning — Denetimli İnce Ayar), önceden eğitilmiş (pretrained) bir dil modelinin, yüksek kaliteli (istek, yanıt) çiftlerinden oluşan bir veri kümesiyle talimat izleme yeteneği kazandırmak amacıyla ek eğitime tabi tutulması sürecidir. RLHF boru hattının ilk hizalama adımını oluşturur ve GPT-4, Claude, Llama-2-Chat gibi modellerin temelinde yer alır. Ön eğitim (pretraining) sırasında model yalnızca sonraki kelimeyi tahmin etmeyi öğrenir; bu model herhangi bir talimatı takip edemez. SFT aşamasında model, 'Bu metni özetle → Metin: ... → Özet: ...' biçimindeki çiftlerle eğitilir. Standart dil modellemesi kaybı (cross-entropy) kullanılır; ancak yalnızca yanıt tokenleri için kayıp hesaplanır — istek tokenleri maskelenir. Bu maskeleme ile model yanıt üretmeyi öğrenir, isteği yinelemez. SFT veri kümesinin kalitesi, miktarından çok daha kritiktir. InstructGPT'de OpenAI, yalnızca birkaç on bin örneğin yeterli olduğunu göstermiştir. Alpaca projesinde 52.000 GPT-4 üretimi sentetik örnek kullanılmış; bu, insan yazımı veriyle kıyaslanabilir sonuçlar vermiştir. Modern yaklaşımlar büyük LLM'lerle sentetik veri üretimini ve filtrelemesini içerir. SFT araçları açısından Axolotl ve Unsloth, LoRA/QLoRA ile tüketici GPU'larında verimli fine-tuning yapılmasına imkân tanır; Hugging Face TRL kütüphanesi SFTTrainer sınıfı aracılığıyla süreci standartlaştırır. Tek bir RTX 4090 üzerinde 7B modelin LoRA ile SFT eğitimi saatler içinde tamamlanabilir. SFT, DPO veya RLHF öncesinde zorunlu temel adımdır; bazı durumlarda SFT tek başına yeterince iyi chat modelleri üretmektedir. Llama ve Mistral tabanlı topluluk modellerinin büyük çoğunluğu yalnızca SFT ile oluşturulmaktadır. Chat GPT'nin ilk sürümleri dahil birçok öncü model, SFT'nin şaşırtıcı derecede güçlü bir hizalama tekniği olduğunu kanıtlamıştır. Verinin çeşitliliği — kodlama, çeviri, özetleme, soru-cevap, çok adımlı akıl yürütme — modelin genel talimat izleme kapasitesini genişletir. Tek alan veriyle SFT, modelin diğer alanlardaki performansını düşürebilir (catastrophic forgetting); bu nedenle genel amaçlı fine-tuning'de veri çeşitliliği vazgeçilmezdir.