tag SentetikVeri

Model Collapse (Model Çöküşü)

Bu sayfada SentetikVeri (Model Collapse (Model Çöküşü)) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

Model Çöküşü (Model Collapse), büyük dil modellerinin (LLM) kendi ürettikleri sentetik içeriklerle döngüsel biçimde yeniden eğitildiğinde aşamalı olarak kalite kaybettiği, çeşitlilik yitirdiği ve halüsinasyon üretimini artırdığı süreçtir. Kavram, 2023 yılında Shumailov ve arkadaşlarının yayımladığı 'The Curse of Recursion: Training on Generated Data Makes Models Forget' başlıklı makaleyle teorik ve deneysel zemine oturtuldu. Model çöküşünün temel işleyişi üç bileşik mekanizmayı kapsar. İlk olarak kuyruk verisi kaybı yaşanır: İnsan yazısının doğal çeşitliliğini oluşturan nadir ifadeler, azınlık dilleri, sıradışı fikirler ve ince mizah unsurları olan 'uzun kuyruk', model eğitimi sırasında ortalama ağırlığın gerisinde kalır. Model çıktıları bu nadir unsurları ihmal eder ve bu çıktılarla eğitilen bir sonraki nesil modeli nadir bilgiden daha da uzaklaşır. İkinci olarak dağılım daralması gözlemlenir: Her eğitim nesliyle birlikte veri dağılımının varyansı azalır; model giderek daha tekdüze, öngörülebilir yanıtlar üretir. Bu, bir fotoğrafın fotokopisinin fotokopisi gibi her aktarımda ince detayları kaybeden bir bozulma sürecine benzer. Üçüncü bileşen ise hata birikimi: Küçük olgusal yanlışlıklar veya hayali bilgi parçaları, model çıktısında kalıcı yer edinerek bir sonraki eğitim yinelemesinde 'gerçek' veri gibi muamele görür ve böylece giderek büyüyerek modelin dünya anlayışını aşındırır. Pratik boyutuyla, yeterli önlem alınmadan yürütülen sentetik döngü eğitimleri modellerin Türkçe gibi kaynak bakımından zayıf dillerde hızla bozulmasına, olgusal güvenilirliğin gerilemesine ve yalnızca alışıldık kalıpları tekrarlayan monoton çıktılara yol açabilir. Araştırmacılar bu riski azaltmak için birkaç temel strateji önerir: Orijinal insan verisi eğitim karışımında belirli bir pay korunmalı; sentetik içerik kriptografik filigran ya da C2PA standardıyla işaretlenerek kaynağı izlenebilir hale getirilmeli; her eğitim döngüsünde veri çeşitlilik metrikleri ölçülmeli; gerçek insan yazısından oluşan referans korpuslar uzun vadeli arşivlerde saklanmalıdır. Phi-4 ve benzeri modellerin dikkatli kurgulanmış sentetik veri karışımıyla iyi sonuçlar elde etmesi, tam sentetik döngüden değil, denetimli sentetik veri kullanımından kaynaklanır.

broken_image

Model Collapse (Model Çöküşü)

Model Çöküşü (Model Collapse), büyük dil modellerinin (LLM) kendi ürettikleri sentetik içeriklerle döngüsel biçimde yeniden eğitildiğinde aşamalı olarak kalite kaybettiği, çeşitlilik yitirdiği ve halüsinasyon üretimini artırdığı süreçtir. Kavram, 2023 yılında Shumailov ve arkadaşlarının yayımladığı 'The Curse of Recursion: Training on Generated Data Makes Models Forget' başlıklı makaleyle teorik ve deneysel zemine oturtuldu. Model çöküşünün temel işleyişi üç bileşik mekanizmayı kapsar. İlk olarak kuyruk verisi kaybı yaşanır: İnsan yazısının doğal çeşitliliğini oluşturan nadir ifadeler, azınlık dilleri, sıradışı fikirler ve ince mizah unsurları olan 'uzun kuyruk', model eğitimi sırasında ortalama ağırlığın gerisinde kalır. Model çıktıları bu nadir unsurları ihmal eder ve bu çıktılarla eğitilen bir sonraki nesil modeli nadir bilgiden daha da uzaklaşır. İkinci olarak dağılım daralması gözlemlenir: Her eğitim nesliyle birlikte veri dağılımının varyansı azalır; model giderek daha tekdüze, öngörülebilir yanıtlar üretir. Bu, bir fotoğrafın fotokopisinin fotokopisi gibi her aktarımda ince detayları kaybeden bir bozulma sürecine benzer. Üçüncü bileşen ise hata birikimi: Küçük olgusal yanlışlıklar veya hayali bilgi parçaları, model çıktısında kalıcı yer edinerek bir sonraki eğitim yinelemesinde 'gerçek' veri gibi muamele görür ve böylece giderek büyüyerek modelin dünya anlayışını aşındırır. Pratik boyutuyla, yeterli önlem alınmadan yürütülen sentetik döngü eğitimleri modellerin Türkçe gibi kaynak bakımından zayıf dillerde hızla bozulmasına, olgusal güvenilirliğin gerilemesine ve yalnızca alışıldık kalıpları tekrarlayan monoton çıktılara yol açabilir. Araştırmacılar bu riski azaltmak için birkaç temel strateji önerir: Orijinal insan verisi eğitim karışımında belirli bir pay korunmalı; sentetik içerik kriptografik filigran ya da C2PA standardıyla işaretlenerek kaynağı izlenebilir hale getirilmeli; her eğitim döngüsünde veri çeşitlilik metrikleri ölçülmeli; gerçek insan yazısından oluşan referans korpuslar uzun vadeli arşivlerde saklanmalıdır. Phi-4 ve benzeri modellerin dikkatli kurgulanmış sentetik veri karışımıyla iyi sonuçlar elde etmesi, tam sentetik döngüden değil, denetimli sentetik veri kullanımından kaynaklanır.

arrow_forward
looks_4

Phi-4 (Phi-4)

Phi-4, Microsoft Research tarafından Aralık 2024'te yayımlanan 14 milyar parametreli bir küçük dil modelidir (SLM). Phi serisinin dördüncü üyesi olan bu model, "veri kalitesi veri miktarından önemlidir" ilkesini en somut biçimde kanıtlayan yapay zeka çalışmalarından biri hâline gelmiştir. Eğitim sürecinde ham internet verisi yerine büyük modeller (GPT-4) aracılığıyla sentetik olarak üretilmiş yüksek kaliteli matematik problemleri, akıl yürütme örnekleri ve kod veri setleri kullanılmıştır. Dikkatle seçilmiş ders kitabı içerikleri ve akademik metinler de eğitim kümesini güçlendirmiştir. Bu veri felsefesi, Phi-1'den başlayan trendin mantıksal devamıdır ve LIMA makalesinin "az ama öz" hipotezini milyarlarca parametre ölçeğine taşımaktadır. Kıyaslama performansı açısından Phi-4, doktora düzeyi bilim sorularını içeren GPQA Diamond testinde ve AMC/MATH rekabetçi matematik kıyaslamalarında 70 milyar parametreli pek çok modeli geride bırakmıştır. HumanEval ve MBPP kodlama kıyaslamalarında da parametre sayısıyla orantısız bir yetenek sergilemiştir. Model, 16.384 tokenlik bağlam penceresiyle çalışır. MIT lisansı altında HuggingFace'de yayımlanmıştır; hem araştırma hem de ticari kullanıma tamamen açıktır. 8 GB VRAM ile tam hassasiyette çalışırken GGUF/Q4 kuantize versiyonları çok daha mütevazı donanımlarda da çalışabilir. Ollama ve LM Studio gibi popüler araçlarla birkaç komutla kurulabilir. Microsoft, 2025 yılında Phi-4 ekosistemi üzerine yeni üyeler eklemiştir: 3,8 milyar parametreli Phi-4-Mini (mobil ve kenar cihazlar için), akıl yürütmeye odaklanan Phi-4-Reasoning ve çok modlu giriş desteği için Phi-4-Vision. Bu varyantlar, küçük model felsefesinin farklı donanım ve kullanım senaryolarına genişlediğini göstermektedir. Phi-4 özellikle eğitim ve öğretim uygulamaları, adım adım matematik yardımcısı, yerel kodlama asistanı ve kaynak kısıtlı bulut dağıtımı senaryolarında güçlü maliyet-performans dengesi sunan SLM modelleri arasında öne çıkmaktadır. Tüketici sınıfı GPU'ları hedefleyen bu model, API maliyeti olmaksızın güçlü yerel AI çözümleri geliştirmek isteyen geliştiriciler için ideal bir başlangıç noktasıdır.

arrow_forward