tag ModelSıkıştırma
Bu sayfada ModelSıkıştırma etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.
Model sıkıştırma (model compression), derin öğrenme ve makine öğrenimi modellerinin boyutunu, hesaplama maliyetini ve bellek gereksinimlerini azaltmaya yönelik tekniklerin genel adıdır. Milyarlarca parametre içeren büyük yapay zeka modelleri; eğitim sürecinde muazzam donanım kaynakları tüketir ve üretim ortamında yüksek gecikme ile enerji maliyeti yaratır. Sıkıştırma teknikleri, bu ağır modelleri orijinal doğruluk değerlerine yakın tutarken çok daha küçük, hızlı ve verimli hale getirir. Temel model sıkıştırma yöntemleri dört ana başlık altında incelenir. Birincisi budama (pruning): modeldeki önemsiz ağırlıkları veya nöronları tespit edip kaldırarak bağlantılar seyreltilir; yapısal budama (structured pruning) bütün dikkat başlarını veya katmanları çıkarırken yapısal olmayan budama (unstructured pruning) bireysel bağlantıları kaldırır. Bu yöntemle %50-90 oranında parametre azaltımı elde edilebilir. İkincisi niceleme (quantization): 32-bit kayan noktalı ağırlık değerleri 8-bit, 4-bit hatta 2-bit tam sayılara dönüştürülür; bu dönüşüm bellek ayak izini 4-16 kat küçültür ve çıkarım (inference) hızını önemli ölçüde artırır. GPTQ, AWQ ve bitsandbytes bu alanda yaygın kullanılan araçlardır. Üçüncüsü bilgi damıtma (knowledge distillation): büyük bir öğretmen modelin yumuşak olasılık çıktıları küçük bir öğrenci modele aktarılarak kompakt ama güçlü modeller elde edilir; DistilBERT, TinyLLaMA ve Phi ailesi bu yaklaşımın başarılı örnekleridir. Dördüncüsü düşük ranklı ayrıştırma (low-rank factorization): büyük ağırlık matrisleri iki küçük matrisin çarpımına ayrıştırılır; LoRA ve QLoRA bu yaklaşımın modern ve son derece popüler uygulamalarıdır. Pratik ekosistemde GPTQ, AWQ, GGUF ve bitsandbytes gibi araçlar, büyük dil modellerini tüketici sınıfı GPU'larda ve hatta CPU üzerinde çalıştırılabilir hale getirmiştir. llama.cpp projesi, 70 milyar parametreli modellerin sıradan dizüstü bilgisayarlarda çalıştırılmasını mümkün kılmıştır. Model sıkıştırma; akıllı telefon tabanlı konuşma tanıma, gerçek zamanlı nesne algılama, uç cihaz (edge) yapay zekası, kaynak kısıtlı IoT sistemleri ve otonom araç yazılımları gibi kritik alanlarda belirleyici öneme sahiptir. Hesaplama demokrasisi açısından değerlendirildiğinde sıkıştırma teknikleri, güçlü yapay zeka modellerini yalnızca büyük şirketlerin değil bireysel geliştiricilerin ve küçük kuruluşların da kullanabildiği teknolojiler haline getiren en önemli etkenlerden biridir.
Knowledge Distillation (Bilgi Damıtma)
Knowledge Distillation (Bilgi Damıtma), büyük ve güçlü bir öğretmen modelin bilgisini daha küçük ve verimli bir öğrenci modele aktarma sürecidir. Öğrenci model, doğrudan ham etiketlerden değil; öğretmenin yumuşak olasılık çıktılarından (soft labels) öğrenerek eğitim veri kümesindeki sinyallerin ötesine geçen genelleme yeteneği kazanır. Tekniğin temeli 2015 yılında Geoffrey Hinton, Oriol Vinyals ve Jeff Dean'in yayımladığı "Distilling the Knowledge in a Neural Network" başlıklı makaledir. Hinton, öğretmenin softmax çıktılarının ham etiketlere kıyasla çok daha zengin bir öğrenme sinyali taşıdığını ortaya koydu: bir görüntü sınıflandırıcısının "kedi" olasılığı %90 iken "köpek" olasılığının %7 olması, modelin sınıflar arasındaki benzerlik yapısını kodladığını gösterir ve öğrenci bu yapıyı devralır. Teknik açıdan distilasyon iki kayıp teriminin ağırlıklı toplamını minimize eder: öğrencinin öğretmen çıktılarına ne kadar yaklaştığını ölçen KL Divergence tabanlı distilasyon kaybı ve standart çapraz entropi kaybı. Sıcaklık (temperature) parametresi softmax dağılımını yumuşatarak sınıflar arası ilişkileri belirginleştirir; tipik değerler 2-5 arasındadır. Pratik uygulamalarda distilasyon, üretim ortamları için belirleyici bir teknik haline gelmiştir. DistilBERT orijinal BERT modelinin %97 performansını %40 daha küçük ve %60 daha hızlı biçimde yeniden üretir. TinyBERT hem öğretmen çıktısından hem de ara katman temsil bilgisinden öğrenir; MobileBERT ise mobil cihaz kısıtları gözetilerek tasarlanmıştır. Distilasyon çeşitleri arasında self-distillation (modelin kendisinden öğrenmesi), multi-teacher distillation (birden fazla öğretmenden bilgi sentezi) ve cross-modal distillation (görüntü modelinin bilgisinin metin modeline aktarılması) sayılabilir. LLM çağında bu teknik, 70B+ büyük modellerin bilgisini 7B veya daha küçük görev-odaklı modellere aktarmak için kritik bir role bürünmüştür. Açık ağırlıklı büyük modeller öğretmen, küçük görev-odaklı modeller öğrenci rolü üstlenir; bu yaklaşım model sıkıştırma, budama (pruning) ve kuantizasyon ile birlikte kullanılarak donanım sınırlı ortamlarda yüksek performans elde etmeye olanak tanır. 2024-2026 döneminde bilgi damıtma, küçük dil modeli (SLM) ekosisteminin merkezine oturdu. Microsoft'un Phi-3-mini'si (3.8 milyar parametre, 2024), GPT-3.5 düzeyinde performansı mobil cihazlara taşıyan ve distilasyon temelli bir veri akışıyla geliştirilen önemli bir açık kaynak modeldir. DeepSeek-R1'in Ocak 2025'te yayımlanan damıtma varyantları, 32 milyar parametreli öğrenci modelin matematik akıl yürütmede OpenAI o1-mini'yi geride bırakmasına zemin hazırladı. Bu süreçte bilgi damıtma, kuantizasyon ve budama teknikleriyle birleştirilerek çıkarım gecikmesi ile bellek tüketimi düşürülmekte; hafif modeller akıllı telefonlar ve gömülü sistemlerde çevrimdışı çalışabilir hale gelmektedir.
Model Sıkıştırma (Model Sıkıştırma)
Model sıkıştırma (model compression), derin öğrenme ve makine öğrenimi modellerinin boyutunu, hesaplama maliyetini ve bellek gereksinimlerini azaltmaya yönelik tekniklerin genel adıdır. Milyarlarca parametre içeren büyük yapay zeka modelleri; eğitim sürecinde muazzam donanım kaynakları tüketir ve üretim ortamında yüksek gecikme ile enerji maliyeti yaratır. Sıkıştırma teknikleri, bu ağır modelleri orijinal doğruluk değerlerine yakın tutarken çok daha küçük, hızlı ve verimli hale getirir. Temel model sıkıştırma yöntemleri dört ana başlık altında incelenir. Birincisi budama (pruning): modeldeki önemsiz ağırlıkları veya nöronları tespit edip kaldırarak bağlantılar seyreltilir; yapısal budama (structured pruning) bütün dikkat başlarını veya katmanları çıkarırken yapısal olmayan budama (unstructured pruning) bireysel bağlantıları kaldırır. Bu yöntemle %50-90 oranında parametre azaltımı elde edilebilir. İkincisi niceleme (quantization): 32-bit kayan noktalı ağırlık değerleri 8-bit, 4-bit hatta 2-bit tam sayılara dönüştürülür; bu dönüşüm bellek ayak izini 4-16 kat küçültür ve çıkarım (inference) hızını önemli ölçüde artırır. GPTQ, AWQ ve bitsandbytes bu alanda yaygın kullanılan araçlardır. Üçüncüsü bilgi damıtma (knowledge distillation): büyük bir öğretmen modelin yumuşak olasılık çıktıları küçük bir öğrenci modele aktarılarak kompakt ama güçlü modeller elde edilir; DistilBERT, TinyLLaMA ve Phi ailesi bu yaklaşımın başarılı örnekleridir. Dördüncüsü düşük ranklı ayrıştırma (low-rank factorization): büyük ağırlık matrisleri iki küçük matrisin çarpımına ayrıştırılır; LoRA ve QLoRA bu yaklaşımın modern ve son derece popüler uygulamalarıdır. Pratik ekosistemde GPTQ, AWQ, GGUF ve bitsandbytes gibi araçlar, büyük dil modellerini tüketici sınıfı GPU'larda ve hatta CPU üzerinde çalıştırılabilir hale getirmiştir. llama.cpp projesi, 70 milyar parametreli modellerin sıradan dizüstü bilgisayarlarda çalıştırılmasını mümkün kılmıştır. Model sıkıştırma; akıllı telefon tabanlı konuşma tanıma, gerçek zamanlı nesne algılama, uç cihaz (edge) yapay zekası, kaynak kısıtlı IoT sistemleri ve otonom araç yazılımları gibi kritik alanlarda belirleyici öneme sahiptir. Hesaplama demokrasisi açısından değerlendirildiğinde sıkıştırma teknikleri, güçlü yapay zeka modellerini yalnızca büyük şirketlerin değil bireysel geliştiricilerin ve küçük kuruluşların da kullanabildiği teknolojiler haline getiren en önemli etkenlerden biridir.
Pruning (Sinir Ağı Budaması)
Sinir ağı budaması (neural network pruning), büyük ve karmaşık derin öğrenme modellerini daha küçük, hızlı ve verimli hale getirmek amacıyla modeldeki gereksiz ya da önemsiz parametreleri kaldıran bir model sıkıştırma yöntemidir. Bir insan beyninin yeni bağlantılar kurarken kullanılmayan sinaptik bağlantıları budadığı bilinmektedir; benzer bir ilkeden esinlenen bu teknik, yapay sinir ağlarına da uygulanır. Budama, çoğunlukla model eğitiminin ardından gerçekleştirilir; ancak eğitim sırasında veya eğitim öncesinde de uygulanabilen yöntemler araştırılmaktadır. Temel amacı, modelin doğruluk oranını kabul edilebilir düzeyde koruyarak parametre sayısını, bellek kullanımını ve hesaplama maliyetini önemli ölçüde düşürmektir. Budama teknikleri iki ana kategoriye ayrılır. Yapılandırılmamış budama (unstructured pruning), ağırlık matrisindeki bireysel bağlantıları kaldırır; seyrek matris yapısı oluşturur ancak standart donanımda gerçek hız kazanımı için özel kütüphane veya donanım desteği gerektirir. Yapılandırılmış budama (structured pruning) ise tüm filtreler, kanallar veya katmanlar gibi bütüncül yapıları bir bütün olarak siler; standart GPU ve CPU'larda doğrudan çıkarım hızı artışı ve model küçülmesi elde edilir. En yaygın yöntem büyüklük tabanlı budamadır (magnitude-based pruning): mutlak değeri en küçük ağırlıklar, modelin öğrendiği bilgiye katkısı az kabul edilerek kaldırılır. Ardından model, performansını yeniden kazanması için ince ayar (fine-tuning) sürecinden geçirilir. Bu "eğit → buda → ince ayar" döngüsü, hedef boyut ve doğruluk değerlerine ulaşılana kadar birkaç kez tekrarlanabilir. 2018'de Frankle ve Carlin tarafından öne sürülen Piyango Bileti Hipotezi (Lottery Ticket Hypothesis), büyük sinir ağlarının başlangıçtan beri eğitilebilir nitelikte küçük alt ağlar — "kazanan biletler" — barındırdığını ileri sürer. Bu alt ağlar, tam ağın yüzde 10 ile 20'si büyüklüğünde olmasına rağmen benzer doğruluk oranlarına ulaşabilmektedir. Budama; mobil uygulamalar, IoT cihazları ve kenar bilişim (edge computing) gibi hesaplama kapasitesinin sınırlı olduğu ortamlarda dağıtımı kolaylaştırır. Günümüzde budama çoğunlukla niceleme (quantization) ve bilgi damıtma (knowledge distillation) ile bir arada uygulanarak çok daha yüksek sıkıştırma oranlarına ulaşılır.