tag model-optimizasyonu

Bu sayfada model-optimizasyonu etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

Model kuantizasyonu (Model Quantization), büyük yapay zeka modellerinin ağırlık ve aktivasyon değerlerini yüksek hassasiyetli kayan noktalı sayılardan (FP32, FP16) daha düşük bitli tam sayı gösterimlerine (INT8, INT4, hatta INT2) dönüştüren bir model sıkıştırma tekniğidir. Bu dönüşüm, modelin bellek ayak izini küçültür, çıkarım hızını artırır ve daha az enerji tüketerek Edge cihazlarda veya tüketici donanımlarında büyük dil modellerinin çalıştırılmasını mümkün kılar. Temel fikir şudur: bir FP32 değer 4 bayt kaplarken INT8 yalnızca 1 bayt, INT4 ise yarım bayt kullanır. 7 milyar parametreli bir LLM FP16 olarak yaklaşık 14 GB VRAM gerektirirken, INT4 kuantizasyonuyla bu ihtiyaç ~4 GB'a düşer ve sıradan bir tüketici GPU'sunda çalışır hale gelir. Başlıca kuantizasyon yaklaşımları şunlardır: **Eğitim Sonrası Kuantizasyon (PTQ — Post-Training Quantization)**, eğitilmiş modeli yeniden eğitmeden doğrudan dönüştürür; GPTQ, AWQ ve llama.cpp bu yöntemi kullanır. **Kuantizasyon Farkındalıklı Eğitim (QAT — Quantization-Aware Training)** ise eğitim sırasında kuantizasyon hatasını simüle ederek daha yüksek doğruluk sunar ancak ek hesaplama maliyeti gerektirir. Bunlara ek olarak **GGUF/GGML formatları** (llama.cpp ekosistemi), **bitsandbytes** (Hugging Face entegrasyonu) ve **ONNX Runtime** kuantize modelleri verimli çalıştıran araçlardır. Kuantizasyonun temel ödünleşimi doğruluk ile verimlilik arasındadır. INT8 genellikle FP32'ye kıyasla %1'in altında doğruluk kaybıyla son derece iyi çalışır. INT4 daha yüksek kayıp gösterebilir; ancak GPTQ ve AWQ gibi kalibrasyonlu yöntemler bu kaybı perplexity açısından ihmal edilebilir düzeyde tutar. Model boyutu ve görev karmaşıklığı arttıkça kuantizasyona dayanıklılık artma eğiliminde olduğu için büyük LLM'ler küçük modellere göre daha az bozunumla kuantize edilir. Pratik kullanımda Ollama, LM Studio ve Jan gibi yerel LLM araçları modellerini GGUF formatında INT4/INT8 kuantize olarak sunar. Hugging Face Hub'da TheBloke gibi topluluk hesapları yaygın modelleri GGUF ve AWQ kuantizasyonlarıyla yayımlar. 2024-2026 döneminde Microsoft'un BitNet gibi deneysel mimarileri 1-bit kuantizasyonu araştırırken, Apple Silicon'ın ANE birimi INT4 çıkarımını CPU/GPU hibrit olarak verimli gerçekleştirir.

code_blocks

Model Quantization (Model Kuantizasyonu — Ağırlık Hassasiyet Azaltma)

Model kuantizasyonu (Model Quantization), büyük yapay zeka modellerinin ağırlık ve aktivasyon değerlerini yüksek hassasiyetli kayan noktalı sayılardan (FP32, FP16) daha düşük bitli tam sayı gösterimlerine (INT8, INT4, hatta INT2) dönüştüren bir model sıkıştırma tekniğidir. Bu dönüşüm, modelin bellek ayak izini küçültür, çıkarım hızını artırır ve daha az enerji tüketerek Edge cihazlarda veya tüketici donanımlarında büyük dil modellerinin çalıştırılmasını mümkün kılar. Temel fikir şudur: bir FP32 değer 4 bayt kaplarken INT8 yalnızca 1 bayt, INT4 ise yarım bayt kullanır. 7 milyar parametreli bir LLM FP16 olarak yaklaşık 14 GB VRAM gerektirirken, INT4 kuantizasyonuyla bu ihtiyaç ~4 GB'a düşer ve sıradan bir tüketici GPU'sunda çalışır hale gelir. Başlıca kuantizasyon yaklaşımları şunlardır: **Eğitim Sonrası Kuantizasyon (PTQ — Post-Training Quantization)**, eğitilmiş modeli yeniden eğitmeden doğrudan dönüştürür; GPTQ, AWQ ve llama.cpp bu yöntemi kullanır. **Kuantizasyon Farkındalıklı Eğitim (QAT — Quantization-Aware Training)** ise eğitim sırasında kuantizasyon hatasını simüle ederek daha yüksek doğruluk sunar ancak ek hesaplama maliyeti gerektirir. Bunlara ek olarak **GGUF/GGML formatları** (llama.cpp ekosistemi), **bitsandbytes** (Hugging Face entegrasyonu) ve **ONNX Runtime** kuantize modelleri verimli çalıştıran araçlardır. Kuantizasyonun temel ödünleşimi doğruluk ile verimlilik arasındadır. INT8 genellikle FP32'ye kıyasla %1'in altında doğruluk kaybıyla son derece iyi çalışır. INT4 daha yüksek kayıp gösterebilir; ancak GPTQ ve AWQ gibi kalibrasyonlu yöntemler bu kaybı perplexity açısından ihmal edilebilir düzeyde tutar. Model boyutu ve görev karmaşıklığı arttıkça kuantizasyona dayanıklılık artma eğiliminde olduğu için büyük LLM'ler küçük modellere göre daha az bozunumla kuantize edilir. Pratik kullanımda Ollama, LM Studio ve Jan gibi yerel LLM araçları modellerini GGUF formatında INT4/INT8 kuantize olarak sunar. Hugging Face Hub'da TheBloke gibi topluluk hesapları yaygın modelleri GGUF ve AWQ kuantizasyonlarıyla yayımlar. 2024-2026 döneminde Microsoft'un BitNet gibi deneysel mimarileri 1-bit kuantizasyonu araştırırken, Apple Silicon'ın ANE birimi INT4 çıkarımını CPU/GPU hibrit olarak verimli gerçekleştirir.

arrow_forward
code_blocks

Pruning (Sinir Ağı Budaması)

Sinir ağı budaması (neural network pruning), büyük ve karmaşık derin öğrenme modellerini daha küçük, hızlı ve verimli hale getirmek amacıyla modeldeki gereksiz ya da önemsiz parametreleri kaldıran bir model sıkıştırma yöntemidir. Bir insan beyninin yeni bağlantılar kurarken kullanılmayan sinaptik bağlantıları budadığı bilinmektedir; benzer bir ilkeden esinlenen bu teknik, yapay sinir ağlarına da uygulanır. Budama, çoğunlukla model eğitiminin ardından gerçekleştirilir; ancak eğitim sırasında veya eğitim öncesinde de uygulanabilen yöntemler araştırılmaktadır. Temel amacı, modelin doğruluk oranını kabul edilebilir düzeyde koruyarak parametre sayısını, bellek kullanımını ve hesaplama maliyetini önemli ölçüde düşürmektir. Budama teknikleri iki ana kategoriye ayrılır. Yapılandırılmamış budama (unstructured pruning), ağırlık matrisindeki bireysel bağlantıları kaldırır; seyrek matris yapısı oluşturur ancak standart donanımda gerçek hız kazanımı için özel kütüphane veya donanım desteği gerektirir. Yapılandırılmış budama (structured pruning) ise tüm filtreler, kanallar veya katmanlar gibi bütüncül yapıları bir bütün olarak siler; standart GPU ve CPU'larda doğrudan çıkarım hızı artışı ve model küçülmesi elde edilir. En yaygın yöntem büyüklük tabanlı budamadır (magnitude-based pruning): mutlak değeri en küçük ağırlıklar, modelin öğrendiği bilgiye katkısı az kabul edilerek kaldırılır. Ardından model, performansını yeniden kazanması için ince ayar (fine-tuning) sürecinden geçirilir. Bu "eğit → buda → ince ayar" döngüsü, hedef boyut ve doğruluk değerlerine ulaşılana kadar birkaç kez tekrarlanabilir. 2018'de Frankle ve Carlin tarafından öne sürülen Piyango Bileti Hipotezi (Lottery Ticket Hypothesis), büyük sinir ağlarının başlangıçtan beri eğitilebilir nitelikte küçük alt ağlar — "kazanan biletler" — barındırdığını ileri sürer. Bu alt ağlar, tam ağın yüzde 10 ile 20'si büyüklüğünde olmasına rağmen benzer doğruluk oranlarına ulaşabilmektedir. Budama; mobil uygulamalar, IoT cihazları ve kenar bilişim (edge computing) gibi hesaplama kapasitesinin sınırlı olduğu ortamlarda dağıtımı kolaylaştırır. Günümüzde budama çoğunlukla niceleme (quantization) ve bilgi damıtma (knowledge distillation) ile bir arada uygulanarak çok daha yüksek sıkıştırma oranlarına ulaşılır.

arrow_forward