Model Sıkıştırma, büyük yapay zeka modellerini performansı koruyarak küçülten ve hızlandıran tekniklerin genel adıdır.

Model sıkıştırma (model compression), derin öğrenme ve makine öğrenimi modellerinin boyutunu, hesaplama maliyetini ve bellek gereksinimlerini azaltmaya yönelik tekniklerin genel adıdır. Milyarlarca parametre içeren büyük yapay zeka modelleri; eğitim sürecinde muazzam donanım kaynakları tüketir ve üretim ortamında yüksek gecikme ile enerji maliyeti yaratır. Sıkıştırma teknikleri, bu ağır modelleri orijinal doğruluk değerlerine yakın tutarken çok daha küçük, hızlı ve verimli hale getirir. Temel model sıkıştırma yöntemleri dört ana başlık altında incelenir. Birincisi budama (pruning): modeldeki önemsiz ağırlıkları veya nöronları tespit edip kaldırarak bağlantılar seyreltilir; yapısal budama (structured pruning) bütün dikkat başlarını veya katmanları çıkarırken yapısal olmayan budama (unstructured pruning) bireysel bağlantıları kaldırır. Bu yöntemle %50-90 oranında parametre azaltımı elde edilebilir. İkincisi niceleme (quantization): 32-bit kayan noktalı ağırlık değerleri 8-bit, 4-bit hatta 2-bit tam sayılara dönüştürülür; bu dönüşüm bellek ayak izini 4-16 kat küçültür ve çıkarım (inference) hızını önemli ölçüde artırır. GPTQ, AWQ ve bitsandbytes bu alanda yaygın kullanılan araçlardır. Üçüncüsü bilgi damıtma (knowledge distillation): büyük bir öğretmen modelin yumuşak olasılık çıktıları küçük bir öğrenci modele aktarılarak kompakt ama güçlü modeller elde edilir; DistilBERT, TinyLLaMA ve Phi ailesi bu yaklaşımın başarılı örnekleridir. Dördüncüsü düşük ranklı ayrıştırma (low-rank factorization): büyük ağırlık matrisleri iki küçük matrisin çarpımına ayrıştırılır; LoRA ve QLoRA bu yaklaşımın modern ve son derece popüler uygulamalarıdır. Pratik ekosistemde GPTQ, AWQ, GGUF ve bitsandbytes gibi araçlar, büyük dil modellerini tüketici sınıfı GPU'larda ve hatta CPU üzerinde çalıştırılabilir hale getirmiştir. llama.cpp projesi, 70 milyar parametreli modellerin sıradan dizüstü bilgisayarlarda çalıştırılmasını mümkün kılmıştır. Model sıkıştırma; akıllı telefon tabanlı konuşma tanıma, gerçek zamanlı nesne algılama, uç cihaz (edge) yapay zekası, kaynak kısıtlı IoT sistemleri ve otonom araç yazılımları gibi kritik alanlarda belirleyici öneme sahiptir. Hesaplama demokrasisi açısından değerlendirildiğinde sıkıştırma teknikleri, güçlü yapay zeka modellerini yalnızca büyük şirketlerin değil bireysel geliştiricilerin ve küçük kuruluşların da kullanabildiği teknolojiler haline getiren en önemli etkenlerden biridir.

Model Sıkıştırma Nedir?

Model sıkıştırma, büyük yapay zeka ve derin öğrenme modellerini daha küçük, hızlı ve verimli hale getiren tekniklerin bütünüdür. GPT-4 gibi büyük dil modelleri yüzlerce milyar parametre barındırabilir; bunların çalıştırılması için veri merkezlerinde pahalı GPU kümeleri gerekir. Model sıkıştırma teknikleri, bu devasa modelleri orijinal doğruluk değerlerine yakın tutarken akıllı telefonlar, IoT cihazları ve edge sistemler gibi kısıtlı ortamlarda çalışabilecek forma sokar.

Sıkıştırma hem çıkarım (inference) maliyetini hem de enerji tüketimini önemli ölçüde düşürür. Son yıllarda açık kaynak topluluğunun geliştirdiği araçlar sayesinde 70 milyar parametreli modeller sıradan dizüstü bilgisayarlarda bile çalışabilmektedir.

Temel Sıkıştırma Teknikleri

  • check_circle Budama (Pruning): Önemsiz ağırlıkları veya nöronları kaldırarak modeli seyreltir. Yapısal budama bütün katmanları çıkarırken yapısal olmayan budama tekil bağlantıları hedefler; %50-90 parametre azaltımı mümkündür.
  • check_circle Niceleme (Quantization): 32-bit kayan noktalı ağırlıkları 8-bit veya 4-bit tam sayılara dönüştürür. Bellek ayak izini 4-16 kat küçültür; GPTQ, AWQ ve bitsandbytes bu alanda yaygın kullanılan araçlardır.
  • check_circle Bilgi Damıtma (Knowledge Distillation): Büyük öğretmen modelin yumuşak olasılık çıktıları küçük öğrenci modele aktarılır. DistilBERT, TinyLLaMA ve Phi ailesi bu yaklaşımın başarılı örnekleridir.
  • check_circle Düşük Ranklı Ayrıştırma (LoRA/QLoRA): Büyük ağırlık matrisleri iki küçük matrisin çarpımına ayrıştırılır. LoRA ve QLoRA bu yaklaşımı ince ayar senaryolarında son derece verimli kılar.

Araçlar ve Ekosistem

  • check_circle GPTQ ve AWQ: LLM'leri 4-bit'e indirgeyen niceleme algoritmaları; doğruluk kaybı minimumda tutulur.
  • check_circle GGUF / llama.cpp: CPU üzerinde büyük dil modeli çalıştırmayı mümkün kılan format ve çalışma zamanı; 70B modeller dizüstü bilgisayarlarda çalışabilir.
  • check_circle bitsandbytes: Hugging Face ekosistemine entegre 8-bit ve 4-bit niceleme kütüphanesi; QLoRA ile birlikte kullanıldığında tek GPU'da büyük model ince ayarını kolaylaştırır.
  • check_circle ONNX Runtime ve TensorRT: Kurumsal üretim ortamlarında model optimizasyonu ve hızlandırılmış çıkarım için kullanılan kütüphaneler; farklı donanım hedefleri için model dönüşümü yapar.

Uygulama Alanları

  • check_circle Edge ve IoT Yapay Zekası: Kısıtlı bellek ve işlemcisi olan cihazlarda gerçek zamanlı nesne algılama, konuşma tanıma ve NLP görevleri yürütülür.
  • check_circle Mobil Uygulamalar: Akıllı telefonlarda çevrimdışı çalışan çeviri, OCR ve sohbet modeli özellikleri sıkıştırılmış modeller aracılığıyla sunulur.
  • check_circle Bulut Maliyet Optimizasyonu: Sıkıştırılmış modeller aynı donanımda daha yüksek istek kapasitesi işler; GPU maliyetleri ve enerji tüketimi düşer.
  • check_circle Otonom Sistemler: Otonom araç ve robot yazılımlarında düşük gecikme zorunluluğu, büyük modellerin yerleşik donanıma uyarlanmasını gerektirir.

Model Sıkıştırma Teknikleri Karşılaştırması

Niceleme

Ağırlık ve aktivasyonları düşük hassasiyete indirger; INT8 genellikle %1'den az doğruluk kaybıyla 4× hızlanma verir.

Budama

Önemsiz bağlantıları keser; yapısal budama donanım hızlanması için daha uygun.

Bilgi Damıtma

Büyük modelden küçüğe bilgi aktarımı; sıkıştırma yöntemleri içinde en yüksek kaliteyi korur.

Düşük Rank Ayrışımı

Ağırlık matrislerini düşük rankli çarpanlara böler; matris çarpımı hızlanır.

Sıkça Sorulan Sorular

  • check_circle Model sıkıştırma doğruluk kaybına yol açar mı? Yöntem ve agresifliğe bağlı olarak küçük doğruluk düşüşleri görülebilir. Modern 4-bit niceleme teknikleri çoğu görevde %1'in altında kayıpla çalışmaktadır.
  • check_circle LoRA model sıkıştırması mıdır? LoRA teknik olarak bir ince ayar (fine-tuning) yöntemidir; ancak düşük ranklı ayrıştırma prensibine dayandığından sıkıştırma teknikleriyle yakından ilişkilidir.
  • check_circle Niceleme ve budama farkı nedir? Niceleme ağırlıkların bit hassasiyetini düşürür (float32'den int4'e), veri tipi değişir. Budama ise ağırlıkları sıfırlar veya tamamen kaldırır; model daha seyrek (sparse) hale gelir.
  • check_circle Hangi sıkıştırma yöntemi seçilmeli? Hız ve minimum mühendislik için niceleme (GPTQ/AWQ); en küçük model boyutu için budama+niceleme kombinasyonu; yeni küçük model üretmek için bilgi damıtma; ince ayar senaryoları için LoRA/QLoRA tercih edilir.