QLoRA Nedir? Nicel LoRA ile Verimli Büyük Dil Modeli İnce Ayarı (QLoRA (Nicel Düşük Sıralı Uyarlama))

QLoRA, büyük dil modellerini 4-bit kuantize ederek LoRA adaptörleriyle tüketici GPU'larında verimli biçimde ince ayarlamayı mümkün kılan parametre-etkin bir öğrenme tekniğidir.

QLoRA (Quantized Low-Rank Adaptation), büyük dil modellerini sınırlı GPU belleğiyle ince ayarlamayı mümkün kılan bir parametre-etkin öğrenme tekniğidir. Tim Dettmers ve ekibi tarafından 2023 NeurIPS konferansında sunulan bu yöntem, modeli 4-bit kuantize ederek dondurur; ardından üzerine küçük LoRA adaptörleri eğitir. Temel model ağırlıkları hiçbir zaman güncellenmez — gradyanlar yalnızca adaptörlerden geçer. Tekniğin üç temel yeniliği şöyle açıklanabilir: **4-bit NormalFloat (NF4):** Sinir ağı ağırlıkları çoğunlukla sıfır merkezli normal dağılım gösterir. NF4, bu dağılıma göre tasarlanmış bilgi teorisi açısından optimal bir kuantizasyon veri tipidir. Standart INT4'ün yaklaşık bir puan üzerinde MMLU doğruluğu elde eder. **Çift Kuantizasyon:** İlk kuantizasyon adımında üretilen sabitlerin kendisi de ikinci kez kuantize edilir. Bu ekstra adım parametre başına ortalama 0,37 bit tasarruf yaratır ve 65 milyar parametreli bir modelde yaklaşık 3 GB ek bellek kazandırır. **Sayfalı Optimize Ediciler:** NVIDIA'nın birleşik bellek altyapısını kullanan bu mekanizma, GPU belleği dolduğunda optimizasyon durumlarını CPU RAM'ine aktarır; böylece uzun dizilerde yaşanan bellek taşması hatalarını önler. Bellek tasarrufu dramatiktir: 65 milyar parametreli bir modelin tam ince ayarı için yaklaşık 1 TB GPU belleği gerekirken QLoRA bunu tek bir 48 GB'lık GPU'ya sığdırır. 7B-8B parametreli modeller ise 10 GB'ın altında VRAM ile, yani RTX 3090 veya RTX 4090 gibi tüketici kartlarıyla eğitilebilir hale gelir. Çalışma zamanında 4-bit ağırlıklar geçici olarak BF16 formatına dönüştürülür, hesaplama yapılır ve atar; yani kalıcı olarak yüksek hassasiyetle saklanmaz. Bu tasarım kararı belleği minimize ederken kaliteyi korur. QLoRA, LLaMA, Mistral, Qwen ve Gemma dahil pratik olarak tüm dönüştürücü tabanlı modellerle çalışır. Araştırmacılar ve geliştiriciler bu yöntemi etki alanı uyarlaması, talimat ayarlaması ve RLHF tarzı hizalama görevleri için yoğun biçimde kullanmaktadır.