Model Merging (Model Birleştirme)

Model Birleştirme, birden fazla ince ayarlı modelin ağırlıklarını yeniden eğitim gerektirmeden matematiksel yöntemlerle tek bir güçlü modelde birleştirme tekniğidir.

Model Birleştirme (Model Merging), önceden eğitilmiş birden fazla yapay zeka modelinin ağırlıklarını ek bir eğitim sürecine gerek kalmaksızın matematiksel işlemler yoluyla tek bir modelde birleştirme tekniğidir. 2022-2025 yılları arasında özellikle açık kaynaklı büyük dil modelleri (LLM) topluluğunda hızla yaygınlaşan bu yöntem, pahalı yeniden eğitim maliyetlerini ortadan kaldırarak farklı yetenekleri tek bir model içinde bir araya getirmeyi mümkün kılar. Geleneksel transfer öğrenme yöntemlerinde her model ayrı ayrı eğitilirken, model birleştirme yalnızca modellerin ağırlık matrislerini (parametrelerini) matematiksel işlemler aracılığıyla birleştirir. Temel dayanak noktası, nöral ağların ağırlık uzayında lineer bağlantısal bölgeler oluşturduğuna dair gözlemdir. Bu sayede aynı temel mimariden türetilen modeller birbirleriyle uyumlu ağırlık uzayları paylaşır ve birleştirme mümkün hale gelir. Başlıca model birleştirme yöntemleri şunlardır: Ağırlık Ortalaması (Model Soup), modellerin basit aritmetik ortalamasını alır ve Wortsman vd. (2022) tarafından popularize edilmiştir. SLERP (Küresel Doğrusal Enterpolasyon), iki modeli düz bir çizgi yerine küresel yüzey üzerinden birleştirerek daha pürüzsüz geçişler sağlar. TIES-Merging, parametre çakışmalarını ve işaret tutarsızlıklarını gidererek çok modelli birleştirmelerde kayıpları minimize eder (Yadav vd., 2023). DARE (Drop and Rescale), rastgele parametre seyreltmesi uygulayarak çakışmaları azaltır. Görev Vektörleri (Task Vectors) ise ince ayarın ağırlık uzayında bıraktığı yöne işaret eden vektörlerdir; bu vektörler toplanarak ya da çıkarılarak yetenekler aktarılabilir. Model birleştirme pratikte mergekit (Goddard vd., 2024) gibi açık kaynaklı araçlarla uygulanmakta ve Hugging Face'te büyük bir topluluk tarafından benimsenmektedir. Bu yaklaşım, yeni yetenekler kazandırmak için binlerce GPU saati harcamak yerine dakikalar içinde denemeler yapmayı olanaklı kılar; hesaplama maliyetini ve karbon ayak izini önemli ölçüde düşürür. Temel kısıt, birleştirilen modellerin aynı mimari ve parametre sayısına sahip olmasıdır.

Model Birleştirme Nasıl Çalışır?

Nöral ağlar, eğitim sırasında milyonlarca ya da milyarlarca parametre (ağırlık) öğrenir. Model birleştirmede bu parametreler, iki veya daha fazla model için ayrı ayrı tutulur ve belirli bir kural dahilinde tek bir parametre kümesine dönüştürülür. Temel varsayım, aynı mimariden türetilen modellerin ağırlık uzayında birbirine yakın bölgelerde bulunduğudur; bu 'lineer mod bağlantısı' (linear mode connectivity) olgusu, doğrusal enterpolasyonun neden işe yaradığını açıklar. Basit durumda iki modelin ortalaması alınır: θ_merge = α × θ_A + (1−α) × θ_B. Oran α değiştirilerek hangi modelin etkisinin baskın olacağı ayarlanabilir. Daha ileri yöntemler, hangi parametrelerin nasıl birleştirileceğini ve parametre çakışmalarının nasıl çözüleceğini ayrıntılı biçimde belirler.

Temel Birleştirme Yöntemleri

  • check_circle Model Soup (Ağırlık Ortalaması): Birden fazla modelin ağırlıklarının basit aritmetik ortalamasını alır. En temel yöntem olup Wortsman vd. (2022) tarafından gösterilmiştir: ince ayar yapılmış birden fazla kontrol noktasının ortalaması genellikle en iyi tek kontrol noktasından daha iyi performans verir.
  • check_circle SLERP (Küresel Doğrusal Enterpolasyon): İki modeli düz bir çizgi yerine küresel yüzey üzerinden enterpolasyonla birleştirir. Doğrusal ortalamadan daha pürüzsüz geçiş sağlar ve yüksek boyutlu ağırlık uzayında vektör uzunluğunu korur.
  • check_circle TIES-Merging (Trim, Elect Sign and Merge): Çok modelli birleştirmelerde çakışan parametre güncellemelerini keser, işaret tutarsızlıklarını oylamayla çözer ve yalnızca büyük güncellemeleri korur. Yadav vd. (2023) tarafından önerilmiştir.
  • check_circle DARE (Drop and Rescale): İnce ayar ağırlıklarını rastgele seyreltir ve yeniden ölçeklendirir; parametre çakışmasını azaltmak için etkili bir ön-işleme adımı olarak TIES ile birlikte kullanılır.
  • check_circle Görev Vektörleri (Task Vectors): İnce ayarın temel modele kıyasla ağırlık uzayında oluşturduğu yön vektörüdür. Bu vektörler toplanarak çoklu yetenek birleştirmesi, çıkarılarak ise istenmeyen yeteneğin silinmesi sağlanabilir (Ilharco vd., 2023).

Kullanım Alanları ve Avantajlar

  • check_circle Yetenek Aktarımı: Kodlama konusunda uzmanlaşmış bir model ile matematik konusunda uzmanlaşmış başka bir model birleştirilerek her iki alanda da yetkin tek bir model elde edilebilir.
  • check_circle Çok Dilli Yetenek Ekleme: İngilizce temel model ile Türkçe ince ayarlı model birleştirilerek çok dilli yetenekler kazandırılabilir; sıfırdan eğitimden çok daha hızlı ve ucuzdur.
  • check_circle Güvenlik ve Hizalama Dengesi: Talimat izleyen bir modelin ağırlıkları, güvenlik ince ayarı yapılmış bir modelle birleştirilerek her iki özelliği taşıyan dengeli bir model elde edilebilir.
  • check_circle Checkpoint Ortalaması: Eğitim sırasında farklı dönemlerden alınan kontrol noktaları ortalaması alınarak daha kararlı ve genelleştirilmiş bir model elde edilir.
  • check_circle Açık Kaynak Topluluğu: Hugging Face'te mergekit ile oluşturulan yüzlerce topluluk birleşimi modeli, yeni mimari kombinasyonlar keşfetmek için kullanılmaktadır.

Sınırlılıklar ve Dikkat Edilmesi Gerekenler

Model birleştirme her durumda işe yaramaz. Temel kısıt, birleştirilen modellerin aynı mimariye ve parametre sayısına sahip olmasıdır; farklı boyutlu modeller (örn. 7B ile 70B) doğrudan birleştirilemez. Çok farklı veri dağılımlarında eğitilmiş modellerin ağırlık uzayları birbirinden uzak düşebilir ve enterpolasyon yetersiz kalabilir. Birleştirme oranı (α) ile yöntem seçimi deneme-yanılma gerektirir. Son olarak, modellerin lisansları birleştirilmiş modelin kullanımını kısıtlayabilir; LLaMA gibi bazı modellerin ticari kullanım kısıtlamaları birleştirme sonrasında da geçerliliğini korur.

Popüler Araçlar

  • check_circle mergekit: Charles Goddard tarafından geliştirilen, SLERP, TIES, DARE ve daha pek çok yöntemi destekleyen açık kaynaklı birleştirme çerçevesi. Hugging Face topluluğunun fiili standardıdır.
  • check_circle Hugging Face Hub: Binlerce birleştirilmiş modelin depolandığı ve mergekit yapılandırma dosyalarının paylaşıldığı merkezi ekosistem. Model kartlarında genellikle merge recipe'si yer alır.
  • check_circle LM-Evaluation-Harness: Birleştirme sonrası modelin MMLU, ARC, HellaSwag gibi kıyaslamalarda test edilmesini sağlayan açık kaynaklı değerlendirme çerçevesi.

Sıkça Sorulan Sorular

  • check_circle Model birleştirme ile ensemble öğrenme arasındaki fark nedir?: Ensemble öğrenme birden fazla modeli çıktı düzeyinde birleştirir (tahminleri birleştirir) ve çıkarım maliyeti katlanarak artar. Model birleştirme ağırlıkları birleştirir, tek bir model üretir; çıkarım maliyeti tek model kadar kalır.
  • check_circle Birleştirilen model her zaman orijinallerden daha iyi midir?: Hayır. Birleştirme yöntemi ve oran seçimi kritiktir; yanlış yapılandırma performansı düşürebilir. MMLU ve ARC gibi kıyaslama testleriyle doğrulama yapılması zorunludur.
  • check_circle Hangi modeller birleştirilebilir?: Yalnızca aynı mimariye ve parametre sayısına sahip modeller doğrudan birleştirilebilir (örn. iki 7B Mistral modeli). Farklı boyutlar, önce bilgi damıtması gibi ek adımlar gerektireceğinden pratikte birleştirilmez.
  • check_circle mergekit için güçlü bir donanım gerekiyor mu?: Hayır. mergekit işlemleri CPU üzerinde yapılabilir; ancak büyük modellerde (70B+) çok fazla RAM gerekir. Küçük modeller (7B) 32 GB RAM ile birkaç dakikada birleştirilebilir.
  • check_circle Model birleştirme ticari olarak kullanılabilir mi?: Kaynak modellerin lisanslarına bağlıdır. Birleştirme, lisans kısıtlamalarını kaldırmaz; en kısıtlayıcı kaynak modelin lisansı birleştirilmiş model için de geçerlidir.