LFM2.5-VL-DSpark: Görsel Dil Modellerine 3x Hız — yapay zeka haberi
newspaper Haber edit_note yapayzekasozluk.tr Haber Masası schedule 27 Eylül 2026 · 15:38 timer 5 dk okuma

LFM2.5-VL-DSpark: Görsel Dil Modellerine 3x Hız

Liquid AI, LFM2.5-VL-3B için DSpark spekülatif kod çözme taslağını yayınladı. Model, cihaz üzerinde 3.13x'e kadar kod çözme hızlanması sunarken yalnızca %8,9 parametre ekliyor ve llama.cpp, MLX-VLM ile SGLang'da ilk günden destekleniyor.

LFM2.5-VL-DSpark Nedir?

Liquid AI, görsel dil modellerinin (vision-language model, VLM) çıkarım hızını artırmak için tasarladığı yeni spekülatif kod çözme (speculative decoding) taslağını duyurdu: LFM2.5-VL-DSpark. Bu taslak model, halihazırda kullanılan LFM2.5-VL-3B hedef modeliyle birlikte çalışarak kod çözme aşamasını belirgin biçimde hızlandırıyor. Şirketin paylaştığı ölçümlere göre cihaz üzerinde 3,13 kata kadar, H100 GPU üzerinde ise 2,66 kata kadar kod çözme hızlanması elde ediliyor. Uçtan uca gecikmede ise sırasıyla 2,62x ve 2,27x iyileşme görülüyor.

DSpark yaklaşımının en dikkat çekici yanı, bu hız artışını çok küçük bir bellek maliyetiyle sunması. Taslak model yaklaşık 280 milyon parametre içeriyor ve bu, 3 milyar parametreli hedef modelin üzerine yalnızca %8,9 ek yük getiriyor. Yani kullanıcılar, model boyutunu neredeyse iki katına çıkarmadan ciddi bir hız kazancı elde ediyor.

DSpark Nasıl Çalışıyor?

Görsel taslak model, Liquid AI'nin metin için geliştirdiği LFM2.5-DSpark taslaklarıyla aynı mimariyi kullanıyor. Taslak model, hedef modelin belirli katmanlarından gizli durumları (hidden state) yakalıyor ve bu bilgilere dayanarak k adet aday token içeren bir blok öneriyor. Görüntü yamaları ve metin tokenları, bu katmanlara girmeden önce ortak bir temsile yansıtılıyor. Böylece taslak model, girdi türü ne olursa olsun aynı boyutlu gizli durum vektörleri üzerinde çalışıyor ve çıkarım algoritması metin modellerinden hiç farklılaşmıyor.

Taslak modelin eğitimi, görsel-dil denetimli ince ayar (SFT) verisi karışımıyla DSpark tarifine uygun biçimde yapıldı. Karışım, modelin hizmet vereceği beklenen iş yüklerine ağırlık verilerek hazırlandı. 3, 4 ve 5 katmanlı ablasyon denemelerinin ardından ekip, 4 katmanlı ve blok boyutu 9 olan sadeleştirilmiş, yalnızca dikkat (attention-only) içeren bir taslakta karar kıldı. Son karışım üzerinde 10 dönem (epoch) eğitim yapıldı ve her dönemden sonra kabul oranı ölçüldü; kabul oranı ek tokenlarla iyileşti ancak bir noktadan sonra azalan verim gösterdi. Çıkarım sırasında donanıma bağlı olarak 8 veya 9 blok boyutu öneriliyor.

Hızlanma Ölçümleri

Ekip, hem cihaz üzeri hem de GPU çıkarımını ölçtü. Her iki yapılandırmada da DSpark blok boyutu 8 kullanıldı ve MMSpec kıyaslama setini takip eden altı farklı görsel görev değerlendirildi: genel görsel soru-cevap (VQA), metin VQA, görüntü altyazılama, grafik VQA, karmaşık akıl yürütme ve çok turlu sohbet.

  • Cihaz üzeri (MLX, M5 Max): Kod çözme göreve göre 2,30x ile 3,13x arasında hızlanıyor; uçtan uca gecikme 1,56x ile 2,62x arasında iyileşiyor.
  • Cihaz üzeri (llama.cpp, M3 Ultra): Kod çözme 1,57x ile 2,14x, uçtan uca ise 1,30x ile 1,77x arasında hızlanıyor.
  • GPU (H100): Aynı taslak model 2,66x'e kadar kod çözme hızlanması sağlıyor; uçtan uca iyileşme 1,64x ile 2,27x aralığında.

Bu tablo, hızlanmanın donanıma ve göreve göre değiştiğini gösteriyor. Özellikle Apple silicon üzerinde elde edilen kazançlar, uç cihazlarda görsel dil modellerinin pratik kullanımını ciddi biçimde kolaylaştırıyor.

Neden Uçtan Uca Kazanç Sınırlı?

Büyük dil modellerinde ön doldurma (prefill) aşaması büyük ölçüde hesaplama bağımlıdır ve maliyeti istem uzunluğuyla birlikte (yarı) karesel olarak büyür. Görsel dil modellerinde bu durum daha da ağırlaşır; çünkü görüntü önce bir görsel kodlayıcıdan (vision encoder) geçer, ardından dil omurgası yüzlerce görsel tokenı metin istemiyle birlikte işler. Uç cihazların hesaplama gücü veri merkezi GPU'larından çok daha düşük olduğu için ön doldurma, uçtan uca gecikmenin daha büyük bir kısmını kaplar. Apple silicon ve H100 üzerindeki ilk token süresi (time-to-first-token) ve kod çözme ölçümleri bunu doğruluyor. M5'in çekirdek başına GPU sinir hızlandırıcıları bu farkı bir miktar kapatıyor.

Spekülatif kod çözme yalnızca kod çözme aşamasını hızlandırır; görsel kodlamayı veya ön doldurmayı hızlandırmaz. Bu aşamalar zaten toplam sürenin büyük kısmını kapladığında, kod çözmede elde edilen büyük bir hızlanma bile uçtan uca yalnızca mütevazı bir kazanç sağlar. Bu, Amdahl yasasının doğrudan bir yansıması: genel hızlanma, hızlandırılamayan iş yükü kısmıyla sınırlanır.

Kurulum ve Kullanım

DSpark taslak modeli, üç popüler çıkarım çatısında ilk günden destekleniyor: llama.cpp, MLX-VLM ve SGLang. SGLang ile çalıştırmak için LFM2 hedefleri için DSpark desteği içeren bir SGLang derlemesi (PR #40651) gerekiyor. Hedef model, taslak modele bağlı olarak başlatılıyor ve OpenAI uyumlu uç nokta `http://localhost:30000/v1` adresinden sorgulanabiliyor. Blok boyutu, taslak modelin `config.json` dosyasından okunuyor; temel karşılaştırma için üç `--speculative-*` bayrağı çıkarılarak aynı komut çalıştırılıyor.

llama.cpp ile çalıştırmak için ilgili derleme (PR #29339) gerekiyor. `llama-server` komutunda hedef model, `--mmproj` ile görsel yansıtıcı ve `-md` ile taslak model belirtiliyor; `--spec-type draft-dspark` ve `--spec-draft-n-max 8` gibi bayraklarla blok boyutu ayarlanıyor. MLX-VLM ile çalıştırmak için ise ilgili derleme (PR #2280) kullanılıyor ve `mlx_vlm.server` komutuna `--draft-model` parametresi ekleniyor. Blok boyutu yan meta verilerden okunuyor ve `n-max` değeri buna göre sınırlanıyor.

Spekülatif kod çözmenin kesin (exact) olduğunu vurgulamak gerekiyor: hedef model önerilen her tokenı doğruluyor, dolayısıyla açgözlü (greedy) çıktı tek başına hedef modelle aynı oluyor. Yanıt başına zamanlama raporları `draft_n` ve `draft_n_accepted` değerlerini gösteriyor. Görsel DSpark taslak modeli Hugging Face üzerinde Safetensors ve GGUF formatlarında erişilebilir durumda.

Neden Önemli?

Liquid AI'nin bu hamlesi, "her yerde çalışan yapay zeka" vizyonunun somut bir adımı. Açık ağırlıklı (open-weight) modellerin indirilip ince ayar yapılabilmesi ve kısıtlama olmadan dağıtılabilmesi, Türkiye'deki geliştiriciler ve girişimler için de önemli bir fırsat yaratıyor. Özellikle uç cihazlarda çalışan görsel dil modelleri, bulut maliyetlerini ve veri gizliliği endişelerini azaltmak isteyen yerli uygulamalar için cazip bir seçenek.

DSpark'ın yalnızca %8,9 ek parametreyle 3 kata kadar kod çözme hızlanması sunması, sınırlı donanıma sahip cihazlarda dahi görsel dil modellerinin kullanılabilir hale gelmesi anlamına geliyor. llama.cpp, MLX ve SGLang gibi yaygın çatılarda ilk günden destek verilmesi, entegrasyon eşiğini düşürüyor. Yine de Amdahl yasasının hatırlattığı gerçeği unutmamak gerekiyor: ön doldurma ve görsel kodlama darboğazları çözülmeden, uçtan uca kazançlar kod çözme hızlanmasının gerisinde kalacak. Bu nedenle önümüzdeki dönemde görsel kodlayıcı ve ön doldurma tarafında yapılacak iyileştirmeler, bu tür spekülatif çözümlerin etkisini daha da artırabilir.

link Kaynak: HuggingFace
tag Liquid AI tag LFM2.5 tag görsel dil modeli tag spekülatif kod çözme tag llama.cpp tag SGLang

İlgili Terimler

8 terim