NeoMME: Tek Kuleli Çok Modlu Kodlayıcı ile Belge Erişiminde Yeni Çağ
NeoMME, görüntü ve metni tek bir Transformer ile işleyen, 260M ve 800M parametreli çok dilli ve çok modlu bir kodlayıcıdır. Ayrı görüntü kulesi veya nedensel dil modeli kullanmadan, maskeleme tabanlı difüzyon hedefiyle sıfırdan eğitilir. NeoMME-Retriever, görsel belge erişiminde yoğun ve geç etkileşimli vektörleri tek geçişte üretir; 2048x2048 çözünürlükte saniyede 51 sayfa işleyerek ColModernVBERT'in iki katı hıza ulaşır.
NeoMME Nedir?
Yapay zeka alanındaki son gelişmeler, görsel ve metinsel veriyi birlikte işleyen modellerin önemini artırıyor. NeoMME, bu alanda farklı bir yaklaşım sunan, 260M ve 800M parametreli iki farklı boyutta hazırlanmış çok dilli ve çok modlu bir kodlayıcı (encoder) ailesi olarak tanıtılıyor. NeoMME, üretken görsel dil modellerinin (VLM) aksine, önceden eğitilmiş ayrı bir görüntü kulesi veya nedensel dil modeli kullanmıyor. Bunun yerine, tek bir çift yönlü Transformer (bidirectional Transformer) hem metin token'larını hem de ham görüntü parçacıklarını (patch) işliyor. Model, tümüyle sıfırdan, maskeli ayrık difüzyon (masked discrete-diffusion) hedefiyle eğitiliyor.
Bu mimari, görüntü ve metnin aynı hesaplama yolunu paylaşması sayesinde ön eğitim, ince ayar, paralelleştirme ve sunum aşamalarında daha esnek bir kullanım sunuyor. NeoMME, görüntüleri 32x32 boyutunda parçalara bölüp küçük bir MLP ile projekte ederken, metinleri faktörize token gömme (factorized token embeddings) yöntemiyle işliyor. Böylece iki farklı veri türü de aynı Transformer kodlayıcıya girdi olarak veriliyor.
Teknik Özellikler ve Mimarisi
NeoMME'nin mimarisi, modern kodlayıcıların getirdiği birçok yeniliği içeriyor. Dinamik görüntü çözünürlüğü sayesinde görüntüler en-boy oranını ve boyutunu koruyarak işleniyor; böylece yüksek çözünürlüklü bir belge sayfası, daha küçük bir görüntüye kıyasla daha fazla token kullanabiliyor. Model, 16.384 token uzunluğunda bağlam penceresine sahip; bu, iki adet 4K UHD görüntüyü aynı anda işlemeye yetiyor. Dikkat mekanizması olarak çoğu katmanda simetrik kayan pencere dikkati (sliding-window attention) kullanılırken, her altıncı katman ve son katman global dikkat ile çalışıyor.
Ayrıca NeoMME, gruplu sorgu dikkati (grouped-query attention), sorgu-anahtar normalizasyonu, kapılı dikkat, 2D döner konum gömme ve kare-ReLU MLP gibi son teknoloji kodlayıcı iyileştirmelerini barındırıyor. Çok dilli destek için 131k token kelime hazinesine sahip bir BPE tokenizer, çok dilli metin, kod, matematik ve makine üretimi görüntü transkriptleri üzerinde sıfırdan eğitilmiş. Bu özellikler, NeoMME'yi hem performans hem de verimlilik açısından güçlü bir seçenek haline getiriyor.
Eğitim ve Performans
NeoMME, sıfırdan maskeli bir metin giderici (denoiser) olarak eğitiliyor. Metin örneklerinde bozulma oranı 0 ile 1 arasında rastgele seçilirken, çok modlu örneklerde bu oran 0.3 ile 1 arasında tutuluyor. Görüntü parçacıkları görünür kalırken, model maskelenmiş metni yeniden oluşturmaya çalışıyor. Hafif maskeleme ile model, çevresindeki metinden eksik kelimeyi tahmin edebiliyor; ancak yüksek maskeleme oranı, modeli görüntüye dayalı açıklamalar öğrenmeye zorluyor. Eğitimde çok dilli metin, kod, matematik, doğal görüntüler ve belge görüntüleri bir arada kullanılıyor. Her model yaklaşık 524 milyar paketlenmiş token ile eğitilirken, bunun 290 milyarı yalnızca metin örneklerinden oluşuyor. ModernBERT'in 2 trilyon tokenlık bütçesine kıyasla daha küçük olan bu bütçe, NorMuon optimizörü ile veri verimliliğini artırmayı hedefliyor.
NeoMME-Retriever ile Belge Erişimi
NeoMME'nin asıl kullanım alanı, görsel belge erişimi (visual document retrieval) olarak öne çıkıyor. NeoMME-Retriever, ColPali'nin sayfa-görüntüsü yaklaşımını kullanarak belge sayfalarını sıralıyor; böylece PDF'lerden metin çıkarmak için gereken OCR ön işleme adımlarını ortadan kaldırıyor. Sayfaları görüntü olarak ele almak, düzen, grafikler, tablolar ve yazı tipleri gibi görsel ipuçlarını koruyor. NeoMME-Retriever, yoğun (dense) ve geç etkileşimli (late-interaction) gömme vektörlerini tek bir ileri geçişte üretiyor. Yoğun gömme, ortalama havuzlama ile elde edilirken, geç etkileşimli gömme, her token veya görüntü parçası için 128 boyutlu normalize vektörler üretiyor. Bu iki gösterim, kullanıcıya esneklik sağlıyor: büyük külliyatlarda önce yoğun gömme ile hızlı arama yapılıp ardından geç etkileşimli gömme ile yeniden sıralama yapılabiliyor.
ViDoRe v3 üzerinde yapılan değerlendirmede NeoMME-Retriever-260M, 0.523 nDCG@10 puanıyla 800M parametrenin altındaki modeller arasında en yüksek skoru elde ediyor. 800M modeli ise 0.556 puanla benzer boyuttaki Vultron Retriever Flash'ın (0.8B) hemen altında yer alıyor. Her iki model de model boyutu açısından Pareto sınırında bulunuyor. Ayrıca NeoMME-Retriever, 2048x2048 çözünürlükte bir NVIDIA L40S GPU üzerinde saniyede yaklaşık 51 sayfa kodlayarak ColModernVBERT'in iki katı hız sunuyor.
Depolama ve Sıkıştırma
Geç etkileşimli gömme vektörleri, yüksek çözünürlüklü belgelerde büyük depolama alanı gerektirebiliyor. NeoMME-Retriever, bu sorunu çözmek için hiyerarşik token havuzlama (hierarchical token pooling) ve asimetrik niceleme (asymmetric quantization) yöntemlerini birleştiriyor. Token havuzlama, benzer vektörleri kümeleyip her kümenin ortalamasını alarak vektör sayısını azaltıyor; asimetrik niceleme ise belge vektörlerini int8 veya ikili (binary) formata dönüştürüyor. Bu sayede sayfa başına depolama alanı yaklaşık 1.5 MB'den 6 kB'a düşürülüyor (255 kat küçülme) ve orijinal nDCG@10 değerinin %95'inden fazlası korunuyor. Kullanıcılar, depolama bütçelerine ve kalite gereksinimlerine göre bu sıkıştırma ayarlarından birini seçebiliyor.
Neden Önemli?
NeoMME, görsel belge erişiminde verimlilik ve performansı bir araya getiren önemli bir adım. Türkiye'deki araştırmacılar ve şirketler için bu model, büyük ölçekli belge arşivlerini işlerken hem donanım maliyetlerini düşürme hem de hızlı sonuç alma potansiyeli sunuyor. Özellikle hukuk, sağlık ve finans gibi sektörlerde taranmış belgelerden bilgi çıkarmak kritik; NeoMME, OCR'ye olan ihtiyacı ortadan kaldırarak bu süreci hızlandırabilir. Ayrıca Apache 2.0 lisansıyla açık kaynak olarak yayınlanması, Türk geliştiricilerin modeli kendi dillerine ve ihtiyaçlarına uyarlamasını kolaylaştırıyor. NeoMME'nin tek kuleli mimarisi, gelecekteki çok modlu modeller için de bir yol haritası çiziyor; bu da yapay zeka ekosisteminde önemli bir değişimin habercisi olabilir.