tag SLM

Gemma 3 (Gemma 3)

Bu sayfada SLM (Gemma 3 (Gemma 3)) etiketi ile işaretlenmiş 4 yapay zeka kavramını bulabilirsiniz.

Gemma, Latince "değerli taş" anlamına gelen ve Google DeepMind'ın açık ağırlıklı yapay zeka modeli ailesine verdiği isimdir; Gemma 3 ise bu ailenin 2025 yılında yayımlanan, çok modlu (multimodal) üçüncü nesil sürümüdür. 1B, 4B, 12B ve 27B parametre boyutlarında sunulan Gemma 3, metin ve görüntü anlama yeteneklerini tek mimaride birleştirir. Önceki Gemma 2'ye kıyasla uzun bağlam desteği (128K token), işlev çağırma (function calling) ve çok dilli performans belirgin şekilde iyileştirilmiştir. Gemma 3, Google'ın Gemini modellerinin eğitim altyapısından ve araştırma birikiminden yararlanan ama bağımsız bir ağırlık setine sahip model ailesidir. Ticari kullanıma açık Gemma lisansı altında yayımlanan bu modeller HuggingFace Transformers, Ollama ve LM Studio gibi platformlarda kolayca çalıştırılabilir. 27B parametreli versiyon, tek tüketici GPU'suna sığabilen en güçlü açık modellerden biridir; instruction-tuned (IT) varyantları sohbet ve görev yönlendirme için optimize edilmiştir. Gemma'nın önemi, güçlü bir modelin ağırlıklarını indirip kendi donanımınızda çalıştırabilmenizde yatar: Veri gizliliği gerektiren kurumsal senaryolarda, internet bağlantısız edge cihazlarda veya API maliyetinden kaçınmak istediğiniz projelerde yerel bir alternatif sunar. Performans açısından Gemma 3 27B, birçok kıyaslamada 70B ölçekli modellere yakın sonuçlar üretir; özellikle çok dilli anlama, kod üretimi ve görüntü açıklama görevlerinde güçlüdür. Türkçe dahil 140'tan fazla dili destekler. Pratikte `ollama run gemma3:4b` komutuyla dakikalar içinde denenebilir; kurumsal tarafta ise Google AI Studio ve Vertex AI üzerinden yönetilen API erişimi de mevcuttur.

diamond

Gemma 3 (Gemma 3)

Gemma, Latince "değerli taş" anlamına gelen ve Google DeepMind'ın açık ağırlıklı yapay zeka modeli ailesine verdiği isimdir; Gemma 3 ise bu ailenin 2025 yılında yayımlanan, çok modlu (multimodal) üçüncü nesil sürümüdür. 1B, 4B, 12B ve 27B parametre boyutlarında sunulan Gemma 3, metin ve görüntü anlama yeteneklerini tek mimaride birleştirir. Önceki Gemma 2'ye kıyasla uzun bağlam desteği (128K token), işlev çağırma (function calling) ve çok dilli performans belirgin şekilde iyileştirilmiştir. Gemma 3, Google'ın Gemini modellerinin eğitim altyapısından ve araştırma birikiminden yararlanan ama bağımsız bir ağırlık setine sahip model ailesidir. Ticari kullanıma açık Gemma lisansı altında yayımlanan bu modeller HuggingFace Transformers, Ollama ve LM Studio gibi platformlarda kolayca çalıştırılabilir. 27B parametreli versiyon, tek tüketici GPU'suna sığabilen en güçlü açık modellerden biridir; instruction-tuned (IT) varyantları sohbet ve görev yönlendirme için optimize edilmiştir. Gemma'nın önemi, güçlü bir modelin ağırlıklarını indirip kendi donanımınızda çalıştırabilmenizde yatar: Veri gizliliği gerektiren kurumsal senaryolarda, internet bağlantısız edge cihazlarda veya API maliyetinden kaçınmak istediğiniz projelerde yerel bir alternatif sunar. Performans açısından Gemma 3 27B, birçok kıyaslamada 70B ölçekli modellere yakın sonuçlar üretir; özellikle çok dilli anlama, kod üretimi ve görüntü açıklama görevlerinde güçlüdür. Türkçe dahil 140'tan fazla dili destekler. Pratikte `ollama run gemma3:4b` komutuyla dakikalar içinde denenebilir; kurumsal tarafta ise Google AI Studio ve Vertex AI üzerinden yönetilen API erişimi de mevcuttur.

arrow_forward
looks_4

Phi-4 (Phi-4)

Phi-4, Microsoft Research tarafından Aralık 2024'te yayımlanan 14 milyar parametreli bir küçük dil modelidir (SLM). Phi serisinin dördüncü üyesi olan bu model, "veri kalitesi veri miktarından önemlidir" ilkesini en somut biçimde kanıtlayan yapay zeka çalışmalarından biri hâline gelmiştir. Eğitim sürecinde ham internet verisi yerine büyük modeller (GPT-4) aracılığıyla sentetik olarak üretilmiş yüksek kaliteli matematik problemleri, akıl yürütme örnekleri ve kod veri setleri kullanılmıştır. Dikkatle seçilmiş ders kitabı içerikleri ve akademik metinler de eğitim kümesini güçlendirmiştir. Bu veri felsefesi, Phi-1'den başlayan trendin mantıksal devamıdır ve LIMA makalesinin "az ama öz" hipotezini milyarlarca parametre ölçeğine taşımaktadır. Kıyaslama performansı açısından Phi-4, doktora düzeyi bilim sorularını içeren GPQA Diamond testinde ve AMC/MATH rekabetçi matematik kıyaslamalarında 70 milyar parametreli pek çok modeli geride bırakmıştır. HumanEval ve MBPP kodlama kıyaslamalarında da parametre sayısıyla orantısız bir yetenek sergilemiştir. Model, 16.384 tokenlik bağlam penceresiyle çalışır. MIT lisansı altında HuggingFace'de yayımlanmıştır; hem araştırma hem de ticari kullanıma tamamen açıktır. 8 GB VRAM ile tam hassasiyette çalışırken GGUF/Q4 kuantize versiyonları çok daha mütevazı donanımlarda da çalışabilir. Ollama ve LM Studio gibi popüler araçlarla birkaç komutla kurulabilir. Microsoft, 2025 yılında Phi-4 ekosistemi üzerine yeni üyeler eklemiştir: 3,8 milyar parametreli Phi-4-Mini (mobil ve kenar cihazlar için), akıl yürütmeye odaklanan Phi-4-Reasoning ve çok modlu giriş desteği için Phi-4-Vision. Bu varyantlar, küçük model felsefesinin farklı donanım ve kullanım senaryolarına genişlediğini göstermektedir. Phi-4 özellikle eğitim ve öğretim uygulamaları, adım adım matematik yardımcısı, yerel kodlama asistanı ve kaynak kısıtlı bulut dağıtımı senaryolarında güçlü maliyet-performans dengesi sunan SLM modelleri arasında öne çıkmaktadır. Tüketici sınıfı GPU'ları hedefleyen bu model, API maliyeti olmaksızın güçlü yerel AI çözümleri geliştirmek isteyen geliştiriciler için ideal bir başlangıç noktasıdır.

arrow_forward
phonelink

Small Language Model (Küçük Dil Modeli)

Small Language Model (SLM — Küçük Dil Modeli), genellikle 1B ila 14B parametre aralığında, edge cihazlarda veya sınırlı hesaplama kaynaklarında çalışabilmek üzere tasarlanmış ve optimize edilmiş dil modeli sınıfıdır. GPT-4 veya Claude gibi yüz milyar parametreli dev modellerin aksine SLM'ler; yerel cihazda çalışabilme, düşük gecikme, veri gizliliği ve maliyet etkinliği gibi pratik avantajlar sunar. Bu özellikler, SLM'leri bulut bağlantısı gerektirmeyen veya veri egemenliğinin kritik olduğu senaryolarda öne çıkarmaktadır. Sınırlı kaynaklarla bile yüksek kaliteli sonuçlar üretme yeteneği, SLM'leri yapay zekanın demokratikleşmesinde kilit bir rol üstlenir kılmaktadır. SLM'lerin yükselişini mümkün kılan iki temel yaklaşım bulunmaktadır: Veri kalitesi odaklı eğitim (Phi-4 gibi yüksek kaliteli sentetik veri ile parametre sınırını zorlama) ve model damıtma (distillation — büyük bir öğretmen modelden küçük öğrenci modele bilgi aktarımı). Quantization (INT4/INT8), pruning ve grouped query attention gibi ek teknikler de bellek ayak izini ve çıkarım süresini önemli ölçüde azaltmaktadır. Bu kombinasyonlar sayesinde küçük modeller parametre sayısıyla orantısız biçimde yüksek performans sergileyebilmektedir. Popüler SLM örnekleri arasında Microsoft Phi-4 (14B), Google Gemma 3 (1B-27B), Meta Llama 3.2 (1B, 3B), Mistral 7B ve Alibaba Qwen2.5 serisi sayılabilir. Uygulama alanları: akıllı telefon asistanları, IoT cihazları, gizlilik öncelikli kurumsal uygulamalar, düşük bant genişliği ortamları ve gerçek zamanlı yanıt gerektiren sistemler. Donanım desteği açısından Apple Silicon (M1-M4 serisi), Qualcomm Hexagon NPU ve NVIDIA Jetson gibi nöral işlem birimleri SLM çıkarımını hem hızlandırmakta hem de güç tüketimini düşürmektedir. Ollama, llama.cpp ve ONNX Runtime gibi açık kaynaklı framework'ler SLM'leri tüketici donanımında dakikalar içinde çalıştırmayı mümkün kılmaktadır. SLM, özellikle sağlık, finans ve hukuk gibi veri gizliliğinin kritik olduğu sektörlerde şirket içi AI çözümlerinin temel bileşeni hâline gelmektedir.

arrow_forward
person

Student Model (Öğrenci Model (Student Model))

Öğrenci model (student model), bilgi damıtma (knowledge distillation) sürecinde daha büyük ve güçlü bir öğretmen modelden (teacher model) bilgi aktarımı alarak eğitilen küçük ve hafif sinir ağıdır. Öğrenci modelin hedefi, öğretmenin performansına mümkün olduğunca yaklaşmak — ancak çok daha az parametreyle ve dolayısıyla daha düşük hesaplama maliyetiyle. Yöntemin temelleri Hinton, Vinyals ve Dean'ın 2015 tarihli çalışmasına dayanır. Geleneksel eğitimde model gerçek etiketlerden (one-hot vektörler) öğrenir; damıtma yaklaşımında ise öğrenci bunlara ek olarak öğretmenin yumuşak çıktılarını (olasılık dağılımları) hedef alır. Bu yumuşak etiketler, doğru sınıf dışındaki düşük olasılıkların sınıflar arası benzerlik bilgisini taşıdığı 'karanlık bilgi' (dark knowledge) kavramını somutlaştırır. Sıcaklık parametresi T, softmax dağılımını düzleştirerek bu benzerlik ilişkilerini öğrenciye aktarır; T yükseldikçe öğrenci daha zengin yapısal bilgiye erişir. Eğitim kaybı çoğunlukla iki terimin ağırlıklı toplamıdır: sert etiket kaybı (doğru sınıf) ve öğretmenin yumuşatılmış dağılımı için KL diverjansı ya da çapraz entropi. Üç temel strateji uygulamada öne çıkmaktadır. Yanıt tabanlı damıtmada öğrenci yalnızca son katman çıktılarını taklit eder. Özellik tabanlı damıtmada ara katman aktivasyonları da eşleştirilir; bu yaklaşım DistilBERT ve TinyBERT'te kullanılmıştır. İlişki tabanlı damıtmada ise öğrenci, örnekler arası mesafe yapısını korumayı öğrenir. DistilBERT, BERT'in %40 küçük versiyonu olarak parametre sayısını 110M'den 66M'ye indirirken GLUE kıyaslamasında %97 performansı korumakta ve çıkarımda %60 hız kazanmaktadır. LLM damıtmasında öğrenci modelin önemi daha da büyümüştür. Phi-4 (Microsoft, 14B), Gemma 3 (Google, 1-27B) ve Qwen 3 gibi küçük dil modelleri (SLM), GPT-4 veya Claude gibi öğretmen modellerden üretilen sentetik verilerle eğitilerek boyutlarına kıyasla olağanüstü performans sergilemektedir. DeepSeek-R1-Distill serisinde büyük R1 modelinin akıl yürütme yetenekleri 7B-70B arası daha küçük modellere aktarılmış; bu modeller MATH ve coding kıyaslama setlerinde çok daha büyük modelleri geride bırakmıştır. Bu yaklaşım, tüketici cihazları ve uç (edge) sistemleri için güçlü modeller üretmenin pratik yolu haline gelmiştir.

arrow_forward