SAM (SAM (Her Şeyi Segmentleyen Model))

Meta AI'nın geliştirdiği, nokta veya kutu istemiyle görüntüdeki herhangi bir nesneyi sıfır-atış yeteneğiyle piksel düzeyinde segmentleyen temel bilgisayarlı görü modeli.

SAM (Segment Anything Model — Her Şeyi Segmentleyen Model), Meta AI Research tarafından 2023'te yayımlanan ve görüntü segmentasyonunda sıfır-atış (zero-shot) genelleştirme yeteneği sunan temel bir bilgisayarlı görü modelidir. Geleneksel segmentasyon modelleri belirli nesne kategorileri için özel olarak eğitilirken SAM, yalnızca bir nokta, sınır kutusu veya metin istemi ile görüntüdeki herhangi bir nesneyi anında segmentleyebilir. Model, 11 milyondan fazla görüntü ve 1,1 milyardan fazla maske içeren SA-1B veri kümesiyle eğitilmiştir — segmentasyon alanındaki en büyük veri setlerinden biridir. SAM üç ana bileşenden oluşur: MAE ile önceden eğitilmiş ViT tabanlı bir görüntü kodlayıcısı, nokta, kutu veya metin girdileri için bir istem kodlayıcısı ve çakışan potansiyel maskeler üreten hafif bir maske dekoderi. Bu mimari, modelin bir görüntüdeki her nesneyi hiçbir kategori bilgisine gerek duymadan ayrıştırmasına imkân tanır. Meta, 2024'te SAM 2'yi yayımladı. SAM 2, SAM'ın video segmentasyonuna genişletilmiş versiyonudur; gerçek zamanlı nesne izleme ve kareler arası tutarlı maske üretimi sunar. Streaming memory mimarisi, daha önce görülmüş karelerin bilgisini saklar ve böylece modelin nesneyi kaybolduğunda yeniden bulmasına olanak tanır. Kullanım alanları oldukça geniştir: tıbbi görüntülemede organ ve lezyon tespiti, otonom araçlarda sahne analizi, AR/VR içerik üretimi, uydu görüntülerinde arazi örtüsü haritalaması ve e-ticaret ürün görsellerinde arka plan kaldırma. Türkiye'de akıllı tarım sistemleri, endüstriyel kalite kontrol ve mobil uygulama geliştirmede benimsenmektedir.

SAM Nasıl Çalışır?

SAM, promptable segmentation paradigmasını benimser: kullanıcı bir nokta, sınır kutusu veya metin istemi verdiğinde model, söz konusu nesneyi piksel düzeyinde ayrıştırır. Görüntü kodlayıcısı (ViT-H/L/B) görüntüyü bir kez işleyerek gömmeler üretir; sonraki her istem bu hazır temsil üzerinde milisaniyeler içinde yanıtlanır. Maske dekoderi birden fazla geçerli maskeyi aynı anda çıkarır ve belirsiz istemler için en olası üç segmentasyon adayını döndürür.

SAM Mimarisi: Üç Bileşen

🖼️ Görüntü Kodlayıcı

MAE önceden eğitimli ViT (Vision Transformer). Görüntüyü bir kez işler, yeniden kullanılabilir gömme üretir. ViT-H en büyük, ViT-B en hızlı versiyondur; kenar cihazlar için SAM-HQ ve MobileSAM gibi distile versiyonlar mevcuttur.

✏️ İstem Kodlayıcı

Nokta, sınır kutusu (bounding box) veya kaba maske girdilerini vektöre dönüştürür. Çok turlu etkileşimli segmentasyona destek verir: kullanıcı her turda yeni istemler ekleyerek maskeyi rafine edebilir.

🎭 Maske Dekoderi

İki transformer katmanı + MLP ile belirsiz maskeler dahil en fazla 3 aday maske üretir. IoU tahmini ile her maskenin güven skoru verilir. Gerçek zamanlı uygulamalarda sadece bu bileşen tekrar çalıştırılır.

SAM 2: Video Segmentasyonu

Meta'nın 2024'te yayımladığı SAM 2, orijinal SAM'ı video ve gerçek zamanlı kullanım senaryolarına genişletir. Streaming memory adlı yeni mekanizma, önceki karelerin gömme belleğini saklar; bu sayede nesne kısmen örtüldüğünde veya sahne dışına çıktığında model onu yeniden bulabilir. SA-V veri kümesi ile 50.9K video ve 642.6K maski kapsar. Otonom araç sensör füzyonu, video düzenleme efektleri ve tıbbi görüntü dizisi analizinde giderek yaygınlaşmaktadır.

Kullanım Alanları ve Türkiye'deki Uygulamalar

  • check_circle Tıbbi Görüntüleme: Organ, tümör ve lezyon segmentasyonunda radyolog iş yükünü azaltır. 2D MR ve CT dilimlerinde piksel düzeyinde ayrıştırma için özelleştirilmiş SAM varyantları (MedSAM) klinik araştırmalarda kullanılmaktadır.
  • check_circle E-Ticaret ve Ürün Görseli: Ürün fotoğraflarından arka plan otomatik kaldırma. Trendyol, Hepsiburada gibi platformlarda satıcıların yüklediği görsellerin standartlaştırılması için SAM tabanlı otomatik kırpma araçları öne çıkmaktadır.
  • check_circle Otonom Araçlar: Kamera görüntülerinde yaya, taşıt ve altyapı elemanlarının anlık segmentasyonu. LiDAR-kamera füzyonunda özellik eşleştirme için önemsiz gömme üretimi.
  • check_circle Uydu ve Hava Görüntüsü: Arazi örtüsü sınıflandırması, bina tespiti ve afet hasar değerlendirmesi. Türkiye'de AFAD ve belediyeler SAM tabanlı uydu analizi araştırmaktadır.

Sık Sorulan Sorular

  • check_circle SAM hangi istem türlerini destekler?: Nokta (foreground/background), sınır kutusu (bounding box), kaba maske ve metinden istem desteklenir. Çok turlu etkileşimde her istem bir öncekini rafine eder; kullanıcı 'bu bölge dahil değil' gibi negatif noktalar da ekleyebilir.
  • check_circle SAM ile klasik segmentasyon modeli (Mask R-CNN) arasındaki fark nedir?: Mask R-CNN belirli kategorilere (insan, araba, köpek gibi) özel eğitilir; bilmediği nesneyi segmentleyemez. SAM kategori bilgisi gerektirmez — hiç görmediği nesneleri bile isteme göre ayrıştırır. Bu sıfır-atış (zero-shot) yeteneği SAM'ın temel farkıdır.
  • check_circle SAM 2 ile SAM arasındaki temel fark nedir?: SAM yalnızca tek görüntülerle çalışır. SAM 2, streaming memory mimarisiyle video karelerinde nesneyi takip eder; kareler arası kimlik tutarlılığı sağlar ve örtülme durumlarını yönetir. Ayrıca SAM 2, görüntü segmentasyonunda da SAM'ı geride bırakır.
  • check_circle SAM'ı kendi projem için nasıl kullanırım?: Meta'nın GitHub deposundan (facebookresearch/segment-anything) açık kaynak ağırlıkları indirilebilir. Hugging Face'de demo ve pipeline API mevcuttur. Mobil/kenar uygulamaları için MobileSAM veya EfficientSAM gibi hafifletilmiş versiyonlar kullanılabilir.
  • check_circle SAM Türkçe metin istemi ile çalışır mı?: Orijinal SAM yalnızca görsel istemler (nokta, kutu) kullanır — metin istemi natifte desteklenmez. Grounded-SAM gibi birleşik yaklaşımlar Grounding DINO ile SAM'ı birleştirerek metin tabanlı segmentasyonu mümkün kılar; bu pipeline Türkçe metin desteği için çok dilli DINO versiyonları gerektirir.