NER Nedir ve Tarihsel Gelişimi
Named Entity Recognition, metindeki özel adları tespit eden köklü bir NLP görevidir. İlk sistemler 1996 MUC-6 konferansında kural tabanlı yöntemlerle ortaya çıktı. 2000'lerde CRF modelleri baskın hale gelirken, 2018'de BERT'in yayımlanmasıyla transformer mimarisi NER performansını büyük ölçüde artırdı. Bugün NER, bilgi çıkarma zincirinin ilk ve kritik halkası olmaya devam etmektedir.
Temel Varlık Türleri ve BIO Etiketleme
- check_circle PER (Kişi): "Atatürk", "Elon Musk" gibi gerçek ya da kurgu kişi adları.
- check_circle ORG (Kuruluş): "TÜBİTAK", "OpenAI" gibi şirket, üniversite ve devlet kurumları.
- check_circle LOC (Yer): "İstanbul", "Karadeniz" gibi coğrafi yer ve bölge adları.
- check_circle DATE / TIME (Tarih-Saat): "3 Mayıs 2025", "saat 14:00" gibi zamansal ifadeler.
- check_circle BIO Şeması: Her token B (Beginning), I (Inside) veya O (Outside) olarak etiketlenir; "Boğaziçi Üniversitesi" → B-ORG I-ORG.
Transformer Modellerle Modern NER
BERT ve türevleri NER'i token sınıflandırma (token classification) görevi olarak uygular. Her token, BIO şemasına göre etiketlenir; modelin son katmanına bağlı bir çıkış katmanı kategori olasılıklarını üretir. Güncel SOTA modeller genel alanlarda %95+ F1 skoru elde etmektedir. LLM'ler de NER görevine girmeye başlasa da; üretim ortamlarında hız ve pozisyon tutarlılığı açısından BIO-encoder modeller hâlâ tercih edilmektedir.
Türkçe NER: BERTurk ve Dil Zorlukları
- check_circle BERTurk: Stefan Schweter tarafından 35 GB Türkçe metinle eğitilmiş model; NER görevinde ~%97 doğruluk.
- check_circle Eklemeli Yapı Sorunu: "Ankara'daki" gibi eklemeli sözcükler alt-kelime tokenizasyonla parçalanarak varlık sınırlarını bozabilir.
- check_circle BERTurk v2 / BERT5urk: 2025'te FineWeb2'nin Türkçe alt kümesiyle ön eğitilmiş yeni nesil modeller devreye girdi.
- check_circle WikiANN Veri Seti: CoNLL formatında Türkçe NER annotasyonları sunan açık kaynaklı temel referans veri seti.
- check_circle Sağlık Alanı NER: 2025'te Türkçe radyoloji raporlarında derin öğrenme temelli NER uygulaması DIR Journal'da yayımlandı.
Uygulama Alanları
- check_circle Haber ve Medya: Metinden kişi, kurum ve yer çıkararak Knowledge Graph zenginleştirme ve içerik etiketleme.
- check_circle SEO ve İçerik Anlama: Arama motorları NER kullanarak sorguları varlık bazında eşleştirir ve Google Knowledge Graph'ı besler.
- check_circle Hukuk ve Finans: Sözleşmelerdeki taraf adları, şirket isimleri ve tarihler gibi kritik bilgilerin otomatik çıkarımı.
- check_circle Sağlık: Hasta-ilaç-hastalık üçlüsünün tıbbi metinlerden çıkarılması; elektronik sağlık kayıt sistemleriyle entegrasyon.
- check_circle Soru-Cevap Sistemleri: NER, soru içindeki varlıkları tespit ederek cevap adaylarını daraltmada anahtar rol oynar.
Sık Sorulan Sorular
- check_circle NER ile POS etiketleme arasındaki fark nedir?: POS (Part-of-Speech) her sözcüğün dilbilgisel türünü (isim, fiil, sıfat) belirlerken, NER belirli varlık kategorilerini (kişi, yer, kurum) tespit eder; amaçları ve eğitim verileri farklıdır.
- check_circle Zero-shot NER mümkün mü?: GPT-4 gibi büyük dil modelleri örneksiz (zero-shot) NER yapabilir; ancak pozisyon tutarlılığı gerektiren üretim sistemlerinde BIO-encoder modeller daha güvenilirdir.
- check_circle Türkçe için hangi veri seti kullanılır?: WikiANN, CoNLL formatında Türkçe NER annotasyonları sunar; Mukayese benchmark da NER dahil Türkçe NLP görevlerini karşılaştırmalı değerlendirir.
- check_circle NER çıktısı nasıl kullanılır?: Varlık listesi doğrudan arama indeksine, bilgi tabanına veya downstream görevlere (ilişki çıkarma, olay tespiti) girdi olarak verilir.
- check_circle Nested NER nedir?: Bir varlık ifadesinin başka bir varlık içinde yer almasıdır; örneğin 'Türkiye Büyük Millet Meclisi'nde 'Türkiye' de ayrıca LOC varlığıdır. Çok katmanlı modeller bu durumu ele alır.