Named Entity Recognition (Adlandırılmış Varlık Tanıma)

Metindeki kişi, kurum, yer ve tarih gibi adlandırılmış varlıkları otomatik olarak tespit edip sınıflandıran temel bir Doğal Dil İşleme tekniği.

Named Entity Recognition (NER), kısaca Adlandırılmış Varlık Tanıma, bir metindeki önceden tanımlanmış kategorilere ait varlıkları otomatik olarak tespit edip sınıflandıran temel bir Doğal Dil İşleme (NLP) tekniğidir. Bu kategoriler tipik olarak kişi adlarını (PER), kuruluşları (ORG), coğrafi yerleri (LOC), tarihleri ve para değerlerini kapsar. NER'in kökleri 1996'daki MUC-6 (Message Understanding Conference) konferansına dayanır; ilk sistemler kural tabanlı yaklaşımlar kullanıyordu. 2000'lerde Koşullu Rastgele Alan (CRF — Conditional Random Field) modellerinin yaygınlaşmasıyla istatistiksel yöntemler baskın hale geldi. Asıl dönüşüm ise 2018'de Google'ın BERT modelini yayımlamasıyla yaşandı; transformer mimarisi NER doğruluğunu dramatik biçimde artırdı. Günümüzde NER, BIO etiketleme şeması üzerinden çalışır: her token, varlığın Başlangıcı (B — Beginning), İç kısmı (I — Inside) veya Varlık Dışı (O — Outside) olarak işaretlenir. Örneğin "Boğaziçi Üniversitesi" ifadesi B-ORG ve I-ORG olarak etiketlenir. Modern BERT tabanlı modeller bu sınıflandırmayı token düzeyinde gerçekleştirerek %95+ F1 skoru elde eder. Türkçe için en yaygın kullanılan model BERTurk'tür. Stefan Schweter tarafından geliştirilen bu model, 35 GB Türkçe metinle eğitilmiş olup NER görevinde yaklaşık %97 doğruluk sağlamaktadır. Türkçe'nin eklemeli (agglutinative) yapısı NER'i güçleştirir; "Ankara'daki" gibi sözcükler tokenizasyon açısından özel dikkat gerektirir. NER'in uygulama alanları son derece geniştir: haber metinlerinden kişi ve kurum çıkarma, hukuk belgelerinde sözleşme taraflarını belirleme, sağlık alanında hasta-ilaç-hastalık tanıma ve arama motorlarında Knowledge Graph zenginleştirme bunların başında gelir. Büyük Dil Modelleri NER görevine girmeye başlasa da üretim ortamlarında BIO-encoder modeller hız ve güvenilirlik açısından hâlâ tercih edilmektedir.

NER Nedir ve Tarihsel Gelişimi

Named Entity Recognition, metindeki özel adları tespit eden köklü bir NLP görevidir. İlk sistemler 1996 MUC-6 konferansında kural tabanlı yöntemlerle ortaya çıktı. 2000'lerde CRF modelleri baskın hale gelirken, 2018'de BERT'in yayımlanmasıyla transformer mimarisi NER performansını büyük ölçüde artırdı. Bugün NER, bilgi çıkarma zincirinin ilk ve kritik halkası olmaya devam etmektedir.

Temel Varlık Türleri ve BIO Etiketleme

  • check_circle PER (Kişi): "Atatürk", "Elon Musk" gibi gerçek ya da kurgu kişi adları.
  • check_circle ORG (Kuruluş): "TÜBİTAK", "OpenAI" gibi şirket, üniversite ve devlet kurumları.
  • check_circle LOC (Yer): "İstanbul", "Karadeniz" gibi coğrafi yer ve bölge adları.
  • check_circle DATE / TIME (Tarih-Saat): "3 Mayıs 2025", "saat 14:00" gibi zamansal ifadeler.
  • check_circle BIO Şeması: Her token B (Beginning), I (Inside) veya O (Outside) olarak etiketlenir; "Boğaziçi Üniversitesi" → B-ORG I-ORG.

Transformer Modellerle Modern NER

BERT ve türevleri NER'i token sınıflandırma (token classification) görevi olarak uygular. Her token, BIO şemasına göre etiketlenir; modelin son katmanına bağlı bir çıkış katmanı kategori olasılıklarını üretir. Güncel SOTA modeller genel alanlarda %95+ F1 skoru elde etmektedir. LLM'ler de NER görevine girmeye başlasa da; üretim ortamlarında hız ve pozisyon tutarlılığı açısından BIO-encoder modeller hâlâ tercih edilmektedir.

Türkçe NER: BERTurk ve Dil Zorlukları

  • check_circle BERTurk: Stefan Schweter tarafından 35 GB Türkçe metinle eğitilmiş model; NER görevinde ~%97 doğruluk.
  • check_circle Eklemeli Yapı Sorunu: "Ankara'daki" gibi eklemeli sözcükler alt-kelime tokenizasyonla parçalanarak varlık sınırlarını bozabilir.
  • check_circle BERTurk v2 / BERT5urk: 2025'te FineWeb2'nin Türkçe alt kümesiyle ön eğitilmiş yeni nesil modeller devreye girdi.
  • check_circle WikiANN Veri Seti: CoNLL formatında Türkçe NER annotasyonları sunan açık kaynaklı temel referans veri seti.
  • check_circle Sağlık Alanı NER: 2025'te Türkçe radyoloji raporlarında derin öğrenme temelli NER uygulaması DIR Journal'da yayımlandı.

Uygulama Alanları

  • check_circle Haber ve Medya: Metinden kişi, kurum ve yer çıkararak Knowledge Graph zenginleştirme ve içerik etiketleme.
  • check_circle SEO ve İçerik Anlama: Arama motorları NER kullanarak sorguları varlık bazında eşleştirir ve Google Knowledge Graph'ı besler.
  • check_circle Hukuk ve Finans: Sözleşmelerdeki taraf adları, şirket isimleri ve tarihler gibi kritik bilgilerin otomatik çıkarımı.
  • check_circle Sağlık: Hasta-ilaç-hastalık üçlüsünün tıbbi metinlerden çıkarılması; elektronik sağlık kayıt sistemleriyle entegrasyon.
  • check_circle Soru-Cevap Sistemleri: NER, soru içindeki varlıkları tespit ederek cevap adaylarını daraltmada anahtar rol oynar.

Sık Sorulan Sorular

  • check_circle NER ile POS etiketleme arasındaki fark nedir?: POS (Part-of-Speech) her sözcüğün dilbilgisel türünü (isim, fiil, sıfat) belirlerken, NER belirli varlık kategorilerini (kişi, yer, kurum) tespit eder; amaçları ve eğitim verileri farklıdır.
  • check_circle Zero-shot NER mümkün mü?: GPT-4 gibi büyük dil modelleri örneksiz (zero-shot) NER yapabilir; ancak pozisyon tutarlılığı gerektiren üretim sistemlerinde BIO-encoder modeller daha güvenilirdir.
  • check_circle Türkçe için hangi veri seti kullanılır?: WikiANN, CoNLL formatında Türkçe NER annotasyonları sunar; Mukayese benchmark da NER dahil Türkçe NLP görevlerini karşılaştırmalı değerlendirir.
  • check_circle NER çıktısı nasıl kullanılır?: Varlık listesi doğrudan arama indeksine, bilgi tabanına veya downstream görevlere (ilişki çıkarma, olay tespiti) girdi olarak verilir.
  • check_circle Nested NER nedir?: Bir varlık ifadesinin başka bir varlık içinde yer almasıdır; örneğin 'Türkiye Büyük Millet Meclisi'nde 'Türkiye' de ayrıca LOC varlığıdır. Çok katmanlı modeller bu durumu ele alır.