Named Entity Recognition (NER) (Varlık İsmi Tanıma)

Metindeki kisi, yer, kurum ve tarih gibi belirli varlik isimlerini otomatik olarak tespit edip siniflandiran dogal dil isleme gorevi.

Named Entity Recognition (NER / Isimli Varlik Tanima), bir metin parcasindaki kisi adlarini, yer adlarini, kurum isimlerini, tarihleri, para miktarlarini ve diger belirli varlik kategorilerini otomatik olarak tespit edip etiketleyen bir dogal dil isleme gorevidir. Anlam cikarmada temel bir adim olan NER, ham metinden yapisal bilgi uretmenin en onemli araclarindan biridir. Ornegin "Elon Musk 2024 yilinda Tesla'nin CEO'sunu degistirdi" cumlesinde NER sistemi "Elon Musk"i PERSON, "Tesla"yi ORG, "2024 yilinda"yi DATE olarak etiketler. Bu etiketleme; bilgi grafikleri olusturma, soru yanıtlama, belge ozetleme, biyomedikal veri analizi ve haber izleme gibi sistemlerin temel girdisini olusturur. NER yaklasimlar tarihsel olarak uc kusakta gelismistir. Ilk kusak kural tabanli sistemler el ile yazilmis duzenli ifadeler ve sozlukler kullaniyordu; bakimi guc ve yeni alanlara genellemesi zayifdi. Ikinci kusak istatistiksel modeller (Conditional Random Fields, CRF) elle hazirlanmis dilbilimsel ozellikler ve egriltilmis egitim verisi gerektiriyordu; CoNLL-2003 yarismasi bu donemde NER arastirmasinin referans noktasiydi. Ucuncu kusak derin ogrenme modelleri, ozellikle BiLSTM-CRF mimarisi, el ozellikleri ihtiyacini ortadan kaldirdi ve durum sanatini ileriye tasidi. BERT ve diger Transformer modelleri 2018 sonrasinda hemen hemen tum benchmark'larda BiLSTM-CRF'yi gecmistir. Guncel NER uygulamalarinda spaCy kutuphanesi gercek zamanli ve hafif kullanim icin yaygin tercih olurken Hugging Face Transformers ekosistemi token siniflandirma gorevi olarak egitilmis veya ince ayarlanmis modelleri kolayca kullanimakta sunar. Biyomedikal ve hukuk gibi alana ozgul sistemlerde genel NER modelleri yetersiz kalabilir; bu durumda alan verisiyle ince ayar veya sifirdan egitim gereklidir. NER'in pratik zorluklar arasinda belirsizlik onemsenmistir: "Apple" sirket mi yoksa meyve mi, "Paris" sehir mi yoksa kisi mi? Baglam penceresi ve coreference resolution bu belirsizlikleri cozmede kritik rol oynar. **Sik Sorulan Sorular** **NER ile metin siniflandirma arasindaki fark nedir?** Metin siniflandirma bir belgeye veya cumleye kresek bir etiket atar (pozitif/negatif duygu gibi). NER ise metin icerisindeki belirli token dizilerini bulur ve etiketler; mekanizma token duzeyinde calisir. **NER ciktilarini nasil degerlendiririm?** F1 skoru standart metrik olup hem tam eslesme hem de tur dogrulugunu gerektirir. Precision, modelin isaretledigi varliklarin ne kadari gercekten dogru; recall, gercek varliklarin ne kadari tespit edildi. **spaCy mi Transformers mi kullanayim?** Hiz ve hafiflik kritikse spaCy, maksimum dogruluk gerekiyorsa BERT tabanli model; her ikisini de deneyip belirli verinizde benchmark yapmak onerilen pratiktir. **NER her dilde esit iyi calisir mi?** Hayir. Turkce gibi morfolojik zengin dillerde NER daha zordur; kelime sinirlarinin belirlenmesi ve ek yapilari modeli zorlar. Dile ozgu veya cok dilli on egitimli modeller kullanmak sonuclari iyilestirir.

NER Nedir?

Named Entity Recognition (NER), metin icerisindeki kisi adlarini, yer adlarini, kurum isimlerini, tarihleri ve diger belirli varlik kategorilerini otomatik olarak taniyan ve siniflandiran bir dogal dil isleme gorevidir. Ham metinden yapisal bilgi uretmenin temel adimlarindan biridir: bir cumledeki hangi kelimelerin belirli bir anlam tasıyan varlik oldugunu tespit eder. Bilgi grafikleri, soru yanıtlama, belge analizi ve arama motorlari NER ciktisini temel girdi olarak kullanir.

Nasil Calisir?

Modern NER modelleri token siniflandirma gorevi olarak formulle edilir: her kelime (token) bir etiket alir. BIO (Beginning-Inside-Outside) etiket sema en yaygin formattir; ornegin 'Elon' B-PER, 'Musk' I-PER, 'CEO' O etiketi alir. Transformer modelleri (BERT, RoBERTa) her token icin baglamsallasmis vektor uretir ve bir siniflandirici katmani bu vektoru etiketle eslestirir. Egitim verisinde etiketli metin ornekleri bu eslestirmeyi optimize eder.

Tarihsel Gelisim

Kural tabanli sistemlerden CRF'e (Conditional Random Fields), BiLSTM-CRF'e ve nihayetinde Transformer modellerine uzanan NER evrimi, genel NLP ilerlemenin bir aynasidur. CoNLL-2003 benchmark'i, PER/ORG/LOC/MISC kategorilerinde on yillar boyunca referans olmustur. BERT (2018) ile Transformer modellerinin CoNLL-2003'te insan performansina ulasip gecmesi, NER disiplininde bir donusum noktasiydi. Gunumuzde BERT veya RoBERTa tabanli modeller production NER'in standart baslangiç noktasidur.

Kullanim Alanlari ve Zorluklar

NER biyomedikal veri analizinde gen ve hastalik adlarini cikarirken finans uygulamalarinda sirket ve para birimlerini, haber izleme sistemlerinde kisi ve kurumlari tanir. Belirsizlik yonetimi onemli bir zorluktur: 'Apple' sirket mi meyve mi, 'Paris' sehir mi kisi mi sorusu baglama bakarak cevaplanmalidir. Turkce gibi morfolojik zengin dillerde kelime sinirlarinin belirlenmesi ve eklerin islenmesi ek karmasiklik yaratir; dile ozgul veya cok dilli modeller bu durumda tercih edilir.

Adlandırılmış Varlık Tanıma Yaklaşımları

Kural Tabanlı

Sözlük listeleri ve regex desenleriyle hızlı, yorumlanabilir NER; alan değişimlerine karşı kırılgan.

CRF Modelleri

Koşullu rastgele alanlar token dizilerini etiketler; özellik mühendisliği gerektirir ama sağlamdır.

BERT Tabanlı

Bağlamsal gömüler sayesinde belirsizlikleri çözer; az etiketli veriyle yüksek doğruluk sağlar.

LLM Few-Shot

GPT-4 gibi modeller birkaç örnekle sıfır eğitimden varlıkları tanır; esnek ama maliyetli.

help Sik Sorulan Sorular

  • check_circle NER ile metin siniflandirma arasindaki fark nedir? Metin siniflandirma bir belgeye kresek etiket atar. NER ise metin icerisindeki belirli token dizilerini bulur ve etiketler; mekanizma token duzeyinde calisir.
  • check_circle NER ciktilarini nasil degerlendiririm? F1 skoru standart metrik olup hem tam eslesme hem de tur dogrulugunu gerektirir. Precision dogru isaretlemeleri, recall gercek varliklarin tespitini olcer.
  • check_circle spaCy mi Transformers mi kullanayim? Hiz ve hafiflik kritikse spaCy; maksimum dogruluk gerekiyorsa BERT tabanli model tercih edilir. Her ikisini kendi verinizde benchmark yapmaniz onerilen pratiktir.
  • check_circle NER her dilde esit iyi calisir mi? Hayir. Turkce gibi morfolojik zengin dillerde NER daha zordur. Dile ozgu veya cok dilli on egitimli modeller kullanmak sonuclari iyilestirir.