tag BilgiCikarma

Named Entity Recognition (Adlandırılmış Varlık Tanıma)

Bu sayfada BilgiCikarma (Named Entity Recognition (Adlandırılmış Varlık Tanıma)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Named Entity Recognition (NER), kısaca Adlandırılmış Varlık Tanıma, bir metindeki önceden tanımlanmış kategorilere ait varlıkları otomatik olarak tespit edip sınıflandıran temel bir Doğal Dil İşleme (NLP) tekniğidir. Bu kategoriler tipik olarak kişi adlarını (PER), kuruluşları (ORG), coğrafi yerleri (LOC), tarihleri ve para değerlerini kapsar. NER'in kökleri 1996'daki MUC-6 (Message Understanding Conference) konferansına dayanır; ilk sistemler kural tabanlı yaklaşımlar kullanıyordu. 2000'lerde Koşullu Rastgele Alan (CRF — Conditional Random Field) modellerinin yaygınlaşmasıyla istatistiksel yöntemler baskın hale geldi. Asıl dönüşüm ise 2018'de Google'ın BERT modelini yayımlamasıyla yaşandı; transformer mimarisi NER doğruluğunu dramatik biçimde artırdı. Günümüzde NER, BIO etiketleme şeması üzerinden çalışır: her token, varlığın Başlangıcı (B — Beginning), İç kısmı (I — Inside) veya Varlık Dışı (O — Outside) olarak işaretlenir. Örneğin "Boğaziçi Üniversitesi" ifadesi B-ORG ve I-ORG olarak etiketlenir. Modern BERT tabanlı modeller bu sınıflandırmayı token düzeyinde gerçekleştirerek %95+ F1 skoru elde eder. Türkçe için en yaygın kullanılan model BERTurk'tür. Stefan Schweter tarafından geliştirilen bu model, 35 GB Türkçe metinle eğitilmiş olup NER görevinde yaklaşık %97 doğruluk sağlamaktadır. Türkçe'nin eklemeli (agglutinative) yapısı NER'i güçleştirir; "Ankara'daki" gibi sözcükler tokenizasyon açısından özel dikkat gerektirir. NER'in uygulama alanları son derece geniştir: haber metinlerinden kişi ve kurum çıkarma, hukuk belgelerinde sözleşme taraflarını belirleme, sağlık alanında hasta-ilaç-hastalık tanıma ve arama motorlarında Knowledge Graph zenginleştirme bunların başında gelir. Büyük Dil Modelleri NER görevine girmeye başlasa da üretim ortamlarında BIO-encoder modeller hız ve güvenilirlik açısından hâlâ tercih edilmektedir.

code_blocks

Named Entity Recognition (Adlandırılmış Varlık Tanıma)

Named Entity Recognition (NER), kısaca Adlandırılmış Varlık Tanıma, bir metindeki önceden tanımlanmış kategorilere ait varlıkları otomatik olarak tespit edip sınıflandıran temel bir Doğal Dil İşleme (NLP) tekniğidir. Bu kategoriler tipik olarak kişi adlarını (PER), kuruluşları (ORG), coğrafi yerleri (LOC), tarihleri ve para değerlerini kapsar. NER'in kökleri 1996'daki MUC-6 (Message Understanding Conference) konferansına dayanır; ilk sistemler kural tabanlı yaklaşımlar kullanıyordu. 2000'lerde Koşullu Rastgele Alan (CRF — Conditional Random Field) modellerinin yaygınlaşmasıyla istatistiksel yöntemler baskın hale geldi. Asıl dönüşüm ise 2018'de Google'ın BERT modelini yayımlamasıyla yaşandı; transformer mimarisi NER doğruluğunu dramatik biçimde artırdı. Günümüzde NER, BIO etiketleme şeması üzerinden çalışır: her token, varlığın Başlangıcı (B — Beginning), İç kısmı (I — Inside) veya Varlık Dışı (O — Outside) olarak işaretlenir. Örneğin "Boğaziçi Üniversitesi" ifadesi B-ORG ve I-ORG olarak etiketlenir. Modern BERT tabanlı modeller bu sınıflandırmayı token düzeyinde gerçekleştirerek %95+ F1 skoru elde eder. Türkçe için en yaygın kullanılan model BERTurk'tür. Stefan Schweter tarafından geliştirilen bu model, 35 GB Türkçe metinle eğitilmiş olup NER görevinde yaklaşık %97 doğruluk sağlamaktadır. Türkçe'nin eklemeli (agglutinative) yapısı NER'i güçleştirir; "Ankara'daki" gibi sözcükler tokenizasyon açısından özel dikkat gerektirir. NER'in uygulama alanları son derece geniştir: haber metinlerinden kişi ve kurum çıkarma, hukuk belgelerinde sözleşme taraflarını belirleme, sağlık alanında hasta-ilaç-hastalık tanıma ve arama motorlarında Knowledge Graph zenginleştirme bunların başında gelir. Büyük Dil Modelleri NER görevine girmeye başlasa da üretim ortamlarında BIO-encoder modeller hız ve güvenilirlik açısından hâlâ tercih edilmektedir.

arrow_forward