tag NER
Entity Extraction (Varlık Çıkarımı (Entity Extraction))
Bu sayfada NER (Entity Extraction (Varlık Çıkarımı (Entity Extraction))) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.
Varlık çıkarımı (Entity Extraction), doğal dil işleme (NLP) alanında yapılandırılmamış metinlerden adlandırılmış varlıkları — kişi adları, kurum adları, coğrafi konumlar, tarihler, ürün adları gibi — otomatik olarak tespit etme ve sınıflandırma sürecidir. İsimli Varlık Tanıma (Named Entity Recognition — NER) olarak da bilinir. Teknik açıdan NER, her tokeni BIO (Beginning-Inside-Outside) veya BIOES şemasıyla etiketleyen bir dizi etiketleme problemidir. Geleneksel yöntemler kural tabanlı düzenli ifadeler ve istatistiksel Koşullu Rastsal Alanlar (CRF) üzerine kuruluydu. BiLSTM-CRF mimarisi, bağlamsal özellik öğrenmeyi CRF etiket tutarlılığıyla birleştirerek 2010'ların NER standardı oldu. 2019'dan itibaren BERT tabanlı token sınıflandırması bu mimarinin büyük bölümünün yerini aldı; alan-özgü varlık türleri (tıbbi terminoloji, hukuki belgeler) için ince ayarlı BERT modelleri güçlü seçenek olmaya devam etmektedir. Modern LLM tabanlı yaklaşımlarda süreç kökten basitleşmiştir: GPT-4 veya Claude'a few-shot örnekler vererek ya da structured output (JSON mod) kullanarak sıfır veya az örnekten yüksek kaliteli NER sonuçları elde etmek mümkündür. Bu yaklaşım özellikle özel ontoloji ve az kaynaklı dillerde esneklik sağlar. Varlık çıkarımı doğrudan metinsel bağlamdan bilgi grafiği oluşturma sürecinin temelidir. GraphRAG akışında belge parçalarından varlık çiftleri çıkarılır, ilişkileri belirlenir ve bunlar bir bilgi grafiğine dönüştürülür. Topluluk tespiti ve özetleme aşamalarının girdisini bu varlık-ilişki üçlüleri oluşturur. Türkçe NER'da eklemeli dil yapısı ek bir zorluk katmanı ekler: token sınırları belirsizleşebilir ve özel isimler büyük harf kuralını her zaman izlemeyebilir. BERTurk tabanlı ince ayar veya LLM'in JSON çıktı moduyla birkaç örnekten öğrenme en pratik seçeneklerdir. Değerlendirme span bazlı F1 skoru ile yapılır; kesinlik (precision) ve geri çağırma (recall) her varlık tipi için ayrı raporlanır. CoNLL-2003 ve OntoNotes bu alanın standart kıyaslama veri kümeleridir.
Entity Extraction (Varlık Çıkarımı (Entity Extraction))
Varlık çıkarımı (Entity Extraction), doğal dil işleme (NLP) alanında yapılandırılmamış metinlerden adlandırılmış varlıkları — kişi adları, kurum adları, coğrafi konumlar, tarihler, ürün adları gibi — otomatik olarak tespit etme ve sınıflandırma sürecidir. İsimli Varlık Tanıma (Named Entity Recognition — NER) olarak da bilinir. Teknik açıdan NER, her tokeni BIO (Beginning-Inside-Outside) veya BIOES şemasıyla etiketleyen bir dizi etiketleme problemidir. Geleneksel yöntemler kural tabanlı düzenli ifadeler ve istatistiksel Koşullu Rastsal Alanlar (CRF) üzerine kuruluydu. BiLSTM-CRF mimarisi, bağlamsal özellik öğrenmeyi CRF etiket tutarlılığıyla birleştirerek 2010'ların NER standardı oldu. 2019'dan itibaren BERT tabanlı token sınıflandırması bu mimarinin büyük bölümünün yerini aldı; alan-özgü varlık türleri (tıbbi terminoloji, hukuki belgeler) için ince ayarlı BERT modelleri güçlü seçenek olmaya devam etmektedir. Modern LLM tabanlı yaklaşımlarda süreç kökten basitleşmiştir: GPT-4 veya Claude'a few-shot örnekler vererek ya da structured output (JSON mod) kullanarak sıfır veya az örnekten yüksek kaliteli NER sonuçları elde etmek mümkündür. Bu yaklaşım özellikle özel ontoloji ve az kaynaklı dillerde esneklik sağlar. Varlık çıkarımı doğrudan metinsel bağlamdan bilgi grafiği oluşturma sürecinin temelidir. GraphRAG akışında belge parçalarından varlık çiftleri çıkarılır, ilişkileri belirlenir ve bunlar bir bilgi grafiğine dönüştürülür. Topluluk tespiti ve özetleme aşamalarının girdisini bu varlık-ilişki üçlüleri oluşturur. Türkçe NER'da eklemeli dil yapısı ek bir zorluk katmanı ekler: token sınırları belirsizleşebilir ve özel isimler büyük harf kuralını her zaman izlemeyebilir. BERTurk tabanlı ince ayar veya LLM'in JSON çıktı moduyla birkaç örnekten öğrenme en pratik seçeneklerdir. Değerlendirme span bazlı F1 skoru ile yapılır; kesinlik (precision) ve geri çağırma (recall) her varlık tipi için ayrı raporlanır. CoNLL-2003 ve OntoNotes bu alanın standart kıyaslama veri kümeleridir.
Named Entity Recognition (Adlandırılmış Varlık Tanıma)
Named Entity Recognition (NER), kısaca Adlandırılmış Varlık Tanıma, bir metindeki önceden tanımlanmış kategorilere ait varlık ifadelerini otomatik olarak tespit eden ve sınıflandıran temel bir Doğal Dil İşleme görevidir. NER, kişi adlarını (PER), coğrafi konumları (LOC), kuruluş isimlerini (ORG), tarih ve zaman ifadelerini (DATE/TIME) ile para birimlerini (MONEY) ham metin içinden çıkarır. Bu teknoloji, büyük hacimli yapılandırılmamış metni anlamlı ve işlenebilir yapıya dönüştürmek için kritik bir adım işlevi görür. NER'in tarihsel gelişimine bakıldığında ilk sistemlerin 1996 MUC-6 konferansında tanımlanan kurallara dayalı yaklaşımları benimsediği görülür. Bu erken sistemler elle yazılmış düzenli ifadeler ve sözcük listeleri kullanıyordu; İngilizce için kabul edilebilir sonuçlar verse de yeni alanlara uyarlamak son derece maliyetliydi. 2000'lerin başında Koşullu Rastgele Alanlar (CRF) ve Maksimum Entropi gibi istatistiksel modeller kurallı sistemlerin yerini almaya başladı; bu modeller etiketlenmiş eğitim verisinden bağlamsal örüntüler öğreniyor ve genelleme yapabiliyordu. BERT'in 2018'de yayımlanmasıyla NER alanında çığır açıldı. BERT ve sonraki dil modelleri, hem sol hem de sağ bağlamı aynı anda işleyen çift yönlü dikkat mekanizmaları aracılığıyla varlık sınırlarını çok daha doğru tespit edebildi. Günümüzde CoNLL-2003 gibi standart kıyaslama veri kümelerinde F1 puanları yüzde doksan beşi aşmaktadır. BIO etiketleme şeması, varlık sınırlarını açık biçimde kodlaması sayesinde model eğitiminde en yaygın kullanılan standarttır. Türkçe NER için BERTurk ve mBERT modellerini temel alan sistemler geliştirilmiş; tıp, hukuk ve finans gibi alana özel veri kümeleri oluşturulmuştur. Türkçe'nin çekimli ve bitişken yapısı, varlık sınırlarının belirlenmesini İngilizce'ye kıyasla daha güç kılar; bu nedenle alt sözcük tokenizasyon stratejileri kritik önem taşır. NER, bilgi grafiği oluşturma, soru yanıtlama, metin özetleme ve duygu analizi gibi ileri düzey NLP görevlerinin vazgeçilmez bir ön adımıdır.