Published April 15, 2022 | Version v1

Multilingual named entity recognition for medieval charters. Datasets and models

Authors/Creators

  • 1. École nationale des chartes

Description

Annotated dataset for training named entities recognition models for medieval charters in Latin, French and Spanish.

 

The original raw texts for all charters were collected from four charters collections

- HOME-ALCAR corpus : https://zenodo.org/record/5600884

- CBMA : http://www.cbma-project.eu

- Diplomata Belgica : https://www.diplomata-belgica.be

- CODEA corpus : https://corpuscodea.es/

 

We include (i) the annotated training datasets, (ii) the contextual and static embeddings trained on medieval multilingual texts and (iii) the named entity recognition models trained using two architectures: Bi-LSTM-CRF + stacked embeddings and fine-tuning on Bert-based models (mBert and RoBERTa)

Codes, datasets and notebooks used to train models can be consulted in our gitlab repository: https://gitlab.com/magistermilitum/ner_medieval_multilingual

Our best RoBERTa model is also available in the HuggingFace library: https://huggingface.co/magistermilitum/roberta-multilingual-medieval-ner

Files

Multilingual_NER_medieval_charters.zip

Files (15.0 GB)

Name Size
md5:d4eb6cb69d5a9d374d6b60b69fd157eb
15.0 GB Preview Download