Published February 28, 2023 | Version v1.2

Jeu de données de segmentation non normalisée- castillan médiéval

  • 1. ENS de Lyon

Description

Jeu de données de segmentation/tokénisation sur un corpus non régularisé en sortie d'HTR/OCR. Castillan médiéval (15e siècle); manuscrit (deux témoins,55%) et incunable (un témoin, 45%). Les normes de segmentation sont celles du castillan actuel.

Le jeu de données fait environ 37.000 lignes pour l'instant. Il est produit à partir de mon corpus de thèse.

Le corpus provient de deux manuscrits et d'un incunable qui contiennent le Regimiento de los prínçipes.

  • Val_S: Ms. 251, Universidad de Valladolid. Fols 1r-27r et 175r-197v.
  • Sev_Z: Inc/901, Bibliothèque Nationale d'Espagne. Fols 1r-114r et 153r-249v.
  • Mad_A: Inv. 15304, Bibliothèque de la Fundación Lázaro Galdiano, fols. 237v-274v.
  • Sal_L: Ms 2709, Bibliothèque Universitaire de Salamanque, fols. 365r-391r.

Le corpus peut difficilement servir pour l'étude du texte. Les changements de folio ne sont pas toujours indiqués; certaines lignes trop mal transcrites ont été supprimées.

Citer le corpus

Merci de citer ma thèse de doctorat si vous utilisez ce corpus:

Matthias Gille Levenson, La version B du Regimiento de los prínçipes glosé (1374-1494) : étude et éditions de la partie sur le gouvernement de la cité par temps de guerre (III,3), thèse de doctorat en préparation sous la direction de Carlos Heusch et de Jesús R. Velasco

Files

corpus.zip

Files (513.1 kB)

Name Size Download all
md5:1eb82ad0e7c42e56cf8b27b706929d25
513.1 kB Preview Download