Annotation de textes d’états de langue anciens : pour le redéploiement de l’existant

Dans le cadre de la construction du corpus PhraseoRoChe, un corpus diachronique rassemblant des romans de chevalerie du 13e au 17e siècle, cet article s’intéresse aux performances de différents analyseurs (étiqueteurs, lemmatiseurs, parseurs en dépendances) entrainés sur des états de langue connexes...

Szczegółowa specyfikacja

Zapisane w:
Opis bibliograficzny
Wydane w:URI:https://journals.openedition.org/corpus,
Główni autorzy: Renwick, Adam, Kraif, Olivier
Format: Article ou chapitre numérique
Wydane: Corpus 2024
Hasła przedmiotowe:
Dostęp online:Accès Université d'Orléans et IFPM
Accès Université d'Orléans et IFPM
Opis
Streszczenie:Dans le cadre de la construction du corpus PhraseoRoChe, un corpus diachronique rassemblant des romans de chevalerie du 13e au 17e siècle, cet article s’intéresse aux performances de différents analyseurs (étiqueteurs, lemmatiseurs, parseurs en dépendances) entrainés sur des états de langue connexes allant de l’ancien français au moyen français et au français moderne. Nous étudions ainsi la possibilité d’étendre ces analyseurs au-delà des états de langues précis sur lesquels ils ont été entrainés, en s’appuyant notamment sur les divergences entre analyseurs pour identifier les annotations les moins fiables, et ainsi prioriser les interventions manuelles de correction / validation des annotations automatiques. Nous étudions également les possibilités offertes par un traitement superficiel de modernisation graphique pour tirer parti d’un analyseur moderne appliqué à des états de langue anciens.