Finding Relatedness: pathways for detecting textual relatedness in the medieval scholastic corpus

Pour montrer l’importance de préparer d’abord les éditions historiques sous forme de données textuelles, tout en laissant la présentation (que ce soit sous forme imprimée ou sur le Web) comme une tâche secondaire en aval, cet article identifie les résultats bénéfiques pour la recherche qui peuvent ê...

Description complète

Enregistré dans:
Détails bibliographiques
Dans:URI:https://journals.openedition.org/methodos,
Auteur principal: Witt, Jeffrey C.
Format: Article ou chapitre numérique
Langue:Anglais
Publié: Methodos 2024
Sujets:
Accès en ligne:Accès Université d'Orléans et IFPM
Accès Université d'Orléans et IFPM
Description
Résumé:Pour montrer l’importance de préparer d’abord les éditions historiques sous forme de données textuelles, tout en laissant la présentation (que ce soit sous forme imprimée ou sur le Web) comme une tâche secondaire en aval, cet article identifie les résultats bénéfiques pour la recherche qui peuvent être obtenus grâce à l’analyse informatique lorsqu’un tel corpus de données textuelles est à portée de main. En mettant l’accent sur la profonde intertextualité caractéristique du corpus scolastique médiéval, il passe en revue trois méthodes distinctes pour détecter différentes formes de relation textuelle au sein du corpus : les intersections de n-grammes, les “document embeddings” et la convolution. Dans chaque cas, une attention particulière est accordée à la façon dont la disponibilité d'un “knowledge graph” spécifique à un domaine nous aide à la fois à préparer correctement le corpus pour l'analyse et à visualiser les résultats de manière à améliorer la recherche. Ces résultats incluent l’observation des tendances dans les pratiques de citation dans différents genres et sous-genres du corpus, le regroupement automatique des questions par similarité et la détection d’une réutilisation textuelle soutenue et non citée.