Enjeux des corpus bilingues en diachronie longue : l’exemple du projet MICLE

La multiplication des très grands corpus en linguistique historique a entraîné des discussions nombreuses sur les procédures d’annotation et les métadonnées associées, notamment concernant les questions relevant de l’étiquetage morphosyntaxique et de la tokenisation. D’autres sujets cruciaux, en rev...

সম্পূর্ণ বিবরণ

সংরক্ষণ করুন:
গ্রন্থ-পঞ্জীর বিবরন
প্রকাশিত:URI:https://journals.openedition.org/corpus,
প্রধান লেখক: Goux, Mathieu
বিন্যাস: Article ou chapitre numérique
প্রকাশিত: Corpus 2024
বিষয়গুলি:
অনলাইন ব্যবহার করুন:Accès Université d'Orléans et IFPM
Accès Université d'Orléans et IFPM
বিবরন
সংক্ষিপ্ত:La multiplication des très grands corpus en linguistique historique a entraîné des discussions nombreuses sur les procédures d’annotation et les métadonnées associées, notamment concernant les questions relevant de l’étiquetage morphosyntaxique et de la tokenisation. D’autres sujets cruciaux, en revanche, semblent moins abordés, comme la question de la découpe en propositions ou en « phrases » des données linguistiques, la préservation des informations philologiques ou, encore, la question de l’encodage et des formats de données. Notre contribution explore ces thématiques en prenant exemple sur le corpus MICLE, qui a dû résoudre des difficultés inédites au long de sa constitution.