Enjeux des corpus bilingues en diachronie longue : l’exemple du projet MICLE
La multiplication des très grands corpus en linguistique historique a entraîné des discussions nombreuses sur les procédures d’annotation et les métadonnées associées, notamment concernant les questions relevant de l’étiquetage morphosyntaxique et de la tokenisation. D’autres sujets cruciaux, en rev...
সংরক্ষণ করুন:
| প্রকাশিত: | URI:https://journals.openedition.org/corpus, |
|---|---|
| প্রধান লেখক: | |
| বিন্যাস: | Article ou chapitre numérique |
| প্রকাশিত: |
Corpus
2024
|
| বিষয়গুলি: | |
| অনলাইন ব্যবহার করুন: | Accès Université d'Orléans et IFPM Accès Université d'Orléans et IFPM |
| সংক্ষিপ্ত: | La multiplication des très grands corpus en linguistique historique a entraîné des discussions nombreuses sur les procédures d’annotation et les métadonnées associées, notamment concernant les questions relevant de l’étiquetage morphosyntaxique et de la tokenisation. D’autres sujets cruciaux, en revanche, semblent moins abordés, comme la question de la découpe en propositions ou en « phrases » des données linguistiques, la préservation des informations philologiques ou, encore, la question de l’encodage et des formats de données. Notre contribution explore ces thématiques en prenant exemple sur le corpus MICLE, qui a dû résoudre des difficultés inédites au long de sa constitution. |
|---|