Towards a diachronic analysis of Romance morphology through Google n-grams
L’article présente les premiers résultats de l’analyse de la plus récente version des n-grammes de Google italiens et français (GN, 2020), dans le cadre d’un projet qui vise à construire, à partir des données brutes, un ensemble de dictionnaires électroniques disponibles en libre accès qui faciliter...
Uloženo v:
| Vydáno v: | URI:https://journals.openedition.org/corpus, |
|---|---|
| Hlavní autor: | |
| Médium: | Article ou chapitre numérique |
| Jazyk: | Anglais |
| Vydáno: |
Corpus
2022
|
| Témata: | |
| On-line přístup: | Accès Université d'Orléans et IFPM Accès Université d'Orléans et IFPM |
| Shrnutí: | L’article présente les premiers résultats de l’analyse de la plus récente version des n-grammes de Google italiens et français (GN, 2020), dans le cadre d’un projet qui vise à construire, à partir des données brutes, un ensemble de dictionnaires électroniques disponibles en libre accès qui faciliteraient l’utilisation des GN pour la recherche diachronique en morphologie lexicale. L’analyse de dizaines de millions de n-grammes révèle que les GN italiens et français contiennent respectivement 2,7 et 3,7 millions de formes de mots uniques avec l’information sur leur fréquence dans les livres publiés, en fonction de l’année de publication du livre correspondant sur une période d’environ 500 ans. L’article décrit également la procédure d’extraction des données concernant les mots complexes dont les composants sont écrits séparément. |
|---|