Towards a diachronic analysis of Romance morphology through Google n-grams

L’article présente les premiers résultats de l’analyse de la plus récente version des n-grammes de Google italiens et français (GN, 2020), dans le cadre d’un projet qui vise à construire, à partir des données brutes, un ensemble de dictionnaires électroniques disponibles en libre accès qui faciliter...

Celý popis

Uloženo v:
Podrobná bibliografie
Vydáno v:URI:https://journals.openedition.org/corpus,
Hlavní autor: Radimský, Jan
Médium: Article ou chapitre numérique
Jazyk:Anglais
Vydáno: Corpus 2022
Témata:
On-line přístup:Accès Université d'Orléans et IFPM
Accès Université d'Orléans et IFPM
Popis
Shrnutí:L’article présente les premiers résultats de l’analyse de la plus récente version des n-grammes de Google italiens et français (GN, 2020), dans le cadre d’un projet qui vise à construire, à partir des données brutes, un ensemble de dictionnaires électroniques disponibles en libre accès qui faciliteraient l’utilisation des GN pour la recherche diachronique en morphologie lexicale. L’analyse de dizaines de millions de n-grammes révèle que les GN italiens et français contiennent respectivement 2,7 et 3,7 millions de formes de mots uniques avec l’information sur leur fréquence dans les livres publiés, en fonction de l’année de publication du livre correspondant sur une période d’environ 500 ans. L’article décrit également la procédure d’extraction des données concernant les mots complexes dont les composants sont écrits séparément.