La question de la normalisation des écrits scolaires pour leur traitement automatique. Le cas de l’omission de mots

Cette contribution porte sur le traitement du bruit provoqué par les omissions de mots dans un corpus d’écrits scolaires en vue de leur traitement automatique. Même si une étape de normalisation rend possible le traitement de ces textes très fautifs, certains éléments de langage demeurent difficiles...

Ful tanımlama

Kaydedildi:
Detaylı Bibliyografya
Yayımlandı:URI:https://journals.openedition.org/corpus,
Asıl Yazarlar: Barletta, Martina, Ponton, Claude
Materyal Türü: Article ou chapitre numérique
Baskı/Yayın Bilgisi: Corpus 2025
Konular:
Online Erişim:Accès Université d'Orléans et IFPM
Accès Université d'Orléans et IFPM
Diğer Bilgiler
Özet:Cette contribution porte sur le traitement du bruit provoqué par les omissions de mots dans un corpus d’écrits scolaires en vue de leur traitement automatique. Même si une étape de normalisation rend possible le traitement de ces textes très fautifs, certains éléments de langage demeurent difficiles à appréhender notamment dans le cas où le scripteur omet des mots dans le texte. Nous proposons dans cette contribution trois méthodes possibles de traitement automatique ou semi-automatique pour résoudre cette problématique : (1) méthode exploitant un token « masque » de forme xxx ; (2) méthode semi-automatisée où chaque catégorie morpho-syntaxique proposée lors de la normalisation est remplacée par le même « mot prototypique » ; (3) méthode FlauBERT où le modèle de langage est utilisé pour « reconstruire » le token le plus probable dans le texte. Nous évaluons de manière quantitative ces trois méthodes pour ensuite présenter qualitativement les résultats obtenus à travers la méthode (3), la plus efficace dans le contexte de notre recherche.