À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé

La linguistique de corpus tire largement profit des avancées de l’informatique dans le traitement des données. Toutefois, pour le linguiste ordinaire le recours aux étiqueteurs morphosyntaxiques comporte toujours une part de mystère et de magie. Si, muni de cet outil, il peut travailler sur des donn...

Mô tả đầy đủ

Đã lưu trong:
Chi tiết về thư mục
Xuất bản năm:URI:https://journals.openedition.org/corpus,
Tác giả chính: Surcouf, Christian
Định dạng: Article ou chapitre numérique
Được phát hành: Corpus 2025
Những chủ đề:
Truy cập trực tuyến:Accès Université d'Orléans et IFPM
Accès Université d'Orléans et IFPM
id openedition-oai:revues.org:corpus_9607
record_format openedition
collection OpenEdition Journal
format Article ou chapitre numérique
building 0/Bibliothèque numérique/
1/Bibliothèque numérique/OpenEdition Journals/
topic spoken French
POS tagging
noise
silence
present tense
subjunctive present tense
TreeTagger
Dismo
precision
recall
bruit
silence
subjonctif présent
indicatif présent
étiquetage automatique
partie du discours
TreeTagger
Dismo
précision
rappel
corpus de français parlé
spellingShingle spoken French
POS tagging
noise
silence
present tense
subjunctive present tense
TreeTagger
Dismo
precision
recall
bruit
silence
subjonctif présent
indicatif présent
étiquetage automatique
partie du discours
TreeTagger
Dismo
précision
rappel
corpus de français parlé
Surcouf, Christian
À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé
description La linguistique de corpus tire largement profit des avancées de l’informatique dans le traitement des données. Toutefois, pour le linguiste ordinaire le recours aux étiqueteurs morphosyntaxiques comporte toujours une part de mystère et de magie. Si, muni de cet outil, il peut travailler sur des données massives, il ignore cependant comment ont été attribuées les étiquettes, et plus fondamentalement quelles erreurs peuvent avoir surgi durant l’étiquetage. Pourtant, de la qualité de cet étiquetage va dépendre en aval celle des résultats exploités pour les analyses. S’il est relativement aisé de repérer le bruit dans les résultats des requêtes, le silence qui en découle ailleurs est quant à lui beaucoup plus insidieux, difficile à pister, et pour cette raison potentiellement plus dommageable pour les analyses linguistiques. Dans notre étude, sur la base d’un corpus de dix heures de français parlé (surveillé et ordinaire), nous avons comparé l’étiquetage manuel des occurrences du Subjonctif Présent avec l’étiquetage fourni par TreeTagger, TreeTagger-TCOF et Dismo. Nous montrerons que le bruit dans l’étiquetage de l’Indicatif Présent est l’origine principale de l’important taux de silence dans l’étiquetage du Subjonctif Présent, les confusions étant dues – comme le révèle notre examen exhaustif de la conjugaison du Subjonctif Présent parmi les 6 500 verbes du Petit Robert – à des formes orthographiques communes avec l’Indicatif Présent. Pourtant la « précision » des étiqueteurs est souvent présentée comme atteignant des scores autour de 95 % (y compris pour le français parlé). Si les taux de « précision » oscillent ici entre 70 % et 99 %, les taux de « rappel », eux, sont beaucoup plus faibles : de 44 % à 61 %. En définitive, malgré sa dénomination avantageuse, le taux dit de « précision », calculé sur l’ensemble des étiquettes, constitue un indicateur médiocre de la qualité de l’étiquetage quand il s’agit d’une étiquette particulière comme celle du SubjPr.
author Surcouf, Christian
author_facet Surcouf, Christian
author_sort Surcouf, Christian
title À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé
title_short À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé
title_full À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé
title_fullStr À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé
title_full_unstemmed À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé
title_sort à pas de loup dans la bergerie… la problématique du silence et du bruit dans l’étiquetage automatique du subjonctif présent en français parlé
publisher Corpus
publishDate 2025
container_title URI:https://journals.openedition.org/corpus
url https://ezproxy.univ-orleans.fr/login?url=https://doi.org/10.4000/1364w
https://ezproxy.univ-orleans.fr/login?url=https://journals.openedition.org/corpus/9607
_version_ 1877292144089104384
spelling openedition-oai:revues.org:corpus_9607 https://doi.org/10.4000/1364w urn:doi:10.4000/1364w https://journals.openedition.org/corpus/9607 2025-01-27T01:00:00Z info:eu-repo/semantics/openAccess article info:eu-repo/semantics/article urn:handle:20.500.13089/1364w All rights reserved À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé Corpus Bases, corpus, langage - UMR 7320 info:eu-repo/semantics/reference/issn/1765-3126 info:eu-repo/semantics/reference/issn/1638-9808 URI:https://journals.openedition.org/corpus Surcouf, Christian spoken French POS tagging noise silence present tense subjunctive present tense TreeTagger Dismo precision recall bruit silence subjonctif présent indicatif présent étiquetage automatique partie du discours TreeTagger Dismo précision rappel corpus de français parlé La linguistique de corpus tire largement profit des avancées de l’informatique dans le traitement des données. Toutefois, pour le linguiste ordinaire le recours aux étiqueteurs morphosyntaxiques comporte toujours une part de mystère et de magie. Si, muni de cet outil, il peut travailler sur des données massives, il ignore cependant comment ont été attribuées les étiquettes, et plus fondamentalement quelles erreurs peuvent avoir surgi durant l’étiquetage. Pourtant, de la qualité de cet étiquetage va dépendre en aval celle des résultats exploités pour les analyses. S’il est relativement aisé de repérer le bruit dans les résultats des requêtes, le silence qui en découle ailleurs est quant à lui beaucoup plus insidieux, difficile à pister, et pour cette raison potentiellement plus dommageable pour les analyses linguistiques. Dans notre étude, sur la base d’un corpus de dix heures de français parlé (surveillé et ordinaire), nous avons comparé l’étiquetage manuel des occurrences du Subjonctif Présent avec l’étiquetage fourni par TreeTagger, TreeTagger-TCOF et Dismo. Nous montrerons que le bruit dans l’étiquetage de l’Indicatif Présent est l’origine principale de l’important taux de silence dans l’étiquetage du Subjonctif Présent, les confusions étant dues – comme le révèle notre examen exhaustif de la conjugaison du Subjonctif Présent parmi les 6 500 verbes du Petit Robert – à des formes orthographiques communes avec l’Indicatif Présent. Pourtant la « précision » des étiqueteurs est souvent présentée comme atteignant des scores autour de 95 % (y compris pour le français parlé). Si les taux de « précision » oscillent ici entre 70 % et 99 %, les taux de « rappel », eux, sont beaucoup plus faibles : de 44 % à 61 %. En définitive, malgré sa dénomination avantageuse, le taux dit de « précision », calculé sur l’ensemble des étiquettes, constitue un indicateur médiocre de la qualité de l’étiquetage quand il s’agit d’une étiquette particulière comme celle du SubjPr. Corpus linguistics has benefited greatly from advances in data processing. However, for the ordinary linguist, the use of morphosyntactic taggers still carries a certain element of mystery and magic. Equipped with this tool, the linguist can work on massive data, but is mostly unaware of how the labels were assigned, and more fundamentally, what errors may have arisen during labeling. And yet, the quality of the labeling process will determine the quality of the results used for analysis. While noise is fairly easy to detect in tagged data, the resulting silence elsewhere is much more insidious, difficult to track down, and therefore potentially more damaging to linguistic analyses. In our study, we compared our manual tagging of Subjunctive Present occurrences in a ten-hour corpus of spoken French with the tagging provided by TreeTagger, TreeTagger-TCOF and Dismo. We'll show that noise in the tagging of the Present tense is the main cause of the high rate of silence in the tagging of the Subjunctive, the confusions being due –as revealed by our exhaustive analysis of the Subjunctive Present forms of the 6500 verbs in the Petit Robert dictionary– to common orthographic forms with the Present tense. Yet the “precision” of taggers is often presented as reaching scores of around 95% (including for spoken French). While “precision” rates here range from 70% to 99%, “recall” rates are much lower: from 44% to 61%. In short, despite its name, the so-called “precision” rate, calculated on all tags, is a poor indicator of the quality of tagging when it comes to a specific label such as SubjPr.