À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé
La linguistique de corpus tire largement profit des avancées de l’informatique dans le traitement des données. Toutefois, pour le linguiste ordinaire le recours aux étiqueteurs morphosyntaxiques comporte toujours une part de mystère et de magie. Si, muni de cet outil, il peut travailler sur des donn...
Đã lưu trong:
| Xuất bản năm: | URI:https://journals.openedition.org/corpus, |
|---|---|
| Tác giả chính: | |
| Định dạng: | Article ou chapitre numérique |
| Được phát hành: |
Corpus
2025
|
| Những chủ đề: | |
| Truy cập trực tuyến: | Accès Université d'Orléans et IFPM Accès Université d'Orléans et IFPM |
| id |
openedition-oai:revues.org:corpus_9607 |
|---|---|
| record_format |
openedition |
| collection |
OpenEdition Journal |
| format |
Article ou chapitre numérique |
| building |
0/Bibliothèque numérique/ 1/Bibliothèque numérique/OpenEdition Journals/ |
| topic |
spoken French POS tagging noise silence present tense subjunctive present tense TreeTagger Dismo precision recall bruit silence subjonctif présent indicatif présent étiquetage automatique partie du discours TreeTagger Dismo précision rappel corpus de français parlé |
| spellingShingle |
spoken French POS tagging noise silence present tense subjunctive present tense TreeTagger Dismo precision recall bruit silence subjonctif présent indicatif présent étiquetage automatique partie du discours TreeTagger Dismo précision rappel corpus de français parlé Surcouf, Christian À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé |
| description |
La linguistique de corpus tire largement profit des avancées de l’informatique dans le traitement des données. Toutefois, pour le linguiste ordinaire le recours aux étiqueteurs morphosyntaxiques comporte toujours une part de mystère et de magie. Si, muni de cet outil, il peut travailler sur des données massives, il ignore cependant comment ont été attribuées les étiquettes, et plus fondamentalement quelles erreurs peuvent avoir surgi durant l’étiquetage. Pourtant, de la qualité de cet étiquetage va dépendre en aval celle des résultats exploités pour les analyses. S’il est relativement aisé de repérer le bruit dans les résultats des requêtes, le silence qui en découle ailleurs est quant à lui beaucoup plus insidieux, difficile à pister, et pour cette raison potentiellement plus dommageable pour les analyses linguistiques. Dans notre étude, sur la base d’un corpus de dix heures de français parlé (surveillé et ordinaire), nous avons comparé l’étiquetage manuel des occurrences du Subjonctif Présent avec l’étiquetage fourni par TreeTagger, TreeTagger-TCOF et Dismo. Nous montrerons que le bruit dans l’étiquetage de l’Indicatif Présent est l’origine principale de l’important taux de silence dans l’étiquetage du Subjonctif Présent, les confusions étant dues – comme le révèle notre examen exhaustif de la conjugaison du Subjonctif Présent parmi les 6 500 verbes du Petit Robert – à des formes orthographiques communes avec l’Indicatif Présent. Pourtant la « précision » des étiqueteurs est souvent présentée comme atteignant des scores autour de 95 % (y compris pour le français parlé). Si les taux de « précision » oscillent ici entre 70 % et 99 %, les taux de « rappel », eux, sont beaucoup plus faibles : de 44 % à 61 %. En définitive, malgré sa dénomination avantageuse, le taux dit de « précision », calculé sur l’ensemble des étiquettes, constitue un indicateur médiocre de la qualité de l’étiquetage quand il s’agit d’une étiquette particulière comme celle du SubjPr. |
| author |
Surcouf, Christian |
| author_facet |
Surcouf, Christian |
| author_sort |
Surcouf, Christian |
| title |
À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé |
| title_short |
À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé |
| title_full |
À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé |
| title_fullStr |
À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé |
| title_full_unstemmed |
À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé |
| title_sort |
à pas de loup dans la bergerie… la problématique du silence et du bruit dans l’étiquetage automatique du subjonctif présent en français parlé |
| publisher |
Corpus |
| publishDate |
2025 |
| container_title |
URI:https://journals.openedition.org/corpus |
| url |
https://ezproxy.univ-orleans.fr/login?url=https://doi.org/10.4000/1364w https://ezproxy.univ-orleans.fr/login?url=https://journals.openedition.org/corpus/9607 |
| _version_ |
1877292144089104384 |
| spelling |
openedition-oai:revues.org:corpus_9607 https://doi.org/10.4000/1364w urn:doi:10.4000/1364w https://journals.openedition.org/corpus/9607 2025-01-27T01:00:00Z info:eu-repo/semantics/openAccess article info:eu-repo/semantics/article urn:handle:20.500.13089/1364w All rights reserved À pas de loup dans la bergerie… La problématique du silence et du bruit dans l’étiquetage automatique du Subjonctif Présent en français parlé Corpus Bases, corpus, langage - UMR 7320 info:eu-repo/semantics/reference/issn/1765-3126 info:eu-repo/semantics/reference/issn/1638-9808 URI:https://journals.openedition.org/corpus Surcouf, Christian spoken French POS tagging noise silence present tense subjunctive present tense TreeTagger Dismo precision recall bruit silence subjonctif présent indicatif présent étiquetage automatique partie du discours TreeTagger Dismo précision rappel corpus de français parlé La linguistique de corpus tire largement profit des avancées de l’informatique dans le traitement des données. Toutefois, pour le linguiste ordinaire le recours aux étiqueteurs morphosyntaxiques comporte toujours une part de mystère et de magie. Si, muni de cet outil, il peut travailler sur des données massives, il ignore cependant comment ont été attribuées les étiquettes, et plus fondamentalement quelles erreurs peuvent avoir surgi durant l’étiquetage. Pourtant, de la qualité de cet étiquetage va dépendre en aval celle des résultats exploités pour les analyses. S’il est relativement aisé de repérer le bruit dans les résultats des requêtes, le silence qui en découle ailleurs est quant à lui beaucoup plus insidieux, difficile à pister, et pour cette raison potentiellement plus dommageable pour les analyses linguistiques. Dans notre étude, sur la base d’un corpus de dix heures de français parlé (surveillé et ordinaire), nous avons comparé l’étiquetage manuel des occurrences du Subjonctif Présent avec l’étiquetage fourni par TreeTagger, TreeTagger-TCOF et Dismo. Nous montrerons que le bruit dans l’étiquetage de l’Indicatif Présent est l’origine principale de l’important taux de silence dans l’étiquetage du Subjonctif Présent, les confusions étant dues – comme le révèle notre examen exhaustif de la conjugaison du Subjonctif Présent parmi les 6 500 verbes du Petit Robert – à des formes orthographiques communes avec l’Indicatif Présent. Pourtant la « précision » des étiqueteurs est souvent présentée comme atteignant des scores autour de 95 % (y compris pour le français parlé). Si les taux de « précision » oscillent ici entre 70 % et 99 %, les taux de « rappel », eux, sont beaucoup plus faibles : de 44 % à 61 %. En définitive, malgré sa dénomination avantageuse, le taux dit de « précision », calculé sur l’ensemble des étiquettes, constitue un indicateur médiocre de la qualité de l’étiquetage quand il s’agit d’une étiquette particulière comme celle du SubjPr. Corpus linguistics has benefited greatly from advances in data processing. However, for the ordinary linguist, the use of morphosyntactic taggers still carries a certain element of mystery and magic. Equipped with this tool, the linguist can work on massive data, but is mostly unaware of how the labels were assigned, and more fundamentally, what errors may have arisen during labeling. And yet, the quality of the labeling process will determine the quality of the results used for analysis. While noise is fairly easy to detect in tagged data, the resulting silence elsewhere is much more insidious, difficult to track down, and therefore potentially more damaging to linguistic analyses. In our study, we compared our manual tagging of Subjunctive Present occurrences in a ten-hour corpus of spoken French with the tagging provided by TreeTagger, TreeTagger-TCOF and Dismo. We'll show that noise in the tagging of the Present tense is the main cause of the high rate of silence in the tagging of the Subjunctive, the confusions being due –as revealed by our exhaustive analysis of the Subjunctive Present forms of the 6500 verbs in the Petit Robert dictionary– to common orthographic forms with the Present tense. Yet the “precision” of taggers is often presented as reaching scores of around 95% (including for spoken French). While “precision” rates here range from 70% to 99%, “recall” rates are much lower: from 44% to 61%. In short, despite its name, the so-called “precision” rate, calculated on all tags, is a poor indicator of the quality of tagging when it comes to a specific label such as SubjPr. |