Corpus pour la TA : types, tailles et problèmes associés, selon leur usage et le type de système

RésuméLes corpus utilisés en TA de l’écrit et de l’oral ont évolué, depuis les suites de test et les corpus d’essai des débuts, vers des corpus parallèles bilingues ou multilingues, bruts ou enrichis par des métadonnées et une grande variété d’annotations linguistiques. Ils sont assez petits et peuv...

Full description

Saved in:
Bibliographic Details
Main Author: Boitet, Christian
Format: Article ou chapitre numérique
Language:Français
Published: 2007
Subjects:
Online Access:Accès Université d'Orléans et IFPM
Accès Université d'Orléans et IFPM
id cairn-RFLA_121_0025
record_format cairn
spelling cairn-RFLA_121_0025RFLARevue française de linguistique appliquée https://shs.cairn.info/revue-francaise-de-linguistique-appliquee-2007-1-page-25?lang=fr https://doi.org/10.3917/rfla.121.0025 Corpus pour la TA : types, tailles et problèmes associés, selon leur usage et le type de système Boitet, Christian2007 corpus parallèlescorrespondances entre segmentsreprésentations intermédiairestraduction automatique (TA)transcriptions et prétraitementscorrespondences between segmentsintermediate representationsmachine translationparallel corporatranscriptions and preprocessingsfre Revue française de linguistique appliquée | XII | 1 | 2007-03-01 | p. 25-38 | 1386-1204 RFLA_12183 RésuméLes corpus utilisés en TA de l’écrit et de l’oral ont évolué, depuis les suites de test et les corpus d’essai des débuts, vers des corpus parallèles bilingues ou multilingues, bruts ou enrichis par des métadonnées et une grande variété d’annotations linguistiques. Ils sont assez petits et peuvent avoir une « granularité » importante en TA « experte », classique, mais sont énormes et de granularité faible en TA « empirique »,, statistique ou fondée sur les exemples. La représentation des textes et l’interface avec le traitement de la parole posent des problèmes spécifiques, ainsi que la segmentation et la structuration des segments et des corpus. Un défi actuel est d’unifier et de mutualiser leur construction et leur gestion.Corpora used in MT (Machine Translation) of text and speech have evolved, from the early test suites and test corpora, to parallel bilingual and multilingual corpora, raw or enriched by metadata and a large variety of linguistic annotations. They are relatively small and can have a bug "granularity" in "expert" or classical MT, while they are very large and of small granularity in "empirical" MT, be it statistical or example-based. The representation of the texts and of the interface with speech processing poses specific problems, as well as the segmentation and the structuration of segments and corpora. A current challenge is to unify and "wikify" their construction and management.Cairn free access
language Français
format Article ou chapitre numérique
building 0/Bibliothèque numérique/
1/Bibliothèque numérique/Cairn/
topic corpus parallèles
correspondances entre segments
représentations intermédiaires
traduction automatique (TA)
transcriptions et prétraitements
correspondences between segments
intermediate representations
machine translation
parallel corpora
transcriptions and preprocessings
spellingShingle corpus parallèles
correspondances entre segments
représentations intermédiaires
traduction automatique (TA)
transcriptions et prétraitements
correspondences between segments
intermediate representations
machine translation
parallel corpora
transcriptions and preprocessings
Boitet, Christian
Corpus pour la TA : types, tailles et problèmes associés, selon leur usage et le type de système
topic_facet corpus parallèles
correspondances entre segments
représentations intermédiaires
traduction automatique (TA)
transcriptions et prétraitements
correspondences between segments
intermediate representations
machine translation
parallel corpora
transcriptions and preprocessings
description RésuméLes corpus utilisés en TA de l’écrit et de l’oral ont évolué, depuis les suites de test et les corpus d’essai des débuts, vers des corpus parallèles bilingues ou multilingues, bruts ou enrichis par des métadonnées et une grande variété d’annotations linguistiques. Ils sont assez petits et peuvent avoir une « granularité » importante en TA « experte », classique, mais sont énormes et de granularité faible en TA « empirique »,, statistique ou fondée sur les exemples. La représentation des textes et l’interface avec le traitement de la parole posent des problèmes spécifiques, ainsi que la segmentation et la structuration des segments et des corpus. Un défi actuel est d’unifier et de mutualiser leur construction et leur gestion.
author Boitet, Christian
author_facet Boitet, Christian
author_sort Boitet, Christian
title Corpus pour la TA : types, tailles et problèmes associés, selon leur usage et le type de système
title_short Corpus pour la TA : types, tailles et problèmes associés, selon leur usage et le type de système
title_full Corpus pour la TA : types, tailles et problèmes associés, selon leur usage et le type de système
title_fullStr Corpus pour la TA : types, tailles et problèmes associés, selon leur usage et le type de système
title_full_unstemmed Corpus pour la TA : types, tailles et problèmes associés, selon leur usage et le type de système
title_sort corpus pour la ta : types, tailles et problèmes associés, selon leur usage et le type de système
publishDate 2007
container_title
container_issue
url https://ezproxy.univ-orleans.fr/login?url=https://shs.cairn.info/revue-francaise-de-linguistique-appliquee-2007-1-page-25?lang=fr
https://ezproxy.univ-orleans.fr/login?url=https://doi.org/10.3917/rfla.121.0025
_version_ 1877246565111824384