Traitement automatique des domaines

L’objectif de cet article est de présenter une méthode de traitement automatique de la notion de domaine et des applications qu’induit cette méthode dans la recherche d’informations sur le Web. Après avoir mis l’accent sur les précautions qu’il faut prendre pour attribuer un texte à un domaine donné...

Description complète

Enregistré dans:
Détails bibliographiques
Auteurs principaux: Gross, Gaston, Guenthner, Franz
Format: Article ou chapitre numérique
Langue:Français
Publié: 1998
Accès en ligne:Accès Université d'Orléans et IFPM
Accès Université d'Orléans et IFPM
id cairn-RFLA_032_0047
record_format cairn
spelling cairn-RFLA_032_0047RFLARevue française de linguistique appliquée https://shs.cairn.info/revue-francaise-de-linguistique-appliquee-1998-2-page-47?lang=fr https://doi.org/10.3917/rfla.032.0047 Traitement automatique des domaines Gross, GastonGuenthner, Franz1998 fre Revue française de linguistique appliquée | III | 2 | 1998-12-01 | p. 47-56 | 1386-1204 RFLA_03269 L’objectif de cet article est de présenter une méthode de traitement automatique de la notion de domaine et des applications qu’induit cette méthode dans la recherche d’informations sur le Web. Après avoir mis l’accent sur les précautions qu’il faut prendre pour attribuer un texte à un domaine donné, on définit un domaine comme un ensemble d’hyperclasses (humain, concret, locatif, temps, action, etc.), et de classes d’objets, correspondant à la structuration de la phrase simple en prédicats et arguments. Toutes ces informations sémantico-syntaxiques figurent dans des dictionnaires électroniques de langue générale et de langues de spécialité, qui distinguent les mots simples des mots composés. On marquera les pages Web sur la base de ces dictionnaires. Une première application a permis ainsi au moteur de recherches AltaVista d’identifier automatiquement 29 langues. De même, l’identification des mots composés permet de faire des requêtes beaucoup plus précises et rapides que celles que ion ferait en interrogeant sur les éléments lexicaux constitutifs de ces composés. Ces recherches peuvent être encore affinées grâce à la précision supplémentaire qu’apportent les mots composés complexes ? Une application en grandeur réelle a pour objet la langue de la médecine, dans le cadre du projet Webling de la Communauté Européenne.The aim of this article is to present a practical implementation of the notion of a "domain" for the automatic processing of domain information and its application to information retrieval on the WWW. After a discussion of the problems that arise when assigning a text to a given domain, we will define a domain as a set of hyperclasses (such as human, concrete, locative, actions etc.) and of object classes, which correspond to the structure of a simple sentence into predicates and arguments. This semantic-syntactic information is already encoded in general and technical language dictionaries. In these dictionaries we distinguish between simple and compound words. On the basis of the dictionaries we will tag web pages. A first application has enabled the search engine Alta Vista to identify 29 languages. We have also found that the identification of compound words allows queries that lead to more precise and more rapid results, compared to search algorithms that work exclusively with the simple words of the compound expression. Information retrieval can thus be considerably improved by taking into account compound words. An application of this research will be the retrieval of texts in medical language that we are carrying out in the framework of the European Commission research project Webling.Cairn free access
language Français
format Article ou chapitre numérique
building 0/Bibliothèque numérique/
1/Bibliothèque numérique/Cairn/
description L’objectif de cet article est de présenter une méthode de traitement automatique de la notion de domaine et des applications qu’induit cette méthode dans la recherche d’informations sur le Web. Après avoir mis l’accent sur les précautions qu’il faut prendre pour attribuer un texte à un domaine donné, on définit un domaine comme un ensemble d’hyperclasses (humain, concret, locatif, temps, action, etc.), et de classes d’objets, correspondant à la structuration de la phrase simple en prédicats et arguments. Toutes ces informations sémantico-syntaxiques figurent dans des dictionnaires électroniques de langue générale et de langues de spécialité, qui distinguent les mots simples des mots composés. On marquera les pages Web sur la base de ces dictionnaires. Une première application a permis ainsi au moteur de recherches AltaVista d’identifier automatiquement 29 langues. De même, l’identification des mots composés permet de faire des requêtes beaucoup plus précises et rapides que celles que ion ferait en interrogeant sur les éléments lexicaux constitutifs de ces composés. Ces recherches peuvent être encore affinées grâce à la précision supplémentaire qu’apportent les mots composés complexes ? Une application en grandeur réelle a pour objet la langue de la médecine, dans le cadre du projet Webling de la Communauté Européenne.
author Gross, Gaston
Guenthner, Franz
spellingShingle Gross, Gaston
Guenthner, Franz
Traitement automatique des domaines
author_facet Gross, Gaston
Guenthner, Franz
author_sort Gross, Gaston
title Traitement automatique des domaines
title_short Traitement automatique des domaines
title_full Traitement automatique des domaines
title_fullStr Traitement automatique des domaines
title_full_unstemmed Traitement automatique des domaines
title_sort traitement automatique des domaines
publishDate 1998
container_title
container_issue
url https://ezproxy.univ-orleans.fr/login?url=https://shs.cairn.info/revue-francaise-de-linguistique-appliquee-1998-2-page-47?lang=fr
https://ezproxy.univ-orleans.fr/login?url=https://doi.org/10.3917/rfla.032.0047
_version_ 1877246564450172928