Traitement automatique des domaines
L’objectif de cet article est de présenter une méthode de traitement automatique de la notion de domaine et des applications qu’induit cette méthode dans la recherche d’informations sur le Web. Après avoir mis l’accent sur les précautions qu’il faut prendre pour attribuer un texte à un domaine donné...
Enregistré dans:
| Auteurs principaux: | , |
|---|---|
| Format: | Article ou chapitre numérique |
| Langue: | Français |
| Publié: |
1998
|
| Accès en ligne: | Accès Université d'Orléans et IFPM Accès Université d'Orléans et IFPM |
| id |
cairn-RFLA_032_0047 |
|---|---|
| record_format |
cairn |
| spelling |
cairn-RFLA_032_0047RFLARevue française de linguistique appliquée https://shs.cairn.info/revue-francaise-de-linguistique-appliquee-1998-2-page-47?lang=fr https://doi.org/10.3917/rfla.032.0047 Traitement automatique des domaines Gross, GastonGuenthner, Franz1998 fre Revue française de linguistique appliquée | III | 2 | 1998-12-01 | p. 47-56 | 1386-1204 RFLA_03269 L’objectif de cet article est de présenter une méthode de traitement automatique de la notion de domaine et des applications qu’induit cette méthode dans la recherche d’informations sur le Web. Après avoir mis l’accent sur les précautions qu’il faut prendre pour attribuer un texte à un domaine donné, on définit un domaine comme un ensemble d’hyperclasses (humain, concret, locatif, temps, action, etc.), et de classes d’objets, correspondant à la structuration de la phrase simple en prédicats et arguments. Toutes ces informations sémantico-syntaxiques figurent dans des dictionnaires électroniques de langue générale et de langues de spécialité, qui distinguent les mots simples des mots composés. On marquera les pages Web sur la base de ces dictionnaires. Une première application a permis ainsi au moteur de recherches AltaVista d’identifier automatiquement 29 langues. De même, l’identification des mots composés permet de faire des requêtes beaucoup plus précises et rapides que celles que ion ferait en interrogeant sur les éléments lexicaux constitutifs de ces composés. Ces recherches peuvent être encore affinées grâce à la précision supplémentaire qu’apportent les mots composés complexes ? Une application en grandeur réelle a pour objet la langue de la médecine, dans le cadre du projet Webling de la Communauté Européenne.The aim of this article is to present a practical implementation of the notion of a "domain" for the automatic processing of domain information and its application to information retrieval on the WWW. After a discussion of the problems that arise when assigning a text to a given domain, we will define a domain as a set of hyperclasses (such as human, concrete, locative, actions etc.) and of object classes, which correspond to the structure of a simple sentence into predicates and arguments. This semantic-syntactic information is already encoded in general and technical language dictionaries. In these dictionaries we distinguish between simple and compound words. On the basis of the dictionaries we will tag web pages. A first application has enabled the search engine Alta Vista to identify 29 languages. We have also found that the identification of compound words allows queries that lead to more precise and more rapid results, compared to search algorithms that work exclusively with the simple words of the compound expression. Information retrieval can thus be considerably improved by taking into account compound words. An application of this research will be the retrieval of texts in medical language that we are carrying out in the framework of the European Commission research project Webling.Cairn free access |
| language |
Français |
| format |
Article ou chapitre numérique |
| building |
0/Bibliothèque numérique/ 1/Bibliothèque numérique/Cairn/ |
| description |
L’objectif de cet article est de présenter une méthode de traitement automatique de la notion de domaine et des applications qu’induit cette méthode dans la recherche d’informations sur le Web. Après avoir mis l’accent sur les précautions qu’il faut prendre pour attribuer un texte à un domaine donné, on définit un domaine comme un ensemble d’hyperclasses (humain, concret, locatif, temps, action, etc.), et de classes d’objets, correspondant à la structuration de la phrase simple en prédicats et arguments. Toutes ces informations sémantico-syntaxiques figurent dans des dictionnaires électroniques de langue générale et de langues de spécialité, qui distinguent les mots simples des mots composés. On marquera les pages Web sur la base de ces dictionnaires. Une première application a permis ainsi au moteur de recherches AltaVista d’identifier automatiquement 29 langues. De même, l’identification des mots composés permet de faire des requêtes beaucoup plus précises et rapides que celles que ion ferait en interrogeant sur les éléments lexicaux constitutifs de ces composés. Ces recherches peuvent être encore affinées grâce à la précision supplémentaire qu’apportent les mots composés complexes ? Une application en grandeur réelle a pour objet la langue de la médecine, dans le cadre du projet Webling de la Communauté Européenne. |
| author |
Gross, Gaston Guenthner, Franz |
| spellingShingle |
Gross, Gaston Guenthner, Franz Traitement automatique des domaines |
| author_facet |
Gross, Gaston Guenthner, Franz |
| author_sort |
Gross, Gaston |
| title |
Traitement automatique des domaines |
| title_short |
Traitement automatique des domaines |
| title_full |
Traitement automatique des domaines |
| title_fullStr |
Traitement automatique des domaines |
| title_full_unstemmed |
Traitement automatique des domaines |
| title_sort |
traitement automatique des domaines |
| publishDate |
1998 |
| container_title |
|
| container_issue |
|
| url |
https://ezproxy.univ-orleans.fr/login?url=https://shs.cairn.info/revue-francaise-de-linguistique-appliquee-1998-2-page-47?lang=fr https://ezproxy.univ-orleans.fr/login?url=https://doi.org/10.3917/rfla.032.0047 |
| _version_ |
1877246564450172928 |