Construction de cartes pour l'exploration de corpus
Cette thèse s'inscrit dans une problématique qui intéresse principalement deux domaines de recherche en Informatique: il s'agit du Traitement Automatique des Langues d'une part et de l'Apprentissage Automatique d'autre part. Notre objectif est d'extraire des termes auto...
Guardado en:
| Autor principal: | |
|---|---|
| Otros Autores: | |
| Formato: | Thèse et Mémoire papier |
| Lenguaje: | Français |
| Publicado: |
[S.l.] :
[s.n.]
2002.
|
| Materias: | |
| Autres localisations: | Voir dans le Sudoc |
| Variante du titre: | Building text maps for large corpora exploration |
| LEADER | 03197nam a22002777a 4500 | ||
|---|---|---|---|
| 001 | 192537 | ||
| 008 | 030324s2002 xxe ||| |||| 00| 0 fre d | ||
| 009 | PPN070220387 | ||
| 041 | 0 | |a fre |b fre |b eng | |
| 084 | |a 004 | ||
| 100 | 1 | |a Debourges, Isabelle, |d 1974- | |
| 240 | 1 | 0 | |a Building text maps for large corpora exploration |
| 245 | 1 | 0 | |a Construction de cartes pour l'exploration de corpus |c par Isabelle Debourges ; [sous la dir. de] Christel Vrain,... |
| 260 | |a [S.l.] : |b [s.n.], |c 2002. | ||
| 300 | |a 262 p. ; |c 30 cm. | ||
| 502 | |a Thèse de doctorat. Informatique. Orléans. 2002 | ||
| 504 | |a Bibliogr. p. 195-204 | ||
| 506 | |a Publication autorisée par le jury | ||
| 520 | |a Cette thèse s'inscrit dans une problématique qui intéresse principalement deux domaines de recherche en Informatique: il s'agit du Traitement Automatique des Langues d'une part et de l'Apprentissage Automatique d'autre part. Notre objectif est d'extraire des termes autour d'un thème (matérialisé par la requête de l'utilisateur), en explicitant les liens qui les unissent. Il s'agit de générer des cartes de textes donnant une représentation partielle du contenu sémantique de larges corpus homogènes, centrées autour de requêtes posées par l'utilisateur. Plus particulièrement, une carte est composée - d'un ensemble de mots clés fournis par l'utilisateur (la requête), - des concepts fortement liés à cette requête, - des liens entre mots clés et concepts, exprimés au sein du corpus. Cette problématique a été vue comme une structuration de terminologie: une première phase extrait les concepts, une seconde étiquette les liens. Les algorithmes proposés reposent sur des méthodes statistiques utilisant la collocation et des indices linguistiques, pour mettre en évidence des corrélations entre unités lexicales. Les principaux points originaux de cette thèse résident dans - le mode de recherche des concepts fortement liés à la requête: il est basé sur une recherche de point fixe - l'étiquetage des relations par des labels verbaux, éventuellement enrichis d'une orientation et de prépositions. Les algorithmes proposés ont fait l'objet d'une implantation au sein d'un outil. Des résultats obtenus sur un panel de cinq corpus de langues, genres et thématiques divers sont présentés. Une campagne d'évaluation des résultats obtenus sur le livre Introduction au Langage C de Bernard Cassagne, par trois catégories d'experts, a permis de quantifier la qualité des éléments extraits. | ||
| 650 | |a Traitement automatique du langage naturel | ||
| 650 | |a Apprentissage automatique | ||
| 650 | |a Thèses et écrits académiques | ||
| 700 | 1 | |a Vrain, Christel, |d 1961- |4 ths | |
| 710 | 2 | |a Université d'Orléans. |4 dgg | |
| 787 | 0 | 8 | |i Reproduced as: |0 246649674 |t Construction de cartes pour l'exploration de corpus |f par Isabelle Debourges |d 2002 |c Grenoble |n Atelier national de reproduction des thèses |p Microfiches |s [Grenoble thèses] |
| 997 | |0 192537 |1 Thèse et Mémoire papier |a Ressource papier |c 0/Orléans/ |c 1/Orléans/BU Sciences, Technologies, STAPS/ |z Orléans, BU Sciences, Technologies, STAPS, TS 19-2002-37 |z Orléans, BU Sciences, Technologies, STAPS, TS 19-2002-37 b | ||