Construction de cartes pour l'exploration de corpus

Cette thèse s'inscrit dans une problématique qui intéresse principalement deux domaines de recherche en Informatique: il s'agit du Traitement Automatique des Langues d'une part et de l'Apprentissage Automatique d'autre part. Notre objectif est d'extraire des termes auto...

Descripción completa

Guardado en:
Detalles Bibliográficos
Autor principal: Debourges, Isabelle, 1974-
Otros Autores: Vrain, Christel, 1961- (Orientador)
Formato: Thèse et Mémoire papier
Lenguaje:Français
Publicado: [S.l.] : [s.n.] 2002.
Materias:
Autres localisations: Voir dans le Sudoc
Variante du titre:Building text maps for large corpora exploration
LEADER 03197nam a22002777a 4500
001 192537
008 030324s2002 xxe ||| |||| 00| 0 fre d
009 PPN070220387
041 0 |a fre  |b fre  |b eng 
084 |a 004 
100 1 |a Debourges, Isabelle,  |d 1974- 
240 1 0 |a Building text maps for large corpora exploration 
245 1 0 |a Construction de cartes pour l'exploration de corpus   |c par Isabelle Debourges ; [sous la dir. de] Christel Vrain,... 
260 |a [S.l.] :  |b [s.n.],  |c 2002. 
300 |a 262 p. ;  |c 30 cm. 
502 |a Thèse de doctorat. Informatique. Orléans. 2002 
504 |a Bibliogr. p. 195-204 
506 |a Publication autorisée par le jury 
520 |a Cette thèse s'inscrit dans une problématique qui intéresse principalement deux domaines de recherche en Informatique: il s'agit du Traitement Automatique des Langues d'une part et de l'Apprentissage Automatique d'autre part. Notre objectif est d'extraire des termes autour d'un thème (matérialisé par la requête de l'utilisateur), en explicitant les liens qui les unissent. Il s'agit de générer des cartes de textes donnant une représentation partielle du contenu sémantique de larges corpus homogènes, centrées autour de requêtes posées par l'utilisateur. Plus particulièrement, une carte est composée - d'un ensemble de mots clés fournis par l'utilisateur (la requête), - des concepts fortement liés à cette requête, - des liens entre mots clés et concepts, exprimés au sein du corpus. Cette problématique a été vue comme une structuration de terminologie: une première phase extrait les concepts, une seconde étiquette les liens. Les algorithmes proposés reposent sur des méthodes statistiques utilisant la collocation et des indices linguistiques, pour mettre en évidence des corrélations entre unités lexicales. Les principaux points originaux de cette thèse résident dans - le mode de recherche des concepts fortement liés à la requête: il est basé sur une recherche de point fixe - l'étiquetage des relations par des labels verbaux, éventuellement enrichis d'une orientation et de prépositions. Les algorithmes proposés ont fait l'objet d'une implantation au sein d'un outil. Des résultats obtenus sur un panel de cinq corpus de langues, genres et thématiques divers sont présentés. Une campagne d'évaluation des résultats obtenus sur le livre Introduction au Langage C de Bernard Cassagne, par trois catégories d'experts, a permis de quantifier la qualité des éléments extraits. 
650 |a Traitement automatique du langage naturel 
650 |a Apprentissage automatique 
650 |a Thèses et écrits académiques 
700 1 |a Vrain, Christel,  |d 1961-  |4 ths 
710 2 |a Université d'Orléans.  |4 dgg 
787 0 8 |i Reproduced as:  |0 246649674  |t Construction de cartes pour l'exploration de corpus  |f par Isabelle Debourges  |d 2002  |c Grenoble  |n Atelier national de reproduction des thèses  |p Microfiches  |s [Grenoble thèses] 
997 |0 192537  |1 Thèse et Mémoire papier  |a Ressource papier  |c 0/Orléans/  |c 1/Orléans/BU Sciences, Technologies, STAPS/  |z Orléans, BU Sciences, Technologies, STAPS, TS 19-2002-37  |z Orléans, BU Sciences, Technologies, STAPS, TS 19-2002-37 b