Méthode d'enrichissement et d'élargissement d'une ontologie à partir de corpus de spécialité multilingues

par Yuliya Korenchuk

Thèse de doctorat en Sciences du langage

Sous la direction de Amalia Todiraşcu-Courtier et de Delphine Bernhard.

Soutenue le 11-07-2017

à Strasbourg , dans le cadre de École doctorale Humanités (Strasbourg ; 2009-....) , en partenariat avec Linguistique, langues, parole (Strasbourg) (laboratoire) .

Le président du jury était Ulrich Heid.

Les rapporteurs étaient Ulrich Heid, Cecilia Zanni-Merk.


  • Résumé

    Cette thèse propose une méthode pour alimenter une ontologie, une structure de concepts liés par des relations sémantiques, par des termes français, anglais et allemands à partir de corpus spécialisés comparables. Son apport principal est le développement des méthodes d'extraction utilisant des ressources endogènes apprises à partir de corpus et d'ontologie. Exploitant des n-grammes de caractères, elles sont disponibles et indépendantes vis-à-vis de la langue et du domaine. La première contribution porte sur l'utilisation des ressources morphologiques et morphosyntaxiques endogènes pour extraire des termes mono- et polylexicaux à partir de corpus. La deuxième contribution vise à exploiter des ressources endogènes pour identifier leurs traductions. La troisième contribution concerne la construction des familles morphologiques endogènes servant à alimenter l'ontologie.

  • Titre traduit

    Method of ontology enrichment and population from multilingual comparable domain specific corpus


  • Résumé

    This thesis proposes a method of enrichment and population of an ontology, a structure of concepts linked by semantic relations, by terms in French, English and German from comparable domain-specific corpora. Our main contribution is the development of extraction methods based on endogenous resources, learned from the corpus and the ontology being analyzed. Using caracter n-grams, these resources are available and independent of a particular language or domain. The first contribution concerns the use of endogenous morphological and morphosyntactic resources for mono- and polylexical terms extraction from the corpus. The second contribution aims to use endogenous resources to identify translations for these terms. The third contribution concerns the construction of endogenous morphological families designed to enrich and populate the ontology.


Il est disponible au sein de la bibliothèque de l'établissement de soutenance.

Consulter en bibliothèque

La version de soutenance existe

Où se trouve cette thèse ?

  • Bibliothèque : Université de Strasbourg. Service commun de la documentation. Bibliothèque électronique 063.
Voir dans le Sudoc, catalogue collectif des bibliothèques de l'enseignement supérieur et de la recherche.