Système fondé sur les graphes de connaissances pour la recherche de documents de conception en ingénierie : une approche par raisonnement déductif
| Auteur / Autrice : | Matthias Sesboüé |
| Direction : | Cecilia Zanni-Merk |
| Type : | Thèse de doctorat |
| Discipline(s) : | Informatique |
| Date : | Soutenance le 05/09/2024 |
| Etablissement(s) : | Normandie |
| Ecole(s) doctorale(s) : | École doctorale mathématiques, information et ingénierie des systèmes (Caen) |
| Partenaire(s) de recherche : | Laboratoire : Laboratoire d'informatique, de traitement de l'information et des systèmes (Saint-Etienne du Rouvray, Seine-Maritime ; 2006-...) |
| Établissement co-accrédité : Institut national des sciences appliquées Rouen Normandie (Saint-Etienne-du-Rouvray ; 1985-....) | |
| Jury : | Président / Présidente : Lina Fatima Soualmia |
| Examinateurs / Examinatrices : Cecilia Zanni-Merk, Edlira Vakaj, Cassia Trojahn Dos Santos, Nicolas Delestre, Jean-Philippe Kotowicz, Rossi Setchi, Grégory Zacharewicz | |
| Rapporteurs / Rapporteuses : Edlira Vakaj, Cassia Trojahn Dos Santos | |
| DOI : | 10.70675/2e1eece2z8ec6z4077z9beez1b998c238a6e |
Résumé
Ces travaux de recherche industrielle explorent les systèmes fondés sur les graphes de connaissances (KGBS) pour la Recherche d'Informations (RI). Ils ont été menés en partenariat avec l'entreprise TraceParts. Notre cas d'utilisation considère un corpus de documents techniques composé de modèles CAO et de leurs descriptions. Plutôt que d'exploiter les modèles CAO directement, nous nous concentrons sur leurs textes descriptifs. Aujourd'hui, les graphes de connaissances (KG) deviennent omniprésents dans les systèmes d'information et les applications des entreprises. De nombreux domaines de recherche, tels que la RI, ont adopté les KG. Ces artefacts numériques agrègent des données hétérogènes et représentent les connaissances dans un format interprétable par nos ordinateurs. Ce sont des graphes destinés à accumuler et à transmettre les connaissances du monde réel, dont les nœuds représentent des entités d'intérêt et les arêtes les relations entre ces entités. Les projets d'ingénierie et de construction produisent une multitude de documents techniques. Les systèmes de RI sont essentiels pour les industries de ces domaines afin de retrouver efficacement leurs documents. Ces derniers sont complexes, hétérogènes et spécialisés. Bien que ces industries manipulent des documents avec un contenu textuel, ces textes et leurs métadonnées contiennent des concepts et du vocabulaire spécifiques à chaque domaine. Les KG ouverts et les ontologies existantes décrivent des concepts généraux et manquent des connaissances plus fines requises par les applications de RI. Par conséquent, les outils de RI et de gestion des connaissances nécessitent des KG spécifiques à chaque domaine, construits à partir de documents ou étendant des KG existants. Nous explorons tout d'abord les KG, les ontologies et leur relation. Cette revue de littérature nous amène à proposer notre propre définition de KG. Nous considérons les ontologies comme une composante d'un KG et adoptons une perspective fondée sur le Web Sémantique en proposant des technologies issues des normes du Consortium World Wide Web. Nous explorons également la signification théorique et pratique du terme ''sémantique'' avant de poursuivre notre revue de la littérature avec la RI, en mettant l'accent sur la RI fondée sur les KG. Nous mettons en avant des similitudes et distinctions dans les utilisations des KG. Nos contributions introduisent d'abord une architecture pour les KGBS. Cette architecture organise l'acquisition, la modélisation et la consommation des connaissances autour du KG. Nous démontrons que les standards du Web Sémantique fournissent une approche pour chaque composante de notre architecture. Nous utilisons cette dernière pour organiser la présentation de la suite de notre travail. Chacune de nos contributions aborde respectivement l'acquisition, la modélisation et la consommation des connaissances. Pour nos travaux, nous n'avons pas de KG préconstruit ou d'accès à des experts du domaine pour le construire. Par conséquent, nous abordons l'acquisition de connaissances en concevant notre approche d'apprentissage automatique d'ontologies (OLAF). Nous utilisons OLAF pour construire des chaînes de traitements et apprendre automatiquement des ontologies à partir de texte. Nous implémentons notre approche sous forme d'une bibliothèque Python open-source et construisons deux ontologies pour évaluer la pertinence, la facilité d'utilisation et la modularité de notre outil. Nous nous concentrons ensuite sur la modélisation des connaissances, en présentant notre ontologie de RI dont nous démontrons l'utilisation avec un système de RI fondé sur du raisonnement déductif OWL en temps réel. La démonstration de notre ontologie de RI illustre par une implémentation fondée sur le Web Sémantique de notre définition de KG. Enfin, nous mettons en œuvre à échelle industrielle une approche fondée sur les KG avec des données provenant de la plateforme de contenue CAO www.traceparts.com.