Thèse soutenue

Explorer l’évolution de topics dans les grandes archives scientifiques avec des graphes pivot

FR  |  
EN
Auteur / Autrice : Ke Li
Direction : Bernd AmannHubert Naacke
Type : Thèse de doctorat
Discipline(s) : Informatique
Date : Soutenance le 22/06/2021
Etablissement(s) : Sorbonne université
Ecole(s) doctorale(s) : École doctorale Informatique, télécommunications et électronique de Paris (1992-....)
Partenaire(s) de recherche : Laboratoire : LIP6 (1997-....)
Jury : Président / Présidente : Clémence Magnien
Examinateurs / Examinatrices : Nathalie Aussenac-Gilles
Rapporteurs / Rapporteuses : Nicolas Travers, Mírian Halfeld Ferrari Alves
DOI : 10.70675/6acb40dcz979az43c6z8ab4z48b9461b7208

Résumé

FR  |  
EN

Il existe une demande croissante d'outils pratiques pour explorer l'évolution de la recherche scientifique publiée dans des archives bibliographiques telles que le Web of Science, arXiv, PubMed ou ISTEX. L’extraction de topics et de leur évolution à partir de ces archives documentaires a de nombreuses applications et peut être étendue pour synthétiser des récits à partir d'ensembles de documents dans plusieurs domaines, y compris les flux d’actualités, les articles de recherche, les textes juridiques et les œuvres littéraires. Dans cette thèse, nous proposons un modèle de données et un langage d'interrogation pour la visualisation et l'exploration de réseaux d'évolution de sujets de recherche scientifiques. Notre modèle est indépendant d'une méthode particulière d'extraction et d'alignement de topics et propose un ensemble de métriques sémantiques et structurelles pour caractériser et filtrer des motifs d'évolution de domaines scientifiques. Ces métriques sont particulièrement utiles pour la visualisation et l'exploration de grands réseaux d'évolution de topics. Nous présentons également une implémentation de notre modèle sur Apache Spark et les résultats expérimentaux obtenus pour quatre archives de documents représentatives.