Explorer l’évolution de topics dans les grandes archives scientifiques avec des graphes pivot
| Auteur / Autrice : | Ke Li |
| Direction : | Bernd Amann, Hubert Naacke |
| Type : | Thèse de doctorat |
| Discipline(s) : | Informatique |
| Date : | Soutenance le 22/06/2021 |
| Etablissement(s) : | Sorbonne université |
| Ecole(s) doctorale(s) : | École doctorale Informatique, télécommunications et électronique de Paris (1992-....) |
| Partenaire(s) de recherche : | Laboratoire : LIP6 (1997-....) |
| Jury : | Président / Présidente : Clémence Magnien |
| Examinateurs / Examinatrices : Nathalie Aussenac-Gilles | |
| Rapporteurs / Rapporteuses : Nicolas Travers, Mírian Halfeld Ferrari Alves | |
| DOI : | 10.70675/6acb40dcz979az43c6z8ab4z48b9461b7208 |
Résumé
Il existe une demande croissante d'outils pratiques pour explorer l'évolution de la recherche scientifique publiée dans des archives bibliographiques telles que le Web of Science, arXiv, PubMed ou ISTEX. L’extraction de topics et de leur évolution à partir de ces archives documentaires a de nombreuses applications et peut être étendue pour synthétiser des récits à partir d'ensembles de documents dans plusieurs domaines, y compris les flux d’actualités, les articles de recherche, les textes juridiques et les œuvres littéraires. Dans cette thèse, nous proposons un modèle de données et un langage d'interrogation pour la visualisation et l'exploration de réseaux d'évolution de sujets de recherche scientifiques. Notre modèle est indépendant d'une méthode particulière d'extraction et d'alignement de topics et propose un ensemble de métriques sémantiques et structurelles pour caractériser et filtrer des motifs d'évolution de domaines scientifiques. Ces métriques sont particulièrement utiles pour la visualisation et l'exploration de grands réseaux d'évolution de topics. Nous présentons également une implémentation de notre modèle sur Apache Spark et les résultats expérimentaux obtenus pour quatre archives de documents représentatives.