Thèse soutenue

Modèles d'apprentissage profond pour le nettoyage des données tabulaires

FR  |  
EN
Auteur / Autrice : Riccardo Cappuzzo
Direction : Paolo Papotti
Type : Thèse de doctorat
Discipline(s) : Informatique
Date : Soutenance le 01/04/2022
Etablissement(s) : Sorbonne université
Ecole(s) doctorale(s) : École doctorale Informatique, télécommunications et électronique de Paris (1992-....)
Partenaire(s) de recherche : Laboratoire : Institut EURECOM (Sophia-Antipolis, Alpes-Maritimes ; 1992-....)
Jury : Président / Présidente : Paolo Merialdo
Examinateurs / Examinatrices : Raphaël Troncy
Rapporteurs / Rapporteuses : Yannis Velegrakis, Mélanie Herschel
DOI : 10.70675/d83bad15z52faz47ddz9b3czd25cd9ab0f08

Résumé

FR  |  
EN

La conservation des données est un sujet omniprésent et de grande envergure, qui touche tous les domaines, du monde universitaire à l'industrie. Les solutions actuelles reposent sur le travail manuel des utilisateurs du domaine, mais elles ne sont pas adaptées. Nous étudions comment appliquer l'apprentissage profond à la conservation des données tabulaires. Nous concentrons notre travail sur le développement de systèmes de curation de données non supervisés et sur la conception de systèmes de curation qui modélisent intrinsèquement les valeurs catégorielles dans leur forme brute. Nous implémentons d'abord EmbDI pour générer des embeddings pour les données tabulaires, et nous traitons les tâches de résolution d'entités et de correspondance de schémas. Nous passons ensuite au problème de l'imputation des données en utilisant des réseaux neuronaux graphiques dans un cadre d'apprentissage multi-tâches appelé GRIMP.