Thèse soutenue

Gestion des métadonnées pour la gouvernance des lacs de données

FR  |  
EN
Auteur / Autrice : Yan Zhao
Direction : Franck Ravat
Type : Thèse de doctorat
Discipline(s) : Informatique et télécommunications
Date : Soutenance le 07/12/2021
Etablissement(s) : Toulouse 1
Ecole(s) doctorale(s) : École doctorale Mathématiques, informatique et télécommunications (Toulouse)
Partenaire(s) de recherche : Laboratoire : Institut de Recherche en Informatique de Toulouse (1995-....)
DOI : 10.70675/d8a53854z9306z4507zbe48zd67d34112f63

Mots clés

FR  |  
EN

Mots clés contrôlés

Résumé

FR  |  
EN

A l’ère du Big Data, les données sont caractérisées par le volume, la vitesse, la variété, la véracité et la valeur (5V). L’enjeu majeur du Big Data, au-delà du stockage, est d’extraire de la valeur de qualité à travers des analyses avancées sur des données volumineuses, véloces et variées. Depuis une décennie, le Lac de données (LD) est apparu comme une nouvelle solution répondant à cet enjeu de Big Data Analytics. En tant que concept relativement nouveau, le lac de données n’a pas de définition standard ni d’architecture reconnue. Les propositions de la littérature sont insuffisantes au regard de l’ampleur du contexte. Notre première contribution se résume en une définition complète ainsi qu’une architecture générique du lac de données qui contient une zone d’ingestion, une zone de préparation, une zone d’analyse et une zone de gouvernance de données. De plus, afin que les lacs de données ne soient ni invisibles ni inaccessibles par ses différents d’utilisateurs, une gouvernance est vitale. L’élément central d’une bonne gouvernance est un système de management de métadonnées. Dans la littérature, les approches de management des métadonnées sont parcellaires et pas nécessairement génériques pour les LD. La contribution majeure de cette thèse est une solution complète de management de métadonnées permettant aux utilisateurs de trouver, d’accéder, d’interopérer et de réutiliser facilement aussi bien des données que des processus ou des analyses effectuées par le LD. Dans un premier temps, nous avons proposé un modèle de métadonnées permettant de gérer tout le cycle de vie des données dans un LD comme suit : (i) métadonnées représentant différents types de données ingérées (structurées, semi structurées et non structurées) et différents modes d’ingestion (batch et en temps réel), (ii) métadonnées représentant différents processus de transformation des données (ETL, exploration statistiques et phase de préparation en science des données) au travers de la spécification d’opérations de haut niveau, (iii) métadonnées orientées analyse et notamment l’apprentissage automatique pour caractériser les analyses effectuées dans le LD et de pouvoir réutiliser et paramétrer rapidement les futures analyses. Dans un second temps, nous avons défini un système de gestion de métadonnées, nommé DAMMS. DAMMS permet (i) d’ingérer de manière semi-automatique des métadonnées et (ii) d’explorer le contenu du LD (données, processus de transformation ou analyses) de manière ergonomique afin de pouvoir les réutiliser ou les adapter. DAMMS présente ainsi l’avantage de répondre au besoin d’industrialisation de la science des données. Enfin, pour évaluer la faisabilité et l’utilisabilité de notre proposition, nous avons mené conjointement une étude de performance de l’ingestion des métadonnées et une étude analysant l’expérience utilisateur de DAMMS.