Thèse soutenue

Représentations latentes pour l'édition d'images et de vidéos de visages

FR  |  
EN
Auteur / Autrice : Xu Yao
Direction : Yann GousseauAlasdair Newson
Type : Thèse de doctorat
Discipline(s) : Informatique, données, IA: Signal, Images, Automatique et Robotique
Date : Soutenance le 08/04/2022
Etablissement(s) : Institut polytechnique de Paris
Ecole(s) doctorale(s) : École doctorale de l'Institut polytechnique de Paris
Partenaire(s) de recherche : Laboratoire : Laboratoire Traitement et Communication de l'Information / LTCI
Etablissement opérateur d'inscription : Télécom Paris (Palaiseau, Essonne ; 1878-....)
Jury : Président / Présidente : George Drettakis
Examinateurs / Examinatrices : Yann Gousseau, George Drettakis, Nicolas Papadakis, Olivier Lézoray, Stefanie Wuhrer, Sylvain Paris
Rapporteurs / Rapporteuses : Nicolas Papadakis, Olivier Lézoray
DOI : 10.70675/36bff61dz9deaz4530z8f62zcfde241e26ad

Résumé

FR  |  
EN

Apprendre à éditer des images et des vidéos de visages est un domaine particulièrement actif dans la recherche académique et industrielle. Cette thèse aborde le problème de l'édition de visages dans le cas particulier des images et des vidéos à haute résolution. Dans cette thèse, nous développons des méthodes basées sur l'apprentissage profond pour effectuer l'édition d'images faciales. Plus précisément, nous explorons la tâche en utilisant les représentations latentes obtenues à partir de deux types de réseaux neuronaux profonds : les modèles basés sur l'auto-encodage et les réseaux antagonistes génératifs (GAN). Pour chaque type de méthode, nous considérons un problème spécifique d'édition d'image et proposons une solution efficace qui surpasse l'état de l'art. La thèse comprend deux parties. Dans la partie I, nous explorons les tâches d'édition d'images via l'espace latent des autoencodeurs. Nous considérons d'abord la tâche de transfert de style entre les photos, et proposons un algorithme efficace qui est construit sur une paire de réseaux basés sur des autoencodeurs. Ensuite, nous étudions la tâche d'édition de l'âge du visage pour les images à haute résolution, en utilisant une architecture d'encodeur-décodeur. Le réseau proposé encode une image de visage en représentations de caractéristiques invariantes selon l'âge, et apprend un vecteur de modulation correspondant à un âge cible. Notre approche permet une édition fine de l'âge sur des images à haute résolution dans un seul modèle unifié.Dans la deuxième partie, nous explorons la tâche d'édition via l'espace latent des modèles antagonistes génératifs (GAN). Tout d'abord, nous considérons le problème de l'édition ''démêlée'' (disentangled) des attributs faciaux sur des images synthétiques et réelles, en proposant un réseau de transformation latent qui agit dans l'espace latent d'un modèle GAN pré-entraîné. Nous avons également proposé un pipeline de manipulation vidéo, afin de généraliser le résultat de l'édition aux vidéos. Deuxièmement, nous étudions le problème de l'inversion du GAN - la projection d'une image réelle dans l'espace latent d'un GAN pré-entraîné. En particulier, nous proposons un encodeur feed-forward, qui encode une image donnée en un code caractéristique et un code latent en une seule passe. L'encodeur proposé s'avère plus précis et plus stable pour l'inversion d'images et de vidéos, tout en conservant de bonnes capacités d'édition.