Représentations latentes pour l'édition d'images et de vidéos de visages
| Auteur / Autrice : | Xu Yao |
| Direction : | Yann Gousseau, Alasdair Newson |
| Type : | Thèse de doctorat |
| Discipline(s) : | Informatique, données, IA: Signal, Images, Automatique et Robotique |
| Date : | Soutenance le 08/04/2022 |
| Etablissement(s) : | Institut polytechnique de Paris |
| Ecole(s) doctorale(s) : | École doctorale de l'Institut polytechnique de Paris |
| Partenaire(s) de recherche : | Laboratoire : Laboratoire Traitement et Communication de l'Information / LTCI |
| Etablissement opérateur d'inscription : Télécom Paris (Palaiseau, Essonne ; 1878-....) | |
| Jury : | Président / Présidente : George Drettakis |
| Examinateurs / Examinatrices : Yann Gousseau, George Drettakis, Nicolas Papadakis, Olivier Lézoray, Stefanie Wuhrer, Sylvain Paris | |
| Rapporteurs / Rapporteuses : Nicolas Papadakis, Olivier Lézoray | |
| DOI : | 10.70675/36bff61dz9deaz4530z8f62zcfde241e26ad |
Mots clés
Résumé
Apprendre à éditer des images et des vidéos de visages est un domaine particulièrement actif dans la recherche académique et industrielle. Cette thèse aborde le problème de l'édition de visages dans le cas particulier des images et des vidéos à haute résolution. Dans cette thèse, nous développons des méthodes basées sur l'apprentissage profond pour effectuer l'édition d'images faciales. Plus précisément, nous explorons la tâche en utilisant les représentations latentes obtenues à partir de deux types de réseaux neuronaux profonds : les modèles basés sur l'auto-encodage et les réseaux antagonistes génératifs (GAN). Pour chaque type de méthode, nous considérons un problème spécifique d'édition d'image et proposons une solution efficace qui surpasse l'état de l'art. La thèse comprend deux parties. Dans la partie I, nous explorons les tâches d'édition d'images via l'espace latent des autoencodeurs. Nous considérons d'abord la tâche de transfert de style entre les photos, et proposons un algorithme efficace qui est construit sur une paire de réseaux basés sur des autoencodeurs. Ensuite, nous étudions la tâche d'édition de l'âge du visage pour les images à haute résolution, en utilisant une architecture d'encodeur-décodeur. Le réseau proposé encode une image de visage en représentations de caractéristiques invariantes selon l'âge, et apprend un vecteur de modulation correspondant à un âge cible. Notre approche permet une édition fine de l'âge sur des images à haute résolution dans un seul modèle unifié.Dans la deuxième partie, nous explorons la tâche d'édition via l'espace latent des modèles antagonistes génératifs (GAN). Tout d'abord, nous considérons le problème de l'édition ''démêlée'' (disentangled) des attributs faciaux sur des images synthétiques et réelles, en proposant un réseau de transformation latent qui agit dans l'espace latent d'un modèle GAN pré-entraîné. Nous avons également proposé un pipeline de manipulation vidéo, afin de généraliser le résultat de l'édition aux vidéos. Deuxièmement, nous étudions le problème de l'inversion du GAN - la projection d'une image réelle dans l'espace latent d'un GAN pré-entraîné. En particulier, nous proposons un encodeur feed-forward, qui encode une image donnée en un code caractéristique et un code latent en une seule passe. L'encodeur proposé s'avère plus précis et plus stable pour l'inversion d'images et de vidéos, tout en conservant de bonnes capacités d'édition.