Thèse soutenue

Reconnaissance des émotions à l'aide du Deep Learning

FR  |  
EN
Auteur / Autrice : Valeriya Strizhkova
Direction : François BrémondAntitza Dantcheva
Type : Thèse de doctorat
Discipline(s) : Informatique
Date : Soutenance le 14/03/2025
Etablissement(s) : Université Côte d'Azur
Ecole(s) doctorale(s) : École doctorale Sciences et technologies de l'information et de la communication (Nice ; 1992-....)
Partenaire(s) de recherche : Laboratoire : Institut national de recherche en informatique et en automatique (France). Unité de recherche (Sophia Antipolis, Alpes-Maritimes)
Jury : Président / Présidente : Lucile Sassatelli
Examinateurs / Examinatrices : François Brémond, Antitza Dantcheva, Lucile Sassatelli, Mohamed Daoudi, Eric Granger, Danda Pani Paudel
Rapporteurs / Rapporteuses : Mohamed Daoudi, Eric Granger
DOI : 10.70675/d18d9ed4z0046z4b52za5c1zaf409882e4ea

Résumé

FR  |  
EN

La compréhension des émotions humaines est cruciale dans des domaines tels que les soins de santé, l'interaction homme-robot et le marketing. Malgré les progrès réalisés dans la reconnaissance des émotions à partir d'une seule modalité, comme une vidéo faciale ou une séquence de signaux physiologiques, il reste difficile d'améliorer les performances en combinant plusieurs modalités. De plus, reconnaître les émotions dans des données séquentielles longues, telles que des vidéos de longue durée, est un défi, bien que la plupart des vidéos réelles de personnes exprimant des émotions soient longues. Les ensembles de données existants sur les émotions sont limités en volume et en qualité, ce qui complique le développement de systèmes de reconnaissance des émotions basés sur l'apprentissage profond. Un système efficace de compréhension des émotions dans des situations réelles doit être capable de reconnaître les émotions à partir de longues vidéos synchronisées avec plusieurs modalités. Dans cette thèse, nous nous concentrons sur la reconnaissance multimodale des émotions à partir de longues vidéos synchronisées avec des signaux physiologiques. Plus précisément, les méthodes de reconnaissance multimodale des émotions rencontrent trois principaux défis : (a) l'apprentissage de représentations des émotions selon, (b) l'apprentissage de représentations d'émotions fines, et(c) la combinaison de modalités pour prédire les émotions. Dans ce travail, nous introduisons tout d'abord deux grands ensembles de données pour l'analyse comportementale : INEMO et StressID. INEMO est un ensemble de données multimodales conçu pour faciliter la reconnaissance des émotions lors du visionnage de vidéos issues des réseaux sociaux. StressID, quant à lui, est un ensemble de données multimodales conçu pour l'identification du stress. Ensuite, nous proposons deux techniques de pré-entraînement pour la reconnaissance des expressions faciales : 1. un pré-entraînement supervisé sur des données synthétiques générées par notre méthode de génération de vidéos, et 2. un pré-entraînement auto-supervisé sur des vidéos multi-vues. Nous démontrons que ces techniques permettent d'obtenir des représentations faciales riches, améliorant ainsi la précision de la reconnaissance des émotions fines. Enfin, nous abordons la problématique de la reconnaissance des émotions à partir de multiples modalités. Nous proposons un cadre pour la fusion multimodale de vidéos et de signaux physiologiques afin de prédire les émotions. Ce cadre repose principalement sur deux étapes : 1. l'extraction de caractéristiques à partir de longues vidéos brutes et de signaux physiologiques ; 2. la fusion des caractéristiques extraites pour prédire les émotions en utilisant une approche intermodale basée sur un mécanisme d'attention. Notre méthode exploite les modalités supplémentaires, ce qui améliore significativement les performances de reconnaissance des émotions. Nos méthodes ont été évaluées de manière approfondie sur plusieurs ensembles de données de référence pour la reconnaissance des émotions. Les résultats montrent que les méthodes proposées surpassent les approches précédentes, ouvrant la voie à des déploiements concrets dans des environnements réels.