Reconnaissance des émotions à l'aide du Deep Learning
| Auteur / Autrice : | Valeriya Strizhkova |
| Direction : | François Brémond, Antitza Dantcheva |
| Type : | Thèse de doctorat |
| Discipline(s) : | Informatique |
| Date : | Soutenance le 14/03/2025 |
| Etablissement(s) : | Université Côte d'Azur |
| Ecole(s) doctorale(s) : | École doctorale Sciences et technologies de l'information et de la communication (Nice ; 1992-....) |
| Partenaire(s) de recherche : | Laboratoire : Institut national de recherche en informatique et en automatique (France). Unité de recherche (Sophia Antipolis, Alpes-Maritimes) |
| Jury : | Président / Présidente : Lucile Sassatelli |
| Examinateurs / Examinatrices : François Brémond, Antitza Dantcheva, Lucile Sassatelli, Mohamed Daoudi, Eric Granger, Danda Pani Paudel | |
| Rapporteurs / Rapporteuses : Mohamed Daoudi, Eric Granger | |
| DOI : | 10.70675/d18d9ed4z0046z4b52za5c1zaf409882e4ea |
Mots clés
Résumé
La compréhension des émotions humaines est cruciale dans des domaines tels que les soins de santé, l'interaction homme-robot et le marketing. Malgré les progrès réalisés dans la reconnaissance des émotions à partir d'une seule modalité, comme une vidéo faciale ou une séquence de signaux physiologiques, il reste difficile d'améliorer les performances en combinant plusieurs modalités. De plus, reconnaître les émotions dans des données séquentielles longues, telles que des vidéos de longue durée, est un défi, bien que la plupart des vidéos réelles de personnes exprimant des émotions soient longues. Les ensembles de données existants sur les émotions sont limités en volume et en qualité, ce qui complique le développement de systèmes de reconnaissance des émotions basés sur l'apprentissage profond. Un système efficace de compréhension des émotions dans des situations réelles doit être capable de reconnaître les émotions à partir de longues vidéos synchronisées avec plusieurs modalités. Dans cette thèse, nous nous concentrons sur la reconnaissance multimodale des émotions à partir de longues vidéos synchronisées avec des signaux physiologiques. Plus précisément, les méthodes de reconnaissance multimodale des émotions rencontrent trois principaux défis : (a) l'apprentissage de représentations des émotions selon, (b) l'apprentissage de représentations d'émotions fines, et(c) la combinaison de modalités pour prédire les émotions. Dans ce travail, nous introduisons tout d'abord deux grands ensembles de données pour l'analyse comportementale : INEMO et StressID. INEMO est un ensemble de données multimodales conçu pour faciliter la reconnaissance des émotions lors du visionnage de vidéos issues des réseaux sociaux. StressID, quant à lui, est un ensemble de données multimodales conçu pour l'identification du stress. Ensuite, nous proposons deux techniques de pré-entraînement pour la reconnaissance des expressions faciales : 1. un pré-entraînement supervisé sur des données synthétiques générées par notre méthode de génération de vidéos, et 2. un pré-entraînement auto-supervisé sur des vidéos multi-vues. Nous démontrons que ces techniques permettent d'obtenir des représentations faciales riches, améliorant ainsi la précision de la reconnaissance des émotions fines. Enfin, nous abordons la problématique de la reconnaissance des émotions à partir de multiples modalités. Nous proposons un cadre pour la fusion multimodale de vidéos et de signaux physiologiques afin de prédire les émotions. Ce cadre repose principalement sur deux étapes : 1. l'extraction de caractéristiques à partir de longues vidéos brutes et de signaux physiologiques ; 2. la fusion des caractéristiques extraites pour prédire les émotions en utilisant une approche intermodale basée sur un mécanisme d'attention. Notre méthode exploite les modalités supplémentaires, ce qui améliore significativement les performances de reconnaissance des émotions. Nos méthodes ont été évaluées de manière approfondie sur plusieurs ensembles de données de référence pour la reconnaissance des émotions. Les résultats montrent que les méthodes proposées surpassent les approches précédentes, ouvrant la voie à des déploiements concrets dans des environnements réels.