Thèse soutenue

Entraînement adverse divers et adaptatif pour la robustesse de l'apprentissage par renforcement

FR  |  
EN
Auteur / Autrice : Lucas Schott
Direction : Sylvain LamprierHatem HajriElies Gherbi
Type : Thèse de doctorat
Discipline(s) : Sciences et technologies de l'information et de la communication
Date : Soutenance le 14/04/2026
Etablissement(s) : Sorbonne université
Ecole(s) doctorale(s) : École doctorale Informatique, télécommunications et électronique de Paris (1992-....)
Partenaire(s) de recherche : Laboratoire : LIP6 (1997-....)
Jury : Président / Présidente : Stéphane Doncieux
Examinateurs / Examinatrices : Myriam Tami, Matthieu Geist
Rapporteurs / Rapporteuses : Ludovic Denoyer, David Filliat
DOI : 10.70675/5d6e715azaa48z4ff8za86dz4604cd08ab1e

Résumé

FR  |  
EN

L'apprentissage par renforcement (RL) permet à des agents artificiels d'apprendre par essais et erreurs, à l'image des humains et des animaux. Malgré des avancées remarquables dans les jeux, la robotique ou la navigation, les agents RL demeurent extrêmement sensibles aux variations de leur environnement. De faibles modifications dans les observations, la dynamique ou le bruit des capteurs peuvent conduire un agent pourtant bien entraîné à prendre des décisions dangereuses. Cette fragilité limite fortement la fiabilité du RL dans des applications réelles. Cette thèse étudie comment concevoir des agents RL capables de rester fiables, aussi bien dans des conditions nominales que face à d'importantes perturbations. Dans ce but, nous développons d'abord ADARO-RL, un framework open-source qui unifie la génération d'attaques adverses, l'évaluation de la robustesse et l'entraînement adverse pour le RL. Il fournit des processus standardisés, plusieurs modèles de perturbations et des outils pour permettre de modifier les observations et la dynamique des environnements, constituant ainsi la base pour les expérimentations de l'ensemble de la thèse. Nous proposons ensuite EACN, une nouvelle méthode d'entraînement adversarial qui perturbe les dynamiques de l'environnement en utilisant les gradients issus du réseau critique de l'agent RL. Contrairement aux agents adversaires nécessitant un entraînement coûteux, EACN génère efficacement des perturbations réalistes, avec un objectif à long terme, et améliore la robustesse au-delà des approches existantes. Nous étudions ensuite comment la robustesse peut émerger de la combinaison de plusieurs politiques. À travers des expérimentations en classification et en RL, nous montrons que l'ensemble et la fusion des poids de plusieurs agents, chacun entraîné contre un type d'attaque différent, permettent une généralisation partielle de la robustesse. Enfin, nous introduisons un mécanisme adaptatif de régulation de la force des perturbations, qui ajuste automatiquement l'intensité des attaques au cours de l'entraînement. Ce processus, analogue à un curriculum, stabilise l'apprentissage et réduit le besoin de réglages d'hyperparamètres. Ensemble, ces contributions apportent de nouvelles méthodes, outils et perspectives pour développer des agents RL non seulement performants, mais également plus robustes, fiables et aptes à être déployés dans des environnements réels imprévisibles.