Entraînement adverse divers et adaptatif pour la robustesse de l'apprentissage par renforcement
| Auteur / Autrice : | Lucas Schott |
| Direction : | Sylvain Lamprier, Hatem Hajri, Elies Gherbi |
| Type : | Thèse de doctorat |
| Discipline(s) : | Sciences et technologies de l'information et de la communication |
| Date : | Soutenance le 14/04/2026 |
| Etablissement(s) : | Sorbonne université |
| Ecole(s) doctorale(s) : | École doctorale Informatique, télécommunications et électronique de Paris (1992-....) |
| Partenaire(s) de recherche : | Laboratoire : LIP6 (1997-....) |
| Jury : | Président / Présidente : Stéphane Doncieux |
| Examinateurs / Examinatrices : Myriam Tami, Matthieu Geist | |
| Rapporteurs / Rapporteuses : Ludovic Denoyer, David Filliat | |
| DOI : | 10.70675/5d6e715azaa48z4ff8za86dz4604cd08ab1e |
Résumé
L'apprentissage par renforcement (RL) permet à des agents artificiels d'apprendre par essais et erreurs, à l'image des humains et des animaux. Malgré des avancées remarquables dans les jeux, la robotique ou la navigation, les agents RL demeurent extrêmement sensibles aux variations de leur environnement. De faibles modifications dans les observations, la dynamique ou le bruit des capteurs peuvent conduire un agent pourtant bien entraîné à prendre des décisions dangereuses. Cette fragilité limite fortement la fiabilité du RL dans des applications réelles. Cette thèse étudie comment concevoir des agents RL capables de rester fiables, aussi bien dans des conditions nominales que face à d'importantes perturbations. Dans ce but, nous développons d'abord ADARO-RL, un framework open-source qui unifie la génération d'attaques adverses, l'évaluation de la robustesse et l'entraînement adverse pour le RL. Il fournit des processus standardisés, plusieurs modèles de perturbations et des outils pour permettre de modifier les observations et la dynamique des environnements, constituant ainsi la base pour les expérimentations de l'ensemble de la thèse. Nous proposons ensuite EACN, une nouvelle méthode d'entraînement adversarial qui perturbe les dynamiques de l'environnement en utilisant les gradients issus du réseau critique de l'agent RL. Contrairement aux agents adversaires nécessitant un entraînement coûteux, EACN génère efficacement des perturbations réalistes, avec un objectif à long terme, et améliore la robustesse au-delà des approches existantes. Nous étudions ensuite comment la robustesse peut émerger de la combinaison de plusieurs politiques. À travers des expérimentations en classification et en RL, nous montrons que l'ensemble et la fusion des poids de plusieurs agents, chacun entraîné contre un type d'attaque différent, permettent une généralisation partielle de la robustesse. Enfin, nous introduisons un mécanisme adaptatif de régulation de la force des perturbations, qui ajuste automatiquement l'intensité des attaques au cours de l'entraînement. Ce processus, analogue à un curriculum, stabilise l'apprentissage et réduit le besoin de réglages d'hyperparamètres. Ensemble, ces contributions apportent de nouvelles méthodes, outils et perspectives pour développer des agents RL non seulement performants, mais également plus robustes, fiables et aptes à être déployés dans des environnements réels imprévisibles.