Contributions au développement de contrôleurs d’AUV basés sur de l’apprentissage profond par renforcement
| Auteur / Autrice : | Yoann Sola |
| Direction : | Benoît Clément |
| Type : | Thèse de doctorat |
| Discipline(s) : | Automatique, Productique et Robotique |
| Date : | Soutenance le 03/12/2021 |
| Etablissement(s) : | Brest, École nationale supérieure de techniques avancées Bretagne |
| Ecole(s) doctorale(s) : | École doctorale Mathématiques et sciences et technologies de l'information et de la communication (Rennes) |
| Partenaire(s) de recherche : | Laboratoire : Laboratoire en sciences et techniques de l'information, de la communication et de la connaissance (Brest ; 2012-....) - Laboratoire des sciences et techniques de l'information, de la communication et de la connaissance |
| : Agence de l'innovation de défense (France) | |
| Jury : | Président / Présidente : Ali Mansour |
| Examinateurs / Examinatrices : Ali Mansour, Vincent Creuze, Jean-Philippe Diguet, Véronique Serfaty, Gilles Le Chenadec, Benoît Desrochers | |
| Rapporteurs / Rapporteuses : Vincent Creuze, Jean-Philippe Diguet | |
| DOI : | 10.70675/bcad951bz3855z49f0zafc2z99f75e9dc182 |
Mots clés
Mots clés contrôlés
Résumé
L’environnement marin est un cadre très hostile pour la robotique. Il est fortement non-structuré, très incertain et inclut beaucoup de perturbations externes qui ne peuvent pas être facilement prédites ou modélisées. Dans ce travail, nous allons essayer de contrôler un véhicule sous-marin autonome (AUV) afin d’effectuer une tâche de suivi de points de cheminement, en utilisant un contrôleur basé sur de l’apprentissage automatique. L’apprentissage automatique a permis de faire des progrès impressionnants dans de nombreux domaines différents ces dernières années, et le sous-domaine de l’apprentissage profond par renforcement a réussi à concevoir plusieurs algorithmes très adaptés au contrôle continu de systèmes dynamiques. Nous avons choisi d’implémenter l’algorithme du Soft Actor-Critic (SAC), un algorithme d’apprentissage profond par renforcement régularisé en entropie permettant de simultanément remplir une tâche d’apprentissage et d’encourager l’exploration de l’environnement. Nous avons comparé un contrôleur basé sur le SAC avec un contrôleur Proportionnel-Intégral-Dérivé (PID) sur une tâche de suivi de points de cheminement et en utilisant des métriques de performance spécifiques. Tous ces tests ont été effectués en simulation grâce à l’utilisation de l’UUV Simulator. Nous avons décidé d’appliquer ces deux contrôleurs au RexROV 2, un véhicule sous-marin téléguidé (ROV) de forme cubique et à six degrés de liberté converti en AUV. Grâce à ces tests, nous avons réussi à proposer plusieurs contributions intéressantes telles que permettre au SAC d’accomplir un contrôle de l’AUV de bout en bout, surpasser le contrôleur PID en terme d’économie d’énergie, et réduire la quantité d’informations dont l’algorithme du SAC a besoin. De plus nous proposons une méthodologie pour l’entraînement d’algorithmes d’apprentissage profond par renforcement sur des tâches de contrôle, ainsi qu’une discussion sur l’absence d’algorithmes de guidage pour notre contrôleur d’AUV de bout en bout.