Améliorations des représentations pour la conduite autonome
| Auteur / Autrice : | Loïck Chambon |
| Direction : | Matthieu Cord |
| Type : | Thèse de doctorat |
| Discipline(s) : | Sciences et technologies de l'information et de la communication |
| Date : | Soutenance le 23/02/2026 |
| Etablissement(s) : | Sorbonne université |
| Ecole(s) doctorale(s) : | École doctorale Informatique, télécommunications et électronique de Paris (1992-....) |
| Partenaire(s) de recherche : | Laboratoire : Institut des systèmes intelligents et de robotique (Paris ; 2009-....) |
| Jury : | Président / Présidente : Catherine Achard |
| Examinateurs / Examinatrices : Fatma Güney, Éloi Zablocki | |
| Rapporteurs / Rapporteuses : Alexandre Alahi, Vincent Lepetit | |
| DOI : | 10.70675/a24a7fbaz031ez4c52zba86zc1d8c62ec3b3 |
Mots clés
Mots clés contrôlés
Mots clés libres
Résumé
Pour naviguer en toute sécurité dans le monde réel, les véhicules autonomes doivent être capables de percevoir et de comprendre un environnement complexe et dynamique. À cette fin, ils sont équipés de capteurs variés fournissant des données brutes riches et diversifiées. La qualité des représentations extraites de ces données est cruciale pour obtenir de bonnes performances. Cependant, dans un système embarqué, les contraintes de temps de calcul et de ressources sont également critiques. Obtenir des représentations de haute qualité tout en minimisant le coût de calcul et l'utilisation des ressources reste donc un défi majeur. Dans cette thèse, nous visons à améliorer les représentations à la fois en termes de qualité et d'efficacité. Dans un premier temps, nous étudierons la segmentation en vue de dessus Bird's-Eye View (BEV) à partir d'images caméras. Cette tâche consiste à prédire la position statique et dynamique des agents dans une scène urbaine, sans recourir à des données 3D en entrée. L'objectif sera de concevoir un réseau atteignant de hautes performances tout en restant significativement plus efficace en calcul que les approches existantes. Dans un second temps, nous nous concentrerons sur la reconstruction 3D sémantique de scènes urbaines à partir d'images caméras. Cette tâche consiste à attribuer une classe sémantique à chaque voxel d'une grille 3D couvrant la scène, sans utiliser de capteurs 3D en entrée. Pour améliorer la qualité des représentations dans les réseaux existants, nous proposerons un nouvel objectif d'entraînement imposant la reprojection des représentations 3D dans le domaine image, alignant ainsi les prédictions 2D et 3D. Enfin, nous étudierons le sur-échantillonnage de caractéristiques visuelles pour améliorer la qualité des représentations pour diverses tâches, y compris la conduite autonome. Les réseaux basés sur les images sous-échantillonnent généralement les informations spatiales pour produire des représentations sémantiquement riches, alors que de nombreuses tâches bénéficient de caractéristiques à plus haute résolution. Augmenter simplement la résolution d'entrée entraîne cependant un surcoût computationnel important. L'objectif sera donc de développer des méthodes permettant d'obtenir des représentations haute résolution avec un coût de calcul minimal, améliorant ainsi la précision et l'efficacité des représentations.