Thèse soutenue

Contributions méthodologiques en apprentissage profond pour la vision par ordinateur : application à la prédiction de l'état des routes

FR  |  
EN
Auteur / Autrice : Hai Vy Nguyen
Direction : Fabrice GamboaSerge Gratton
Type : Thèse de doctorat
Discipline(s) : Mathématiques et Applications
Date : Soutenance le 02/12/2025
Etablissement(s) : Université de Toulouse (2023-2025)
Ecole(s) doctorale(s) : École doctorale Mathématiques, informatique et télécommunications (Toulouse)
Partenaire(s) de recherche : Laboratoire : Institut de mathématiques de Toulouse (2007-....)
Etablissement de délivrance conjointe : Université de Toulouse (EPE ; 2025-....)
Jury : Président / Présidente : Marianne Clausel
Rapporteurs / Rapporteuses : Rémi Flamary, Jean-François Aujol
DOI : 10.70675/5f015c36zc99cz4c3dz9071zcef52271f82e

Mots clés

FR  |  
EN

Mots clés contrôlés

Résumé

FR  |  
EN

Cette thèse de doctorat explore des méthodes visant à améliorer la robustesse, la transférabilité, la quantification d'incertitude et l'interprétabilité des réseaux de neurones profonds, en se concentrant sur la modélisation et l'exploitation de la géométrie de l'espace des caractéristiques. Ces travaux sont motivés par des besoins pratiques en modèles légers et fiables pour la prédiction en temps réel de l'état des routes, tout en abordant des questions fondamentales en apprentissage de représentations.La première contribution propose un cadre d'entraînement de modèles robustes, combinant une perte discriminative sur l'avant-dernière couche et l'injection de bruit gaussien. Cette approche favorise la compacité intra-classe, la séparabilité inter-classe et l'alignement des caractéristiques bruitées avec leurs homologues non-bruitées. Sur le plan théorique, nous montrons que l'injection de bruit réduit implicitement les valeurs propres de la hessienne de la perte. Cela procure une explication rigoureuse de l'amélioration de la stabilité. Empiriquement, les modèles construits dans ce cadre maintiennent une haute précision sous diverses perturbations. Notre approche fournit donc une méthode pratique et évolutive pour renforcer la robustesse.La deuxième contribution traite du transfert de caractéristiques depuis des modèles volumineux (modèles enseignants) vers des modèles légers (modèles étudiants), via la notion de cohérence perceptive. Plutôt que de copier les caractéristiques exactes, le modèle étudiant préserve l'ordre relatif des distances entre points tel qu'établit par le modèle enseignant. Cette préservation relationnelle respecte la capacité limitée du modèle étudiant tout en conservant la structure globale essentielle. Nous proposons également une interprétation probabiliste de cette cohérence. Les expériences confirment une amélioration du transfert de connaissances, avec une flexibilité accrue entre les architectures.La troisième contribution introduit une méthode non paramétrique et sans hypothèse de distribution pour l'estimation de l'incertitude. Elle est basée sur la Profondeur de Lentille (Lens Depth) et la Distance Fermat. Fonctionnant entièrement dans l'espace des caractéristiques à l'inférence, cette méthode fournit des scores interprétables pour les entrées dans le domaine et hors domaine (OOD), sans nécessiter de ré-entraînement. En mesurant la centralité au sein de la distribution des caractéristiques, elle identifie de manière fiable les échantillons OOD, soutenant un déploiement plus sûr dans des applications critiques.Enfin, cette thèse présente le Module d'Attention Rectangulaire Convolutif (CRAM) pour une attention interprétable et spatialement cohérente. CRAM prédit des rectangles géométriques simples pour mettre en évidence les régions d'attention, sous contrainte d'équivariance faible, produisant des cartes d'attention lisses et de faible dimension. Le module est léger, facilement intégrable aux modèles existants, et améliore la précision et la robustesse par rapport aux approches d'attention positionnelle.Globalement, cette thèse démontre qu'un raisonnement explicite dans l'espace des caractéristiques-par l'entraînement robuste, le transfert relationnel, l'estimation géométrique de l'incertitude ou l'attention structurée-permet aux réseaux de neurones de devenir plus fiables, interprétables et déployables dans des contextes réels. La généralité de ces méthodes autorise leur application à un large éventail de problèmes.