Apprentissage multimodal efficace et évolutif
| Auteur / Autrice : | Mustafa Shukor |
| Direction : | Matthieu Cord |
| Type : | Thèse de doctorat |
| Discipline(s) : | Sciences de l'ingénieur |
| Date : | Soutenance le 24/03/2026 |
| Etablissement(s) : | Sorbonne université |
| Ecole(s) doctorale(s) : | École doctorale Informatique, télécommunications et électronique de Paris (1992-....) |
| Partenaire(s) de recherche : | Laboratoire : Institut des systèmes intelligents et de robotique (Paris ; 2009-....) |
| Jury : | Président / Présidente : Mohamed Chetouani |
| Examinateurs / Examinatrices : Cordelia Schmid, Vicky Kalogeiton | |
| Rapporteurs / Rapporteuses : Graham Taylor, Christian Wolf | |
| DOI : | 10.70675/59b4ea33zaa5bz40c3zb89cz5619c9158b46 |
Mots clés
Résumé
Les modèles de fondation ont permis des avancées spectaculaires en perception et en langage, mais leurs coûts d’entraînement et de déploiement limitent de plus en plus l’accessibilité, la reproductibilité et la durabilité. Cette thèse développe une perspective unifiée de l’efficacité des modèles de fondation multimodaux — au sens des paramètres, du calcul, des données et de la conception architecturale — et propose des méthodes et des principes rendant les grands systèmes multimodaux à la fois plus abordables et mieux compris. Nous étudions d’abord l’adaptation et l’inférence efficaces des grands modèles de langage multimodaux, en montrant que des performances compétitives sur des tâches image–texte, vidéo–texte et audio–texte peuvent être obtenues dans des régimes d’adaptation extrêmement parcimonieux en paramètres, en gelant plus de 99% des backbones vision et langage et en n’entraînant que des connecteurs légers (p. ex., eP-ALM et DePALM) ; nous réduisons ensuite davantage le coût d’inférence en mettant en évidence des redondances entre couches et en proposant des stratégies de saut de calcul sélectif au niveau des jetons et des couches. Nous abordons ensuite le pré-entraînement multimodal efficace en unifiant tâches et modalités au sein d’un cadre unique de type séquence-à-séquence (UnIVAL), en proposant un objectif autorégressif multimodal général pour de grands encodeurs visuels (AIMv2), et en dérivant des lois d’échelle ainsi que des recommandations compute-optimales pour des architectures multimodales natives et pour le choix de mélanges de données optimaux sous contraintes budgétaires. Nous complétons ces avancées par de l’analyse et du contrôle : en étudiant les représentations internes de LLMs multimodaux gelés ou affinés, nous caractérisons l’alignement multimodal implicite, relions le désalignement à des modes d’échec tels que les hallucinations, et proposons des mécanismes de pilotage par activations permettant d’améliorer la contrôlabilité sans entraînement supplémentaire. Enfin, nous transposons ces idées à des applications pratiques en concevant des agents multimodaux compacts pour des contextes incarnés, notamment des politiques vision–langage–action efficaces (SmolVLA) et une prédiction dans un espace d’embedding pour une compréhension en flux à faible latence (VL-JEPA). Au final, cette thèse fournit une boîte à outils cohérente et un ensemble de principes empiriques pour construire des modèles de fondation multimodaux conscients des coûts de calcul, économes en données et contrôlables — afin de démocratiser leur développement et leur déploiement tout en améliorant leur fiabilité en conditions réelles.