Thèse soutenue

Tracking intermittent and moving speakers with speaker-identity information

FR  |  
EN
Auteur / Autrice : Taous Iatariene
Direction : Romain SerizelAlexandre Guérin
Type : Thèse de doctorat
Discipline(s) : Informatique
Date : Soutenance le 22/06/2026
Etablissement(s) : Université de Lorraine
Ecole(s) doctorale(s) : École doctorale IAEM Lorraine - Informatique, Automatique, Électronique - Électrotechnique, Mathématiques de Lorraine (1992-....)
Partenaire(s) de recherche : Laboratoire : Laboratoire lorrain de recherche en informatique et ses applications
Jury : Président / Présidente : Toon Van Waterschoot
Examinateurs / Examinatrices : Nancy Bertin
Rapporteurs / Rapporteuses : Marie Tahon, Archontis Politis
DOI : 10.70675/7d00a820zd012z4672zadf6z678e337e7454

Résumé

FR  |  
EN

L'estimation de la position de sources sonores à partir d'enregistrements audio est utile pour certaines applications industrielles exploitant l'information spatiale, telles que les systèmes de captation visant à extraire une source d'intérêt en présence de bruit. Cette thèse répond à ce besoin et porte sur le suivi des sources sonores, une sous-tâche de l'analyse de scènes spatiales visant à estimer, au cours du temps, les positions des sources sonores à partir d'enregistrements réalisés par des antennes microphoniques. Cette thèse se concentre en particulier sur les scénarios impliquant des sources de parole dans des environnements acoustiques fermés tels que des salles. L'accent est mis sur le cas des locuteurs mobiles et intermittents, susceptibles d'alterner entre des périodes de parole et de silence, tout en pouvant se déplacer pendant ces silences. Bien que pouvant arriver dans des situations réelles, ce scénario reste peu étudié par la communauté scientifique. Il pose toutefois des défis importants: lorsqu'un locuteur est silencieux, sa position ne peut pas être estimée, et tout mouvement imprévisible complique la tâche de suivi devant lier les positions avant et après la période de silence. Une première contribution de cette thèse consiste à formaliser ce problème et à étudier la capacité des systèmes de suivi actuels à gérer ce scénario. Dans ce cadre, un protocole d'évaluation est proposé, comprenant LibriJump, un jeu de données simulées composé de scènes acoustiques comportant des locuteurs intermittents pouvant se déplacer de façon imprévisible pendant les périodes de silence. Il introduit également de nouvelles métriques de suivi complémentaires à celles déjà existantes, développées en adaptant de récentes métriques issues du suivi multi-objets au suivi des sources sonores. Les expériences menées à l'aide de ce nouveau protocole sur des systèmes de suivi représentatifs des approches récentes confirment que les mouvements imprévisibles pendant les silences constituent une limite des systèmes actuels. Les contributions suivantes étudient l'intégration de plongements (embeddings) de locuteurs dans les systèmes de suivi, afin d'améliorer les performances dans des scénarios impliquant des locuteurs mobiles et intermittents. Les embeddings de locuteurs sont des représentations vectorielles compactes de l'identité des locuteurs. Ils sont couramment utilisés dans des tâches de traitement de la parole telles que la reconnaissance de locuteurs et la diarisation, mais n'ont pas, à notre connaissance, été utilisés pour le suivi de locuteurs. Une première solution proposée repose sur un modèle d'extraction d'embeddings standard et pré-entraîné, avec l'idée que l'information liée à l'identité des locuteurs permet d'améliorer la tâche de suivi malgré l'occurrence de mouvements imprévisibles pendant les périodes de silence. Les résultats obtenus sur LibriJump démontrent la pertinence des embeddings de locuteurs pour le suivi de locuteurs mobiles et intermittents. Cependant, cette première solution reste sensible aux facteurs susceptibles de dégrader la qualité de l'extraction des embeddings. Un modèle plus adapté est donc développé dans une deuxième étude afin de mieux s'adapter aux contraintes de la tâche de suivi. La stratégie d'apprentissage proposée vise à extraire des représentations robustes à partir de contextes temporels courts et en présence de parole superposée. Les résultats démontrent l'efficacité de cette stratégie d'apprentissage pour l'extraction d'embeddings de locuteur à partir de courts contextes temporels et montrent une robustesse accrue au recouvrement de parole, même si une marge d'amélioration demeure quant à ce dernier aspect.