Approches sensibles à l'affect pour le résumé automatique de textes : application au dialogue et à la remédiation cognitive dans un contexte à faibles ressources
| Auteur / Autrice : | Yongxin Zhou |
| Direction : | François Portet, Fabien Ringeval |
| Type : | Thèse de doctorat |
| Discipline(s) : | Informatique |
| Date : | Soutenance le 06/11/2024 |
| Etablissement(s) : | Université Grenoble Alpes |
| Ecole(s) doctorale(s) : | École doctorale Mathématiques, sciences et technologies de l'information, informatique (Grenoble, Isère, France ; 1995-....) |
| Partenaire(s) de recherche : | Laboratoire : Laboratoire d'informatique de Grenoble (Isère, France ; 2007-....) |
| Equipe de recherche : Groupe d'étude en traduction automatique - Traitement automatisé des langues et de la parole (Grenoble ; 2007-....) | |
| Jury : | Président / Présidente : Cyril Labbé |
| Examinateurs / Examinatrices : Benoît Favre, Mariët Theune | |
| Rapporteurs / Rapporteuses : Claire Gardent, Albert Gatt | |
| DOI : | 10.70675/8ec4dbe0z863dz45b6z8150zbdca53aadd38 |
Mots clés
Résumé
Cette thèse explore la génération automatique de texte (GAT) pour la thérapie numérique, en se concentrant sur la génération de rapports qui résument les sessions d'entraînement cognitif menées par les patients à domicile avec un assistant virtuel. L'objectif est de fournir aux orthophonistes des informations précieuses pour le suivi des patients. Nous avons abordé deux objectifs principaux : l'identification des informations médicales pertinentes à rapporter et l'extraction des points clés des dialogues entre le patient et l'assistant virtuel.Menée dans un contexte de faibles ressources, la recherche a été confrontée à des défis tels que la non-disponibilité des experts et des données et le traitement des informations affectives. Pour relever ces défis, nous avons adopté deux stratégies : la génération de données vers le texte (D2T) et la génération de texte vers le texte (T2T), en mettant l'accent sur le traitement de l'affect.Pour la génération T2T, afin de faire face au manque de ressources, nous avons utilisé des corpus de dialogues de centres d'appels français tels que DECODA et des modèles pré-appris français et multilingues. Nous avons évalué la performance des modèles en utilisant des mesures automatiques et une évaluation humaine. Nous avons également expérimenté en instruisant de grands modèles de langage (LLMs) sur des ensembles de données en français et en anglais avec diverses prompts, en comparant les résultats avec des modèles pré-appris. Notre évaluation a révélé que les modèles pré-appris ont obtenu de meilleures performances en termes de métriques automatiques, tandis que les résultats de ChatGPT et GPT-4 ont été préférés par les évaluateurs humains.En outre, nous avons introduit PSentScore, un ensemble de mesures visant à quantifier la préservation du contenu affectif dans les résumés de dialogue. Nous avons entraîné des modèles d'analyse du sentiment au niveau des mots. Nous avons mené des expériences sur un ensemble de données de dialogues en anglais (DialogSum), en contrôlant les données d'entraînement, afin de valider notre approche. Nous avons ensuite proposé un nouvel ensemble de mesures pour évaluer la pertinence d'un résumé basé sur la charge affective (proportion) et sa polarité. En utilisant ces mesures, nous avons montré que le modèle de résumé présente souvent une inadéquation entre le contenu affectif du dialogue d'entrée et le résumé. Nous avons également montré qu'en sélectionnant soigneusement les données d'entraînement, nous pouvions réduire ce problème.Pour la génération de D2T, nous avons présenté une application réelle des systèmes GAT : la génération de rapports résumant les sessions de remédiation à distance. Nous avons présenté la conception du rapport de session de remédiation en utilisant deux sources disponibles pour proposer une taxonomie d'informations clés. Nous avons d'abord développé un système basé sur des templates qui implique de proposer une structure de document et d'extraire des caractéristiques. Nous avons également mené des expériences avec GPT-4 en utilisant les mêmes données d'entrée que le système basé sur des templates. Les résultats de l'évaluation humaine ont montré que les rapports générés ont eu des scores moyens de 3.91 (template) et de 3.81 (GPT-4) sur 5. De plus, à partir des commentaires et des entretiens avec les évaluateurs, nous avons pu établir une liste de recommandations pour les rapports dans ce scénario.Cette thèse contribue au domaine de l'évaluation et de l'application de GAT, en faisant les premiers pas vers un GAT sensible à l'affect, crucial pour des domaines tels que les soins de santé et le service à la clientèle. Notre recherche souligne l'importance d'incorporer les émotions et les sentiments dans les systèmes de GAT afin d'améliorer leur efficacité dans les applications du monde réel, telles que l'aide aux orthophonistes avec des outils automatisés pour générer des rapports résumant les progrès des patients.