Apprentissage par transfert pour l'analyse sémantique translingue
| Auteur / Autrice : | Jeongwoo Kang |
| Direction : | Didier Schwab, Maximin Coavoux, Cédric Lopez |
| Type : | Thèse de doctorat |
| Discipline(s) : | Informatique |
| Date : | Soutenance le 08/04/2025 |
| Etablissement(s) : | Université Grenoble Alpes |
| Ecole(s) doctorale(s) : | École doctorale Mathématiques, sciences et technologies de l'information, informatique (Grenoble, Isère, France ; 1995-....) |
| Partenaire(s) de recherche : | Laboratoire : Laboratoire d'informatique de Grenoble (Isère, France ; 2007-....) |
| Equipe de recherche : Groupe d'étude en traduction automatique - Traitement automatisé des langues et de la parole (Grenoble ; 2007-....) | |
| Jury : | Président / Présidente : Éric Gaussier |
| Examinateurs / Examinatrices : Chloé Braud | |
| Rapporteurs / Rapporteuses : Marie-Hélène Candito, Patrice Bellot | |
| DOI : | 10.70675/0dab41b5za289z4b88z9380ze7ebe0d5092f |
Mots clés
Résumé
Abstract Meaning Representation (AMR) capture l'information sémantique des textes et la représente sous la forme d'un graphe. Les graphes AMR sont utiles à de nombreux systèmes de Traitement Automatique des Langues (TAL) en présentant l'information sous une forme structurée, canonique et moins ambiguë. Par conséquent, la conception et le développement d'analyseurs AMR pour générer automatiquement des graphes AMR est une tâche importante. La construction de tels modèles pour le français est cependant confrontée à un défi majeur en raison du manque de données, à la fois pour l'évaluation et l'entraînement. Cette recherche a abordé ces défis à travers trois contributions clés visant à faire progresser l'analyse sémantique AMR en français. Premièrement, nous développons des données d'évaluation AMR multilingues. Ces ensembles de données comportent deux niveaux de qualité (or et argent) en fonction du degré d'intervention manuelle. Les données gold sont obtenues par alignement manuel des données. Nous utilisons les données AMR de l'anglais The Little Prince et les alignons manuellement sur les traductions multilingues. Cet alignement manuel minutieux garantit la qualité et la fiabilité des données. En revanche, les données silver sont obtenues par traduction automatique sans contrôle manuel de la qualité. Par conséquent, nous évaluons ces données de manière intrinsèque et extrinsèque afin de déterminer leur fiabilité. Deuxièmement, nous explorons les approches d'apprentissage zero/few-shot pour entraîner un analyseur AMR pour nos langues cibles sans accès aux données d'entraînement correspondantes. Nous expérimentons deux méthodes différentes : Speaking the Graph Language via Multilingual Translation (Procopio et al., 2021, SGL) et le méta-apprentissage. En reproduisant SGL, nous comparons les configurations bilingues et multilingues afin de déterminer quelle configuration fournit les meilleurs résultats dans les scénarios d'apprentissage zero-shot. En outre, nous appliquons le méta-apprentissage pour entraîner un modèle capable de s'adapter rapidement à une nouvelle langue cible avec quelques exemples. Afin d'évaluer l'efficacité du méta-apprentissage pour l'analyse AMR translingue, nous comparons ses performances à celles d'une approche d'apprentissage conjoint, ce qui donne un aperçu de son applicabilité à l'analyse AMR translingue. Enfin, nous proposons une autre façon de linéariser les graphes AMR pour l'apprentissage de modèles séquence à séquence. Récemment, l'utilisation d'un modèle séquence-séquence pour l'analyse syntaxique AMR a suscité beaucoup d'intérêt en raison de sa simplicité et de son efficacité. La linéarisation des graphes AMR est une condition préalable à ces méthodes. L'encodage de Penman a été un choix courant pour la linéarisation de l'AMR mais nous émettons l'hypothèse que l'encodage de Penman a des limites pour capturer les structures de graphe profondes de l'AMR. Nous proposons une autre façon de les linéariser avec des triplets et nous évaluons notre méthode sur différentes dimensions, en nous concentrant particulièrement sur la profondeur et la longueur des graphes.