Skip to Main content Skip to Navigation
Theses

Unsupervised word discovery for computational language documentation

Résumé : La diversité linguistique est actuellement menacée : la moitié des langues connues dans le monde pourraient disparaître d'ici la fin du siècle. Cette prise de conscience a inspiré de nombreuses initiatives dans le domaine de la linguistique documentaire au cours des deux dernières décennies, et 2019 a été proclamée Année internationale des langues autochtones par les Nations Unies, pour sensibiliser le public à cette question et encourager les initiatives de documentation et de préservation. Néanmoins, ce travail est coûteux en temps, et le nombre de linguistes de terrain, limité. Par conséquent, le domaine émergent de la documentation linguistique computationnelle (CLD) vise à favoriser le travail des linguistes à l'aide d'outils de traitement automatique. Le projet Breaking the Unwritten Language Barrier (BULB), par exemple, constitue l'un des efforts qui définissent ce nouveau domaine, et réunit des linguistes et des informaticiens. Cette thèse examine le problème particulier de la découverte de mots dans un flot non segmenté de caractères, ou de phonèmes, transcrits à partir du signal de parole dans un contexte de langues très peu dotées. Il s'agit principalement d'une procédure de segmentation, qui peut également être couplée à une procédure d'alignement lorsqu'une traduction est disponible. En utilisant deux corpus en langues bantoues correspondant à un scénario réaliste pour la linguistique documentaire, l'un en Mboshi (République du Congo) et l'autre en Myene (Gabon), nous comparons diverses méthodes monolingues et bilingues de découverte de mots sans supervision. Nous montrons ensuite que l'utilisation de connaissances linguistiques expertes au sein du formalisme des Adaptor Grammars peut grandement améliorer les résultats de la segmentation, et nous indiquons également des façons d'utiliser ce formalisme comme outil de décision pour le linguiste. Nous proposons aussi une variante tonale pour un algorithme de segmentation bayésien non-paramétrique, qui utilise un schéma de repli modifié pour capturer la structure tonale. Pour tirer parti de la supervision faible d'une traduction, nous proposons et étendons, enfin, une méthode de segmentation neuronale basée sur l'attention, et améliorons significativement la performance d'une méthode bilingue existante.
Complete list of metadatas

Cited literature [286 references]  Display  Hide  Download

https://tel.archives-ouvertes.fr/tel-02286425
Contributor : Abes Star :  Contact
Submitted on : Friday, September 13, 2019 - 3:44:06 PM
Last modification on : Wednesday, June 24, 2020 - 2:30:09 PM
Document(s) archivé(s) le : Saturday, February 8, 2020 - 1:58:59 PM

File

75551_GODARD_2019_archivage.pd...
Version validated by the jury (STAR)

Identifiers

  • HAL Id : tel-02286425, version 1

Citation

Pierre Godard. Unsupervised word discovery for computational language documentation. Artificial Intelligence [cs.AI]. Université Paris-Saclay, 2019. English. ⟨NNT : 2019SACLS062⟩. ⟨tel-02286425⟩

Share

Metrics

Record views

207

Files downloads

205