-
10
pages
-
Français
-
Documents
Description
TALN 2009 – Session posters, Senlis, 24-26 juin 2009
Segmentation multiple d’un flux de données textuelles pour la
modélisation statistique du langage
Sopheap Seng (1, 2), Laurent Besacier (1), Brigitte Bigi (1), Eric Castelli (2)
(1) Laboratoire LIG/GETALP, Grenoble France
{Sopheap.Seng, Laurent.Besacier, Brigitte.Bigi}@imag.fr
(2) Laboratoire MICA, CNRS/UMI-2954, Hanoi Vietnam
Eric.Castelli@mica.edu.vn
Résumé Dans cet article, nous traitons du problème de la modélisation statistique du
langage pour les langues peu dotées et sans segmentation entre les mots. Tandis que le
manque de données textuelles a un impact sur la performance des modèles, les erreurs
introduites par la segmentation automatique peuvent rendre ces données encore moins
exploitables. Pour exploiter au mieux les données textuelles, nous proposons une méthode qui
effectue des segmentations multiples sur le corpus d’apprentissage au lieu d’une segmentation
unique. Cette méthode basée sur les automates d’état finis permet de retrouver les n-grammes
non trouvés par la segmentation unique et de générer des nouveaux n-grammes pour
l’apprentissage de modèle du langage. L’application de cette approche pour l’apprentissage
des modèles de langage pour les systèmes de reconnaissance automatique de la parole en
langue khmère et vietnamienne s’est montrée plus performante que la méthode par
segmentation unique, à base de règles.
Abstract In this article we deal with the problem of statistical ...
Segmentation multiple d’un flux de données textuelles pour la
modélisation statistique du langage
Sopheap Seng (1, 2), Laurent Besacier (1), Brigitte Bigi (1), Eric Castelli (2)
(1) Laboratoire LIG/GETALP, Grenoble France
{Sopheap.Seng, Laurent.Besacier, Brigitte.Bigi}@imag.fr
(2) Laboratoire MICA, CNRS/UMI-2954, Hanoi Vietnam
Eric.Castelli@mica.edu.vn
Résumé Dans cet article, nous traitons du problème de la modélisation statistique du
langage pour les langues peu dotées et sans segmentation entre les mots. Tandis que le
manque de données textuelles a un impact sur la performance des modèles, les erreurs
introduites par la segmentation automatique peuvent rendre ces données encore moins
exploitables. Pour exploiter au mieux les données textuelles, nous proposons une méthode qui
effectue des segmentations multiples sur le corpus d’apprentissage au lieu d’une segmentation
unique. Cette méthode basée sur les automates d’état finis permet de retrouver les n-grammes
non trouvés par la segmentation unique et de générer des nouveaux n-grammes pour
l’apprentissage de modèle du langage. L’application de cette approche pour l’apprentissage
des modèles de langage pour les systèmes de reconnaissance automatique de la parole en
langue khmère et vietnamienne s’est montrée plus performante que la méthode par
segmentation unique, à base de règles.
Abstract In this article we deal with the problem of statistical ...
-
Publié par
-
Langue
Français