-
1
page
-
Français
-
Documents
Description
Département Parole & Cognition
Equipe MAGIC
Synthèse de parole à partir du texte :
Approche statistique sur grands corpus
Contexte
La synthèse de parole à partir du texte permet de faire prononcer du texte libre à un ordinateur. Un système de
synthèse est généralement composé de 4 composants essentiels :
1. Un analyseur de texte qui extrait de la suite de caractères des connaissances sur la structure linguistique :
segmentation en mots, analyse morphologique, structure syntaxique, etc.
2. Un module de passage entre structure textuelle et structure phonologique : conversion graphème-phonème,
syllabation, accentuation et marquage prosodique, etc.
3. Un module de synthèse qui produit une représentation paramétrique du signal à partir de la structure
phonologique (notamment durée des sons, intensité, et fréquence fondamentale pour la mélodie de la parole)
4. Un vocodeur qui génère un signal acoustique audible respectant la paramétrisation de l’étape précédente
La méthode de synthèse la plus populaire jusqu’à ces dernières années repose sur l’utilisation de tronçons de signaux
préenregistrés, puisés dans des bases de signaux importantes, comprenant les multiples prononciations en contexte
de tous les sons d’une langue. Pour une structure phonologique donnée, fournie par l’étape 2, le système sélectionne
les meilleurs tronçons correspondants et les concatène, en respectant au mieux la paramétrisation fournie par l’étape
3. Des techniques de traitement du ...
Equipe MAGIC
Synthèse de parole à partir du texte :
Approche statistique sur grands corpus
Contexte
La synthèse de parole à partir du texte permet de faire prononcer du texte libre à un ordinateur. Un système de
synthèse est généralement composé de 4 composants essentiels :
1. Un analyseur de texte qui extrait de la suite de caractères des connaissances sur la structure linguistique :
segmentation en mots, analyse morphologique, structure syntaxique, etc.
2. Un module de passage entre structure textuelle et structure phonologique : conversion graphème-phonème,
syllabation, accentuation et marquage prosodique, etc.
3. Un module de synthèse qui produit une représentation paramétrique du signal à partir de la structure
phonologique (notamment durée des sons, intensité, et fréquence fondamentale pour la mélodie de la parole)
4. Un vocodeur qui génère un signal acoustique audible respectant la paramétrisation de l’étape précédente
La méthode de synthèse la plus populaire jusqu’à ces dernières années repose sur l’utilisation de tronçons de signaux
préenregistrés, puisés dans des bases de signaux importantes, comprenant les multiples prononciations en contexte
de tous les sons d’une langue. Pour une structure phonologique donnée, fournie par l’étape 2, le système sélectionne
les meilleurs tronçons correspondants et les concatène, en respectant au mieux la paramétrisation fournie par l’étape
3. Des techniques de traitement du ...
-
Publié par
-
Langue
Français