Accès ouvert

Amélioration Des Techniques De Conversion Vocale Appliquées à La Voix Laryngée et à La Voix Pathologique

Thèse 2023 Français

Résumé

La conversion vocale (VC) vise à transformer un signal de parole émis par un locuteur source afin qu’il paraisse prononcé par un autre locuteur, appelé locuteur cible. Les systèmes de conversion vocale s’appuient généralement sur des données parallèles, où les énoncés source et cible partagent le même contenu linguistique, pour permettre l’apprentissage du modèle. Cependant, ces données sont souvent coûteuses à obtenir et parfois indisponibles, ce qui pose le défi de concevoir une fonction de conversion robuste, même avec des données parallèles limitées ou non disponibles. Les laryngectomisés, par ailleurs, sont des personnes ayant subi une ablation totale du larynx, généralement en raison d’une pathologie laryngée avancée. Cette intervention entraîne une perte de la capacité à parler. Grâce à l’accompagnement d’un orthophoniste, de nombreux patients apprennent à utiliser une voix alternative, appelée voix oesophagienne (ou alaryngée). Cependant, cette voix est souvent rauque, bruitée et peu intelligible, rendant la communication difficile. L’objectif principal de cette thèse est d’améliorer les performances des techniques de conversion vocale appliquées à la voix laryngée et alaryngée. Notre première contribution porte sur la mise en oeuvre d’un système de conversion vocale conçu pour surmonter le problème du lissage excessif, souvent causé par la modélisation statistique fondée sur des caractéristiques de faible dimension. Pour améliorer la qualité de la modélisation, nous avons utilisé des caractéristiques spectrales de haute dimension, intégrées dans deux approches de réseaux neuronaux profonds. Pour répondre à la contrainte de données limitées, nous avons également proposé une technique innovante de pré-apprentissage basée sur un autoencodeur, permettant d’améliorer les performances des modèles de conversion. Notre deuxième contribution s’attache à lever la contrainte du parallélisme dans les données d’apprentissage. Nous avons développé une approche utilisant un modèle autorégressif et des représentations phonétiques pour intégrer les caractéristiques linguistiques et acoustiques dans le processus de conversion, éliminant ainsi la dépendance à des données parallèles. Enfin, notre dernière contribution concerne la création d’un système de rehaussement de la parole pathologique, en particulier pour la voix oesophagienne, afin d’en améliorer l’intelligibilité et le naturel. Ce système repose sur une nouvelle technique de conversion vocale qui évite les limites du processus d’alignement classique. Il s’appuie sur une architecture dite « de bout en bout », combinant un modèle séquence à séquence avec un mécanisme d’attention auditive, pour offrir des performances optimales.

Citer ce document

Ezzine, K. (2023). Amélioration Des Techniques De Conversion Vocale Appliquées à La Voix Laryngée et à La Voix Pathologique.

Accès au document

Voir sur le dépôt source

Ce document est hébergé sur son dépôt institutionnel d'origine.

Auteur(s)

Statistiques

Consultations : 2

Téléchargements : 0