Test de VoiceBox

J'ai testé VoiceBox sur EndeavorOS. Un outil de synthèse et de reconnaissance vocale qui se veut complet et intuitif, porté sur divers systèmes d'exploitation.

Pas de binaire distribué directement pour mon système, je procède donc à la compilation en suivant les étapes indiquées sur le site internet. Aucun souci particulier à la compilation tout déroule bien. Compilation un peu longue: compter facilement 1h.

J'ai fais un premier essai de génération vocale:

VoiceBox

On fait ensuite un essai avec un texte français un peu plus conséquent: prenons l'introduction du jeu de figurines Rangers of shadow Deep telle qu'elle figure dans le livre des règles:

Introduction Rangers of Shadow Deep

On remarque immédiatement que certaines syllabes sont quasi muettes et que certains raccords sont mal cadencés dans les phrases. J'adapte très légèrement le texte pour faire ressortir certaines pauses ou certaines syllabes:

Introduction Rangers of Shadow Deep - Adapté

Le résultat obtenu en quelques secondes est assez bluffant.

Les essais que j'ai menés sur le clonage de voix sont assez longs à mettre en oeuvre et chronophages. Il faut un certains temps pour réussir à obtenir un résultat à peu près cohérent. De plus, le clonage nécessite un grosse configuration avec GPU et RAM conséquent.

Dans l'interface de VoiceBox il manquerait des accès aux paramétrages pour pouvoir facilement dupliquer les réglages fins sur le moteur de synthèse d'une génération audio à l'autre.

Voix de Morgan Freeman synthétique

Cela dit, ces premiers essais me confortent dans l'idée de continuer les tests avec le clonage de voix et la reconnaissance vocale. Peut être un prochain article à suivre d'ici quelques temps...