Service Azure qui intègre le traitement vocal dans les applications et les services.
fr-FR-VivienneMultilingualNeural mispronounces years (1900, 2100) when a decimal number is present in the same sentence
Produit : Azure AI Speech / Speech Studio – Text to Speech
Voix : fr-FR-VivienneMultilingualNeural
Langue SSML : fr-FR
Description du problème
Lorsqu'une phrase contient à la fois une année (1900, 2100) et un nombre décimal (33,3), la voix fr-FR-VivienneMultilingualNeural prononce incorrectement les années.
Exemple : 2100 est prononcé « vingt-et-un centsse » au lieu de « deux mille cent », et 1900 est prononcé de façon similaire.
Dès que le nombre décimal est remplacé par un entier (33 au lieu de 33,3), les années sont prononcées correctement.
Le problème vient donc bien des années, dont la prononciation est perturbée par la présence d'un nombre décimal ailleurs dans la phrase.
Cas KO (années mal prononcées)
<speak xmlns="http://www.w3.org/2001/10/synthesis"
xmlns:mstts="http://www.w3.org/2001/mstts"
xmlns:emo="http://www.w3.org/2009/10/emotionml"
version="1.0" xml:lang="fr-FR">
<voice name="fr-FR-VivienneMultilingualNeural">
Il a dit en 2100 de 33,3 depuis 1900.
</voice>
</speak>
Résultat audio : 2100 et 1900 sont mal prononcés (« centsse » au lieu de « cent »)
Cas OK (années correctement prononcées)
<speak xmlns="http://www.w3.org/2001/10/synthesis"
xmlns:mstts="http://www.w3.org/2001/mstts"
xmlns:emo="http://www.w3.org/2009/10/emotionml"
version="1.0" xml:lang="fr-FR">
<voice name="fr-FR-VivienneMultilingualNeural">
Il a dit en 2100 de 33 depuis 1900.
</voice>
</speak>
Résultat audio : 2100 et 1900 sont prononcés correctement
Hypothèse
La présence d'un nombre décimal (avec virgule) dans la phrase semble modifier le contexte d'interprétation numérique du moteur TTS, qui traite alors les années comme des nombres à lire différemment — probablement en mode « numérique pur » plutôt que « année ».
Questions
- Ce comportement est-il un bug connu de
fr-FR-VivienneMultilingualNeural? Un correctif est-il prévu ? - Ce problème affecte-t-il d'autres voix fr-FR ?
Reproduit via Speech Studio (éditeur SSML en ligne) – aucune configuration personnalisée de lexique.