Dúvida sobre Azure Speech Studio

Brasil Treinamentos Atendente 02 5 Pontos de reputação
2025-12-22T12:23:01.01+00:00

 

O Azure Speech Studio deixou de interpretar blocos de texto separados por linhas em branco como parágrafos independentes, passando a unir o conteúdo em um único áudio. Gostaria de saber se esse comportamento mudou oficialmente e se há configuração para retornar a versão anterior. Azure Speech Studio – Text to Speech behavior change regarding paragraph blocks

Previously, when using Azure Speech Studio (Text to Speech) with plain text input,

each text block separated by blank lines was treated as an independent paragraph

and generated distinct audio segments.

Currently, the same input is being interpreted as a single continuous text,

even when blocks are clearly separated by line breaks or blank lines.

As a result, different text blocks are being merged or interpolated into one audio output.

This behavior change is impacting existing workflows that relied on block-based

text input without requiring SSML.

Questions:

  • Was this behavior intentionally changed?
  • Is there any configuration or option to restore the previous behavior?
  • Is SSML now mandatory to define paragraph boundaries?
  • Is this a known issue or regression?

Expected behavior:

Each text block separated by blank lines should be treated as a paragraph,

without requiring manual SSML wrapping.

Inteligência de Documentos do Azure em Foundry Tools
0 comentários Sem comentários

1 resposta

Classificar por: Mais útil
  1. Dio Xavier 295.5K Pontos de reputação Moderador Voluntário
    2025-12-24T14:28:38.6266667+00:00

    Olá

    Bem vindo à Comunidade Microsoft Azure

    Bom dia. Este comportamento tem sido reportado por muitos usuários. Atualmente não há documentação pública da Microsoft que descreva oficialmente uma alteração de comportamento desse tipo no Speech Studio ou um parâmetro para reverter ao processamento anterior. O serviço de conversão de texto em fala do Azure espera entrada em texto simples ou SSML (Speech Synthesis Markup Language). O formato SSML permite definir explicitamente parágrafos, quebras e pausas usando tags como <p> ou <break> para controlar onde e como o áudio é gerado.

    Se o seu fluxo de trabalho depende de parágrafos separados, a abordagem recomendada é:

    • Converter o texto em SSML antes de enviar ao Speech Studio ou às APIs e envolver cada parágrafo com elementos <p> ou <s> conforme o controle de estrutura desejado.
    • Usar pausas explícitas (<break time="500ms" />) entre parágrafos, se quiser controlar o espaçamento no áudio.
    • Testar com a API REST ou SDK usando SpeakSsmlAsync (ou equivalente) em vez de texto simples para garantir que a estrutura de parágrafos seja respeitada.

    Documentação de referência recomendada:

    Estrutura e eventos de documentos do SSML

    Como sintetizar a fala a partir de texto

    Espero ter ajudado. Boas Festas!

    Esta resposta foi útil?

    0 comentários Sem comentários

Sua resposta

As respostas podem ser marcadas como ‘Aceitas’ pelo autor da pergunta e ‘Recomendadas’ pelos moderadores, o que ajuda os usuários a saber a resposta que resolveu o problema do autor.