Guía

Cómo generar SSML a partir de texto plano

Escribe un texto, elige la voz y los ajustes de velocidad, tono y volumen, y genera el marcado SSML para usarlo con un motor de síntesis de voz. El resultado es marcado, no un archivo de audio.

Herramienta Generador de SSML para texto a voz

Qué puedes preparar con el generador

Este generador convierte texto plano en marcado SSML, el formato que puede utilizarse con motores de síntesis de voz. Es útil cuando necesitas preparar un texto para una aplicación de voz y quieres controlar la voz seleccionada, la velocidad, el tono y el volumen sin escribir manualmente todo el marcado.

La entrada principal es un texto opcional. Si no se proporciona, se considera vacía. El resultado no es una grabación ni reproduce la voz: es una estructura SSML que después puede utilizar un motor de síntesis de voz compatible. Puedes escoger una voz por nombre o dejar la opción predeterminada.

Pasos para generar el marcado SSML

  1. Escribe o pega el texto que quieras convertir. Revisa que contenga palabras y no solo espacios en blanco.
  2. Selecciona una voz por su nombre si tu flujo de trabajo requiere una voz concreta. Si no indicas ninguna, se utiliza default.
  3. Ajusta la velocidad con una de estas opciones: x-slow, slow, medium, fast o x-fast.
  4. Ajusta el tono con x-low, low, medium, high o x-high.
  5. Elige el volumen entre silent, x-soft, soft, medium, loud y x-loud.
  6. Genera el resultado y revisa el marcado SSML antes de pasarlo a tu motor de síntesis de voz.

Los valores reconocidos de velocidad y tono se transforman en porcentajes relativos. Los valores reconocidos de volumen se transforman en niveles numéricos. Si escribes una opción que no pertenece a las listas admitidas, el ajuste correspondiente vuelve a medium. Por eso conviene seleccionar una opción disponible en lugar de introducir variantes traducidas o abreviaturas.

El texto se prepara para formar parte del marcado: los caracteres que tienen un significado especial en XML se escapan. Las líneas no vacías se agrupan en elementos de frase, mientras que dos saltos de línea separan los párrafos. Conserva los saltos de línea si esa separación debe reflejarse en la estructura final.

Cómo leer y revisar el resultado

Interpreta el resultado como marcado para entregar a un motor de síntesis de voz, no como audio listo para escuchar. Comprueba que el texto aparezca dentro de la estructura generada, que los cambios de línea que necesitas se hayan conservado y que la voz indicada sea la que pretendías usar.

Si el texto incluye caracteres como <, > o &, el escape XML forma parte del resultado esperado y evita que esos caracteres se interpreten directamente como marcado del contenido. Asimismo, una separación entre párrafos depende de que existan dos saltos de línea; una sucesión de líneas no vacías se trata como frases dentro de la estructura correspondiente.

Los ajustes solo se aplican como opciones reconocidas. Un valor desconocido no conserva necesariamente tu redacción personalizada: se sustituye por el nivel medio del ajuste afectado. Si el texto efectivo está vacío o contiene únicamente espacios, la operación termina correctamente con una indicación de error, pero sin marcado de voz generado. La configuración declarada de acceso a red figura como desactivada; ese dato no permite deducir dónde se ejecuta la herramienta ni establecer garantías sobre almacenamiento o privacidad.

Ejemplo práctico

Quieres preparar un saludo breve con una configuración neutra para pasarlo después a un motor de síntesis de voz.

Pega «Hola, Marta. Bienvenida.» en el campo de texto, deja la voz default, selecciona medium para velocidad, tono y volumen, y genera el resultado.

El resultado tiene forma de marcado SSML e incluye el texto dentro de elementos de frase; la separación mediante dos saltos de línea se refleja como separación de párrafos. No se genera una grabación de audio.

Limitaciones

  • Entrega marcado SSML, no audio. La configuración declarada de acceso a red está desactivada, pero ese dato no demuestra dónde se ejecuta la herramienta ni ofrece una garantía de almacenamiento o privacidad.

Errores frecuentes

  • Si recibes una indicación de error sin marcado, revisa que el texto no esté vacío ni contenga únicamente espacios; añade contenido antes de volver a generarlo.

Preguntas frecuentes

¿Qué ocurre si dejo el texto vacío?

Sí, si el texto efectivo contiene palabras. Cuando está vacío o solo tiene espacios, la herramienta devuelve una indicación de error y no genera marcado de voz.

¿Tengo que indicar un nombre de voz?

Si no indicas una voz, se utiliza default. También puedes proporcionar un nombre de voz cuando tu flujo de trabajo lo necesite.

¿El resultado es un archivo de audio?

No. El resultado es marcado SSML para usarlo con un motor de síntesis de voz; la herramienta no produce ni reproduce una grabación de audio.

Herramienta

Generador de SSML para texto a voz