Skip to main content
El texto a voz convierte texto escrito en audio hablado. Elige un modelo de TTS, selecciona una voz admitida por ese modelo, envía el texto a /audio/speech y guarda la respuesta binaria de audio. Usa esta guía para la generación de voz estándar. Si quieres crear voz a partir de una voz de referencia personalizada, consulta Clonación de voz.

Uso básico

Elige un modelo y una voz

Las voces son específicas de cada modelo. El valor de voice debe ser válido para el model que elijas. Usa la página de Modelos de Texto a Voz para explorar los modelos y voces disponibles. El selector de voces muestra los IDs de voz exactos que debes pasar en tu solicitud.
Los IDs de voz distinguen entre mayúsculas y minúsculas. Si cambias de modelo TTS, actualiza el valor de voice al mismo tiempo.

Estructura de la solicitud

Consejos para producción

  • Almacena en caché el audio generado cuando el texto de origen y la voz se reutilicen.
  • Normaliza y revisa el texto antes de sintetizarlo. La puntuación afecta el ritmo y la entonación.
  • Guarda la salida con la extensión de archivo correcta según el formato de respuesta del modelo.

Recursos relacionados