La voz a texto transcribe audio hablado a texto escrito. Envía un archivo de audio a /audio/transcriptions, elige un modelo de transcripción y selecciona el formato de respuesta que deseas recibir.
Uso básico
Entradas admitidas
Los formatos de audio comunes incluyen mp3, mp4, mpeg, mpga, m4a, wav, webm, flac y ogg. Consulta la página de Modelos de Voz a Texto para conocer el soporte de modelos y precios actuales.
Usa formatos de subtítulos cuando la transcripción se combine con la reproducción de contenido multimedia. Usa json o text cuando la transcripción alimente resúmenes, búsqueda o prompts de chat posteriores.
Consejos para producción
- Mantén el audio claro y evita solapamientos entre hablantes cuando sea posible.
- Divide las grabaciones muy largas en fragmentos más pequeños si tu flujo de trabajo necesita menor latencia o reintentos más sencillos.
- Almacena la ruta original del audio, el ID del modelo y el formato de respuesta con cada transcripción para facilitar la auditoría.
Recursos relacionados