La reconnaissance vocale transcrit l’audio parlé en texte écrit. Envoyez un fichier audio à /audio/transcriptions, choisissez un modèle de transcription et sélectionnez le format de réponse que vous souhaitez recevoir.
Utilisation de base
Entrées prises en charge
Les formats audio courants incluent mp3, mp4, mpeg, mpga, m4a, wav, webm, flac et ogg. Consultez la page Modèles de reconnaissance vocale pour connaître les modèles actuellement pris en charge et les tarifs.
Utilisez les formats de sous-titres lorsque la transcription sera associée à la lecture d’un média. Utilisez json ou text lorsque la transcription alimente la synthèse, la recherche ou des invites de chat en aval.
Conseils pour la production
- Gardez l’audio clair et évitez les locuteurs qui se chevauchent lorsque possible.
- Découpez les enregistrements très longs en fragments plus petits si votre flux de travail nécessite une latence plus faible ou des réessais plus faciles.
- Stockez le chemin audio d’origine, l’identifiant du modèle et le format de réponse avec chaque transcription pour la traçabilité.
Ressources connexes