Corps de la requête
Timeout des requêtes synchrones : cet endpoint non-chat attend que le modèle routé termine son traitement. Les entrées volumineuses, les longs fichiers audio ou les grands lots peuvent dépasser les valeurs par défaut courantes de 30s côté client ; configurez donc le timeout de votre client HTTP à au moins120s.
file
requis
Fichier audio à transcrire. Formats pris en charge : flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
string
défaut:"whisper-1"
Modèle à utiliser. Actuellement, seul
whisper-1 est pris en charge.string
Langue de l’audio au format ISO-639-1 (par ex.,
en, zh, ja).string
Texte facultatif pour guider le style du modèle ou poursuivre un segment précédent.
string
défaut:"json"
Format de sortie :
json, text, srt, verbose_json, vtt.number
défaut:"0"
Température d’échantillonnage (de 0 à 1).
array
Granularité des horodatages :
word et/ou segment. Nécessite verbose_json.Réponse
string
Le texte transcrit.
verbose_json :
string
Toujours
transcribe.string
Langue détectée.
number
Durée de l’audio en secondes.
array
Segments de transcription avec horodatages.
array
Horodatages au niveau des mots (si demandés).