Skip to main content

Corps de la requête

Timeout des requêtes synchrones : cet endpoint non-chat attend que le modèle routé termine son traitement. Les entrées volumineuses, les longs fichiers audio ou les grands lots peuvent dépasser les valeurs par défaut courantes de 30s côté client ; configurez donc le timeout de votre client HTTP à au moins 120s.
file
requis
Fichier audio à transcrire. Formats pris en charge : flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
string
défaut:"whisper-1"
Modèle à utiliser. Actuellement, seul whisper-1 est pris en charge.
string
Langue de l’audio au format ISO-639-1 (par ex., en, zh, ja).
string
Texte facultatif pour guider le style du modèle ou poursuivre un segment précédent.
string
défaut:"json"
Format de sortie : json, text, srt, verbose_json, vtt.
number
défaut:"0"
Température d’échantillonnage (de 0 à 1).
array
Granularité des horodatages : word et/ou segment. Nécessite verbose_json.

Réponse

string
Le texte transcrit.
Pour verbose_json :
string
Toujours transcribe.
string
Langue détectée.
number
Durée de l’audio en secondes.
array
Segments de transcription avec horodatages.
array
Horodatages au niveau des mots (si demandés).

Traduction

Pour traduire l’audio en anglais, utilisez l’endpoint de traductions :