Cuerpo de la solicitud
Tiempo de espera de solicitudes síncronas: este endpoint no-chat espera a que el modelo enrutado termine. Entradas grandes, audio largo o lotes grandes pueden superar los valores predeterminados habituales de 30s del cliente, así que configura el timeout de tu cliente HTTP en al menos120s.
file
requerido
Archivo de audio para transcribir. Formatos compatibles: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
string
predeterminado:"whisper-1"
Modelo que se utilizará. Actualmente solo se admite
whisper-1.string
Idioma del audio en formato ISO-639-1 (p. ej.,
en, zh, ja).string
Texto opcional para guiar el estilo del modelo o continuar un segmento anterior.
string
predeterminado:"json"
Formato de salida:
json, text, srt, verbose_json, vtt.number
predeterminado:"0"
Temperatura de muestreo (0 a 1).
array
Granularidad de las marcas de tiempo:
word y/o segment. Requiere verbose_json.Respuesta
string
El texto transcrito.
verbose_json:
string
Siempre
transcribe.string
Idioma detectado.
number
Duración del audio en segundos.
array
Segmentos de la transcripción con marcas de tiempo.
array
Marcas de tiempo a nivel de palabra (si se solicitan).