Skip to main content

Cuerpo de la solicitud

Tiempo de espera de solicitudes síncronas: este endpoint no-chat espera a que el modelo enrutado termine. Entradas grandes, audio largo o lotes grandes pueden superar los valores predeterminados habituales de 30s del cliente, así que configura el timeout de tu cliente HTTP en al menos 120s.
file
requerido
Archivo de audio para transcribir. Formatos compatibles: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
string
predeterminado:"whisper-1"
Modelo que se utilizará. Actualmente solo se admite whisper-1.
string
Idioma del audio en formato ISO-639-1 (p. ej., en, zh, ja).
string
Texto opcional para guiar el estilo del modelo o continuar un segmento anterior.
string
predeterminado:"json"
Formato de salida: json, text, srt, verbose_json, vtt.
number
predeterminado:"0"
Temperatura de muestreo (0 a 1).
array
Granularidad de las marcas de tiempo: word y/o segment. Requiere verbose_json.

Respuesta

string
El texto transcrito.
Para verbose_json:
string
Siempre transcribe.
string
Idioma detectado.
number
Duración del audio en segundos.
array
Segmentos de la transcripción con marcas de tiempo.
array
Marcas de tiempo a nivel de palabra (si se solicitan).

Traducción

Para traducir audio al inglés, utiliza el endpoint de traducciones: