Skip to main content

Corpo da Requisição

Timeout de solicitações síncronas: este endpoint não-chat aguarda o modelo roteado terminar. Entradas grandes, áudios longos ou lotes grandes podem exceder os padrões comuns de 30s dos clientes, então configure o timeout do seu cliente HTTP para pelo menos 120s.
file
obrigatório
Arquivo de áudio para transcrever. Formatos suportados: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
string
padrão:"whisper-1"
Modelo a ser usado. Atualmente, apenas whisper-1 é suportado.
string
Idioma do áudio no formato ISO-639-1 (por exemplo, en, zh, ja).
string
Texto opcional para orientar o estilo do modelo ou continuar um segmento anterior.
string
padrão:"json"
Formato de saída: json, text, srt, verbose_json, vtt.
number
padrão:"0"
Temperatura de amostragem (0 a 1).
array
Granularidade de timestamp: word e/ou segment. Requer verbose_json.

Resposta

string
O texto transcrito.
Para verbose_json:
string
Sempre transcribe.
string
Idioma detectado.
number
Duração do áudio em segundos.
array
Segmentos da transcrição com timestamps.
array
Timestamps em nível de palavra (se solicitado).

Tradução

Para traduzir áudio para o inglês, use o endpoint de translations: