Corpo da Requisição
Timeout de solicitações síncronas: este endpoint não-chat aguarda o modelo roteado terminar. Entradas grandes, áudios longos ou lotes grandes podem exceder os padrões comuns de 30s dos clientes, então configure o timeout do seu cliente HTTP para pelo menos120s.
file
obrigatório
Arquivo de áudio para transcrever. Formatos suportados: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
string
padrão:"whisper-1"
Modelo a ser usado. Atualmente, apenas
whisper-1 é suportado.string
Idioma do áudio no formato ISO-639-1 (por exemplo,
en, zh, ja).string
Texto opcional para orientar o estilo do modelo ou continuar um segmento anterior.
string
padrão:"json"
Formato de saída:
json, text, srt, verbose_json, vtt.number
padrão:"0"
Temperatura de amostragem (0 a 1).
array
Granularidade de timestamp:
word e/ou segment. Requer verbose_json.Resposta
string
O texto transcrito.
verbose_json:
string
Sempre
transcribe.string
Idioma detectado.
number
Duração do áudio em segundos.
array
Segmentos da transcrição com timestamps.
array
Timestamps em nível de palavra (se solicitado).