概覽
將任何支援語言的音訊翻譯為英文文字。不同於轉錄,無論輸入語言為何,此端點一律輸出英文文字。請求本文
同步請求逾時: 這個非聊天端點會等待路由到的模型完成處理。大型輸入、長音訊或大量批次可能超過常見的 30s 用戶端預設逾時,因此請將 HTTP 用戶端逾時設定為至少120s。
file
必填
要翻譯的音訊檔案。支援的格式:
flac、mp3、mp4、mpeg、mpga、m4a、ogg、wav、webm。檔案大小上限為 25 MB。string
預設值:"whisper-1"
要使用的模型。目前僅支援
whisper-1。string
用於引導模型風格或延續前一段內容的選用文字。應以英文撰寫。
string
預設值:"json"
輸出格式。可選項目:
json、text、srt、verbose_json、vtt。number
取樣溫度,介於 0 到 1 之間。較高的值(如 0.8)會產生更隨機的輸出,而較低的值(如 0.2)會使輸出更集中且更具確定性。
回應
string
英文翻譯文字。
verbose_json 格式,回應還包括:
string
輸入音訊所偵測到的語言。
number
輸入音訊的長度(秒)。
array
帶有時間戳記的翻譯文字分段。
翻譯與轉錄的差異
翻譯端點會自動偵測來源語言並翻譯為英文。來自轉錄的
language 參數會被忽略。