概要
サポートされている任意の言語の音声を英語テキストに翻訳します。文字起こしとは異なり、この endpoint は入力言語に関係なく常に英語テキストを出力します。リクエストボディ
同期リクエストのタイムアウト: この非チャットエンドポイントは、ルーティング先モデルの処理完了を待ちます。大きな入力、長い音声、大きなバッチは一般的な 30s のクライアント既定値を超えることがあるため、HTTP クライアントのタイムアウトは少なくとも120s に設定してください。
file
必須
翻訳する音声ファイル。サポートされている形式:
flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm。最大ファイルサイズは 25 MB です。string
デフォルト:"whisper-1"
使用する model。現在は
whisper-1 のみサポートされています。string
model のスタイルを誘導したり、前のセグメントの続きを生成したりするための任意のテキストです。英語である必要があります。
string
デフォルト:"json"
出力の形式。オプション:
json, text, srt, verbose_json, vtt。number
0 から 1 の間の sampling temperature。0.8 のような高い値ではよりランダムな出力が生成され、0.2 のような低い値ではより集中的で決定論的な出力になります。
レスポンス
string
英語に翻訳されたテキスト。
verbose_json 形式では、レスポンスには以下も含まれます:
string
入力音声の検出された言語。
number
入力音声の長さ(秒)。
array
タイムスタンプ付きの翻訳済みテキストのセグメント。
翻訳と文字起こしの違い
翻訳 endpoint はソース言語を自動的に検出し、英語に翻訳します。文字起こしの
language parameter は無視されます。