Skip to main content

リクエストボディ

同期リクエストのタイムアウト: この非チャットエンドポイントは、ルーティング先モデルの処理完了を待ちます。大きな入力、長い音声、大きなバッチは一般的な 30s のクライアント既定値を超えることがあるため、HTTP クライアントのタイムアウトは少なくとも 120s に設定してください。
file
必須
文字起こしする音声ファイル。対応形式: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm。
string
デフォルト:"whisper-1"
使用するモデル。現在は whisper-1 のみサポートされています。
string
ISO-639-1 形式の音声言語(例: en, zh, ja)。
string
モデルのスタイルを誘導したり、前のセグメントの続きを生成したりするための任意のテキスト。
string
デフォルト:"json"
出力形式: json, text, srt, verbose_json, vtt
number
デフォルト:"0"
サンプリング温度(0 から 1)。
array
タイムスタンプの粒度: word および/または segmentverbose_json が必要です。

レスポンス

string
文字起こしされたテキスト。
verbose_json の場合:
string
常に transcribe
string
検出された言語。
number
音声の長さ(秒)。
array
タイムスタンプ付きの文字起こしセグメント。
array
単語レベルのタイムスタンプ(要求された場合)。

翻訳

音声を英語に翻訳するには、translations endpoint を使用します: