Skip to main content
音訊工作負載分成兩類。文字轉語音、轉寫、音訊翻譯這類檔案式請求使用音訊端點;需要低延遲互動音訊或多模態事件時,使用即時 WebSocket 端點。

選擇流程

發現模型

不要在客戶端硬編碼模型列表。語音和轉寫可使用推薦模型短名單;即時能力需要在開啟 socket 前透過模型詳情確認。

同步音訊請求

語音、轉寫和翻譯會在 HTTP 請求中直接返回。大輸入可能超過常見客戶端逾時,建議設定更寬鬆的逾時並保存 request ID 方便排查。

即時會話

開啟 WebSocket 時在查詢參數中傳 model,並在 Authorization header 中傳 API key。事件格式按所選即時模型文件發送;會話結束時主動關閉 socket。 本指南只涵蓋 WebSocket 代理。TokenLab 目前不提供 OpenAI Realtime REST client secret、translation client secret、Calls 或 legacy beta session 管理端點。

狀態處理

  • 保存生成的音訊檔案,刷新頁面時不要重複發起同一請求。
  • 轉寫和翻譯即使是同步呼叫,也應展示上傳和處理中狀態。
  • 即時會話要處理關閉事件,只有使用者重新開始會話時才重連。
  • 不要把 API key、私有 URL 或帳戶密鑰放進音訊文字輸入。

API 參考