Skip to main content
오디오 작업은 두 가지 형태로 나뉩니다. 텍스트 음성 변환, 전사, 오디오 번역처럼 파일에 가까운 요청은 audio endpoint를 사용합니다. 낮은 지연의 대화형 오디오나 실시간 멀티모달 이벤트가 필요하면 realtime WebSocket endpoint를 사용합니다.

워크플로 선택

모델 찾기

클라이언트에 모델 목록을 고정하지 마세요. 음성과 전사는 추천 목록을 사용하고, realtime은 socket을 열기 전에 모델 상세에서 지원 여부를 확인하세요.

동기 오디오 요청

음성 합성은 HTTP 응답으로 오디오를 반환합니다. 전사와 번역은 최종 텍스트 또는 접수된 작업을 반환할 수 있습니다. 최종 텍스트 대신 작업 ID와 상태가 있으면 ID를 저장하고 완료 또는 실패까지 poll_url을 조회하세요. 큰 파일에는 충분한 제한 시간을 설정하고 Request ID를 보관하세요.

실시간 세션

WebSocket을 열 때 query string에 model을, Authorization header에 API key를 넣습니다. 선택한 realtime 모델 문서의 이벤트 형식을 사용하고, 세션이 끝나면 socket을 닫으세요. 이 가이드는 WebSocket 하위 집합만 다룹니다. TokenLab은 현재 OpenAI Realtime REST client secret, translation client secret, Calls, legacy beta session 관리 엔드포인트를 제공하지 않습니다. 아래 서버 예제를 실행하려면 ws를 설치하고 상세 계약에 /v1/realtime이 명시된 현재 모델을 TOKENLAB_REALTIME_MODEL로 설정하세요. TOKENLAB_API_KEY는 서버 환경에서 제공합니다. 이름만으로 실시간 지원을 판단하지 마세요.

상태 처리

  • 생성된 오디오 파일을 저장하고 새로고침 때 같은 요청을 반복하지 마세요.
  • 전사와 번역은 동기 호출이어도 업로드 및 처리 상태를 보여주세요.
  • realtime은 close 이벤트를 처리하고 사용자가 새 세션을 시작할 때만 재연결하세요.
  • API key, 비공개 URL, 계정 secret을 오디오 텍스트 입력에 넣지 마세요.

API 레퍼런스