Skip to main content
Workloads de áudio têm duas formas. Use os endpoints de áudio para requisições parecidas com arquivos, como texto para fala, transcrição e tradução de áudio. Use o endpoint WebSocket em tempo real quando a experiência precisar de áudio interativo de baixa latência ou eventos multimodais.

Escolher O Fluxo

Descobrir Modelos

Consulte o catálogo de modelos antes de fixar um modelo. Use listas recomendadas para fala e transcrição, e confirme suporte realtime nos detalhes do modelo antes de abrir um socket.

Requisições De Áudio Síncronas

A síntese retorna áudio na resposta HTTP. Transcrição e tradução podem retornar texto final ou uma tarefa aceita. Se a resposta contiver ID e status de tarefa, salve o ID e consulte poll_url até concluir ou falhar. Reserve tempo suficiente para arquivos grandes e mantenha o Request ID.

Sessões Em Tempo Real

Abra um WebSocket com o modelo na query string e a API key no header Authorization. Use o formato de eventos documentado para o modelo realtime escolhido e feche o socket quando a sessão terminar. Este guia cobre apenas o WebSocket subset. No momento, o TokenLab não fornece endpoints REST do OpenAI Realtime para client secret, translation client secret, Calls ou gerenciamento legacy beta session. No exemplo de servidor, instale ws e defina TOKENLAB_REALTIME_MODEL com um modelo atual cujos detalhes declarem /v1/realtime. Forneça TOKENLAB_API_KEY no ambiente do servidor; o nome não comprova suporte realtime.

Tratamento De Estado

  • Salve arquivos de áudio gerados em vez de repetir a mesma requisição ao atualizar.
  • Para transcrição e tradução, mostre estados de upload e processamento mesmo quando a chamada for síncrona.
  • Para realtime, trate eventos de fechamento e reconecte apenas quando o usuário iniciar uma nova sessão.
  • Não coloque API keys, URLs privadas ou segredos de conta no texto de áudio.

Referência Da API