Skip to main content
Les workloads audio ont deux formes. Utilisez les endpoints audio pour les requêtes de type fichier comme la synthèse vocale, la transcription et la traduction audio. Utilisez le WebSocket temps réel quand l’expérience utilisateur nécessite de l’audio interactif à faible latence ou des événements multimodaux.

Choisir Le Flux

Découvrir Les Modèles

Interrogez le catalogue de modèles avant de figer un modèle. Utilisez les listes recommandées pour la parole et la transcription, et vérifiez la prise en charge du temps réel dans le détail du modèle avant d’ouvrir un socket.

Requêtes Audio Synchrones

La synthèse vocale renvoie l’audio dans la réponse HTTP. La transcription et la traduction peuvent renvoyer du texte final ou une tâche acceptée. Si la réponse contient un identifiant et un statut de tâche, conservez l’identifiant et interrogez poll_url jusqu’à la fin ou l’échec. Prévoyez un délai suffisant pour les gros fichiers et gardez le Request ID.

Sessions Temps Réel

Ouvrez un WebSocket avec le modèle dans la query string et la clé API dans l’en-tête Authorization. Utilisez le format d’événements documenté pour le modèle temps réel choisi, puis fermez le socket à la fin de la session. Ce guide couvre uniquement le WebSocket subset. TokenLab ne fournit pas actuellement les endpoints REST OpenAI Realtime pour client secret, translation client secret, Calls ou gestion legacy beta session. Pour cet exemple serveur, installez ws et définissez TOKENLAB_REALTIME_MODEL sur un modèle actuel dont les détails déclarent /v1/realtime. Fournissez TOKENLAB_API_KEY dans l’environnement serveur ; le nom seul ne prouve pas la compatibilité realtime.

Gestion D’état

  • Enregistrez les fichiers audio générés au lieu de relancer la même requête au rafraîchissement.
  • Pour transcription et traduction, affichez les états d’upload et de traitement même si l’appel API est synchrone.
  • Pour le temps réel, gérez les événements de fermeture et reconnectez seulement après le démarrage d’une nouvelle session utilisateur.
  • Ne placez pas de clés API, URLs privées ou secrets de compte dans le texte audio.

Référence API