Skip to main content
Audio-Workloads haben zwei Formen. Verwenden Sie die Audio-Endpunkte für dateiähnliche Anfragen wie Text-to-Speech, Transkription und Audioübersetzung. Verwenden Sie den Realtime-WebSocket-Endpunkt, wenn die Nutzererfahrung interaktive Audio- oder multimodale Ereignisse mit niedriger Latenz benötigt.

Workflow Wählen

Modelle Finden

Fragen Sie den Modellkatalog ab, bevor Sie ein Modell fest einbauen. Nutzen Sie empfohlene Shortlists für Speech und Transkription, und prüfen Sie Realtime-Unterstützung in den Modelldetails, bevor Sie einen Socket öffnen.

Synchrone Audioanfragen

Sprachausgabe liefert Audio in der HTTP-Antwort. Transkription und Übersetzung können fertigen Text oder einen angenommenen Auftrag liefern. Enthält die Antwort eine Auftrags-ID und einen Status statt Text, speichern Sie die ID und fragen Sie poll_url bis zum Abschluss oder Fehler ab. Planen Sie für große Dateien genügend Zeit ein und speichern Sie die Request ID.

Realtime-Sitzungen

Öffnen Sie einen WebSocket mit dem Modell in der Query und dem API-Key im Authorization-Header. Nutzen Sie das Ereignisformat aus der Dokumentation des gewählten Realtime-Modells und schließen Sie den Socket am Ende der Sitzung. Dieser Leitfaden deckt nur das WebSocket subset ab. TokenLab stellt derzeit keine OpenAI-Realtime-REST-Endpunkte für client secret, translation client secret, Calls oder legacy beta session-Verwaltung bereit. Installieren Sie für das Serverbeispiel ws und setzen Sie TOKENLAB_REALTIME_MODEL auf ein aktuelles Modell, dessen Details /v1/realtime nennen. Übergeben Sie TOKENLAB_API_KEY in der Serverumgebung; der Modellname allein belegt keine Realtime-Unterstützung.

Statusbehandlung

  • Speichern Sie generierte Audiodateien, statt dieselbe Anfrage beim Aktualisieren erneut auszuführen.
  • Zeigen Sie Upload- und Verarbeitungsstatus auch bei synchroner Transkription und Übersetzung.
  • Behandeln Sie Close-Events bei Realtime und verbinden Sie erst neu, wenn der Nutzer eine neue Sitzung startet.
  • Legen Sie keine API-Keys, privaten URLs oder Konto-Geheimnisse in Audio-Texteingaben ab.

API-Referenz