Skip to main content

Überblick

Übersetzt Audio in jeder unterstützten Sprache in englischen Text. Im Gegensatz zur Transkription gibt dieser Endpoint unabhängig von der Eingabesprache immer englischen Text aus.

Anfragekörper

Timeout für synchrone Anfragen: Dieser Nicht-Chat-Endpunkt wartet, bis das geroutete Modell fertig ist. Große Eingaben, lange Audiodateien oder große Batches können übliche 30s-Client-Defaults überschreiten; setzen Sie das Timeout Ihres HTTP-Clients daher auf mindestens 120s.
file
erforderlich
Die Audio-Datei, die übersetzt werden soll. Unterstützte Formate: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm. Die maximale Dateigröße beträgt 25 MB.
string
Standard:"whisper-1"
Das zu verwendende Modell. Derzeit wird nur whisper-1 unterstützt.
string
Ein optionaler Text, um den Stil des Modells zu steuern oder ein vorheriges Segment fortzusetzen. Sollte auf Englisch sein.
string
Standard:"json"
Das Format der Ausgabe. Optionen: json, text, srt, verbose_json, vtt.
number
Die Sampling-Temperatur zwischen 0 und 1. Höhere Werte wie 0.8 erzeugen zufälligere Ausgaben, während niedrigere Werte wie 0.2 die Ausgabe fokussierter und deterministischer machen.

Antwort

string
Der übersetzte Text auf Englisch.
Für das Format verbose_json enthält die Antwort außerdem:
string
Die erkannte Sprache des Eingabe-Audios.
number
Die Dauer des Eingabe-Audios in Sekunden.
array
Segmente des übersetzten Textes mit Zeitstempeln.

Übersetzung vs. Transkription

Der Übersetzungs-Endpoint erkennt die Ausgangssprache automatisch und übersetzt ins Englische. Der language-Parameter aus der Transkription wird ignoriert.