Überblick
Übersetzt Audio in jeder unterstützten Sprache in englischen Text. Im Gegensatz zur Transkription gibt dieser Endpoint unabhängig von der Eingabesprache immer englischen Text aus.Anfragekörper
Timeout für synchrone Anfragen: Dieser Nicht-Chat-Endpunkt wartet, bis das geroutete Modell fertig ist. Große Eingaben, lange Audiodateien oder große Batches können übliche 30s-Client-Defaults überschreiten; setzen Sie das Timeout Ihres HTTP-Clients daher auf mindestens120s.
file
erforderlich
Die Audio-Datei, die übersetzt werden soll. Unterstützte Formate:
flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm. Die maximale Dateigröße beträgt 25 MB.string
Standard:"whisper-1"
Das zu verwendende Modell. Derzeit wird nur
whisper-1 unterstützt.string
Ein optionaler Text, um den Stil des Modells zu steuern oder ein vorheriges Segment fortzusetzen. Sollte auf Englisch sein.
string
Standard:"json"
Das Format der Ausgabe. Optionen:
json, text, srt, verbose_json, vtt.number
Die Sampling-Temperatur zwischen 0 und 1. Höhere Werte wie 0.8 erzeugen zufälligere Ausgaben, während niedrigere Werte wie 0.2 die Ausgabe fokussierter und deterministischer machen.
Antwort
string
Der übersetzte Text auf Englisch.
verbose_json enthält die Antwort außerdem:
string
Die erkannte Sprache des Eingabe-Audios.
number
Die Dauer des Eingabe-Audios in Sekunden.
array
Segmente des übersetzten Textes mit Zeitstempeln.
Übersetzung vs. Transkription
Der Übersetzungs-Endpoint erkennt die Ausgangssprache automatisch und übersetzt ins Englische. Der
language-Parameter aus der Transkription wird ignoriert.