Skip to main content

Anfragekörper

Timeout für synchrone Anfragen: Dieser Nicht-Chat-Endpunkt wartet, bis das geroutete Modell fertig ist. Große Eingaben, lange Audiodateien oder große Batches können übliche 30s-Client-Defaults überschreiten; setzen Sie das Timeout Ihres HTTP-Clients daher auf mindestens 120s.
file
erforderlich
Audiodatei zur Transkription. Unterstützte Formate: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
string
Standard:"whisper-1"
Zu verwendendes Modell. Derzeit wird nur whisper-1 unterstützt.
string
Sprache des Audios im ISO-639-1-Format (z. B. en, zh, ja).
string
Optionaler Text, um den Stil des Modells zu steuern oder ein vorheriges Segment fortzusetzen.
string
Standard:"json"
Ausgabeformat: json, text, srt, verbose_json, vtt.
number
Standard:"0"
Sampling-Temperatur (0 bis 1).
array
Granularität der Zeitstempel: word und/oder segment. Erfordert verbose_json.

Antwort

string
Der transkribierte Text.
Für verbose_json:
string
Immer transcribe.
string
Erkannte Sprache.
number
Audiodauer in Sekunden.
array
Transkriptionssegmente mit Zeitstempeln.
array
Zeitstempel auf Wortebene (falls angefordert).

Übersetzung

Um Audio ins Englische zu übersetzen, verwenden Sie den translations-Endpunkt: