Anfragekörper
Timeout für synchrone Anfragen: Dieser Nicht-Chat-Endpunkt wartet, bis das geroutete Modell fertig ist. Große Eingaben, lange Audiodateien oder große Batches können übliche 30s-Client-Defaults überschreiten; setzen Sie das Timeout Ihres HTTP-Clients daher auf mindestens120s.
file
erforderlich
Audiodatei zur Transkription. Unterstützte Formate: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
string
Standard:"whisper-1"
Zu verwendendes Modell. Derzeit wird nur
whisper-1 unterstützt.string
Sprache des Audios im ISO-639-1-Format (z. B.
en, zh, ja).string
Optionaler Text, um den Stil des Modells zu steuern oder ein vorheriges Segment fortzusetzen.
string
Standard:"json"
Ausgabeformat:
json, text, srt, verbose_json, vtt.number
Standard:"0"
Sampling-Temperatur (0 bis 1).
array
Granularität der Zeitstempel:
word und/oder segment. Erfordert verbose_json.Antwort
string
Der transkribierte Text.
verbose_json:
string
Immer
transcribe.string
Erkannte Sprache.
number
Audiodauer in Sekunden.
array
Transkriptionssegmente mit Zeitstempeln.
array
Zeitstempel auf Wortebene (falls angefordert).