Skip to main content

Anfragekörper

string
erforderlich
ID des zu verwendenden Modells. Siehe Models für verfügbare Optionen.
array
erforderlich
Eine Liste von Nachrichten, die die Konversation bilden.Jedes Nachrichtenobjekt enthält:
  • role (string): system, user oder assistant
  • content (string | array): Der Nachrichteninhalt
Wenn content ein Array ist, unterstützt TokenLab strukturierte multimodale Blöcke für kompatible Modelle:
  • text: { "type": "text", "text": "..." }
  • Bild: { "type": "image_url", "image_url": { "url": "https://..." } }
  • audio: { "type": "audio_url", "audio_url": { "url": "https://..." } }
  • video: { "type": "video_url", "video_url": { "url": "https://..." } }
Für multimodalen Produktionstraffic bevorzugen Sie öffentliche https-URLs. TokenLab übersetzt diese Medienblöcke in die anbieter-spezifische Anforderungsform, die vom gerouteten physischen Modell benötigt wird.
number
Standard:"1"
Sampling-Temperatur zwischen 0 und 2. Höhere Werte machen die Ausgabe zufälliger.
integer
Maximale Anzahl an zu generierenden Tokens.
boolean
Standard:"false"
Wenn true, werden partielle Nachrichtendeltas als SSE-Ereignisse gesendet.
object
Optionen fürs Streaming. Setzen Sie include_usage: true, um Token-Nutzungsdaten in Stream-Chunks zu erhalten.
number
Standard:"1"
Nucleus-Sampling-Parameter. Wir empfehlen, entweder diesen oder die Temperatur zu verändern, aber nicht beide.
number
Standard:"0"
Zahl zwischen -2.0 und 2.0. Positive Werte bestrafen wiederholte Tokens.
number
Standard:"0"
Zahl zwischen -2.0 und 2.0. Positive Werte bestrafen Tokens, die bereits im Text vorhanden sind.
string | array
Bis zu 4 Sequenzen, bei denen die API das Generieren von Tokens stoppt.
array
Eine Liste von Tools, die das Modell aufrufen kann (Funktionsaufrufe).
string | object
Steuert, wie das Modell Tools verwendet. Optionen: auto, none, required, oder ein spezifisches Tool-Objekt.
boolean
Standard:"true"
Ob parallele Funktionsaufrufe aktiviert werden sollen. Auf false setzen, um Funktionen nacheinander aufzurufen.
integer
Maximale Tokens für die Vervollständigung. Alternative zu max_tokens, nützlich für neuere modellfamilien mit Reasoning-Unterstützung.
string
Reasoning-Aufwand für reasoning-fähige Modelle. Optionen: low, medium, high.
integer
Zufallsseed für deterministisches Sampling.
integer
Standard:"1"
Anzahl der zu erzeugenden Vervollständigungen (1-128).
boolean
Ob Log-Wahrscheinlichkeiten zurückgegeben werden sollen.
integer
Anzahl der obersten Log-Wahrscheinlichkeiten, die zurückgegeben werden sollen (0-20). Erfordert logprobs: true.
integer
Top-K Sampling-Parameter (für Anthropic/Gemini-Modelle).
object
Spezifikation des Antwortformats. Verwenden Sie {"type": "json_object"} für den JSON-Modus. Behandeln Sie {"type": "json_schema", "json_schema": {...}} als eine Best-Effort-Option, die vom ausgewählten Modell und dem gerouteten Verhalten abhängt.
object
Anpassung der Wahrscheinlichkeit, dass bestimmte Tokens erscheinen. Mappen Sie Token-IDs (als Strings) auf Bias-Werte von -100 bis 100.
string
Ein eindeutiger Bezeichner, der Ihren Endbenutzer für Missbrauchsüberwachung repräsentiert.

Antwort

string
Eindeutiger Bezeichner für die Vervollständigung.
string
Immer chat.completion.
integer
Unix-Zeitstempel, wann die Vervollständigung erstellt wurde.
string
Das für die Vervollständigung verwendete Modell.
array
Liste der Vervollständigungsoptionen.Jede Auswahl enthält:
  • index (integer): Index der Auswahl
  • message (object): Die generierte Nachricht
  • finish_reason (string): Weshalb das Modell gestoppt hat (stop, length, tool_calls)
object
Statistiken zur Token-Nutzung.
  • prompt_tokens (integer): Tokens im Prompt
  • completion_tokens (integer): Tokens in der Vervollständigung
  • total_tokens (integer): Insgesamt verwendete Tokens

Multimodales Beispiel