Skip to main content

Corps de la requête

string
requis
ID du modèle à utiliser. Voir Modèles pour les options disponibles.
array
requis
Une liste de messages constituant la conversation.Chaque objet message contient :
  • role (string) : system, user, ou assistant
  • content (string | array) : Le contenu du message
Lorsque content est un tableau, TokenLab prend en charge des blocs multimodaux structurés pour les modèles compatibles :
  • text: { "type": "text", "text": "..." }
  • image: { "type": "image_url", "image_url": { "url": "https://..." } }
  • vidéo: { "type": "video_url", "video_url": { "url": "https://..." } }
  • audio: { "type": "audio_url", "audio_url": { "url": "https://..." } }
Pour le trafic multimodal en production, privilégiez des URLs publiques en https. TokenLab traduira ces blocs médias dans la forme de requête spécifique au fournisseur requise par le modèle physique routé.
number
défaut:"1"
Température d’échantillonnage entre 0 et 2. Des valeurs plus élevées rendent la sortie plus aléatoire.
integer
Nombre maximal de tokens à générer.
boolean
défaut:"false"
Si true, des deltas de message partiels seront envoyés comme événements SSE.
object
Options pour le streaming. Définissez include_usage: true pour recevoir l’utilisation des tokens dans les fragments de stream.
number
défaut:"1"
Paramètre de sampling nucleus. Nous recommandons de modifier celui-ci ou la température, pas les deux.
number
défaut:"0"
Nombre entre -2.0 et 2.0. Les valeurs positives pénalisent les tokens répétés.
number
défaut:"0"
Nombre entre -2.0 et 2.0. Les valeurs positives pénalisent les tokens déjà présents dans le texte.
string | array
Jusqu’à 4 séquences où l’API arrêtera de générer des tokens.
array
Une liste d’outils que le modèle peut appeler (appel de fonctions).
string | object
Contrôle la manière dont le modèle utilise les outils. Options : auto, none, required, ou un objet outil spécifique.
boolean
défaut:"true"
Permet d’activer l’appel de fonctions en parallèle. Définir sur false pour appeler les fonctions séquentiellement.
integer
Nombre maximal de tokens pour la complétion. Alternative à max_tokens, utile pour les familles de modèles plus récentes activées pour le raisonnement.
string
Effort de raisonnement pour les modèles activés pour le raisonnement. Options : low, medium, high.
integer
Seed aléatoire pour un échantillonnage déterministe.
integer
défaut:"1"
Nombre de complétions à générer (1-128).
boolean
Indique s’il faut retourner les log-probabilités.
integer
Nombre de log-probabilités les plus élevées à retourner (0-20). Nécessite logprobs: true.
integer
Paramètre d’échantillonnage Top-K (pour les modèles Anthropic/Gemini).
object
Spécification du format de réponse. Utiliser {"type": "json_object"} pour le mode JSON. Considérez {"type": "json_schema", "json_schema": {...}} comme une approche best-effort qui dépend du modèle sélectionné et du comportement routé.
object
Modifier la probabilité d’apparition de tokens spécifiés. Mappez les IDs de tokens (comme des chaînes) à des valeurs de biais entre -100 et 100.
string
Identifiant unique représentant votre utilisateur final pour la surveillance des abus.

Réponse

string
Identifiant unique de la complétion.
string
Toujours chat.completion.
integer
Timestamp Unix du moment où la complétion a été créée.
string
Le modèle utilisé pour la complétion.
array
Liste des choix de complétion.Chaque choix contient :
  • index (integer) : Index du choix
  • message (object) : Le message généré
  • finish_reason (string) : Pourquoi le modèle s’est arrêté (stop, length, tool_calls)
object
Statistiques d’utilisation des tokens.
  • prompt_tokens (integer) : Tokens dans le prompt
  • completion_tokens (integer) : Tokens dans la complétion
  • total_tokens (integer) : Total des tokens utilisés

Exemple multimodal