Skip to main content

Cuerpo de la solicitud

string
requerido
ID del modelo a usar. Consulte Models para las opciones disponibles.
array
requerido
Una lista de mensajes que componen la conversación.Cada objeto de mensaje contiene:
  • role (string): system, user o assistant
  • content (string | array): El contenido del mensaje
Cuando content es un array, TokenLab admite bloques multimodales estructurados para modelos compatibles:
  • text: { "type": "text", "text": "..." }
  • imagen: { "type": "image_url", "image_url": { "url": "https://..." } }
  • video: { "type": "video_url", "video_url": { "url": "https://..." } }
  • audio: { "type": "audio_url", "audio_url": { "url": "https://..." } }
Para tráfico multimodal en producción, prefiera URLs públicas https. TokenLab traducirá estos bloques de medios al formato de solicitud específico del proveedor requerido por el modelo físico enrutado.
number
predeterminado:"1"
Temperatura de muestreo entre 0 y 2. Valores más altos hacen la salida más aleatoria.
integer
Número máximo de tokens a generar.
boolean
predeterminado:"false"
Si es true, se enviarán deltas parciales del mensaje como eventos SSE.
object
Opciones para streaming. Establezca include_usage: true para recibir el uso de tokens en fragmentos de la transmisión.
number
predeterminado:"1"
Parámetro de muestreo Nucleus. Recomendamos alterar esto o la temperatura, no ambos.
number
predeterminado:"0"
Número entre -2.0 y 2.0. Los valores positivos penalizan tokens repetidos.
number
predeterminado:"0"
Número entre -2.0 y 2.0. Los valores positivos penalizan tokens que ya están en el texto.
string | array
Hasta 4 secuencias donde la API dejará de generar tokens.
array
Una lista de herramientas que el modelo puede invocar (llamado de funciones).
string | object
Controla cómo el modelo usa las herramientas. Opciones: auto, none, required, o un objeto de herramienta específico.
boolean
predeterminado:"true"
Indica si se habilitan llamadas a funciones en paralelo. Establézcalo en false para llamar a las funciones de forma secuencial.
integer
Tokens máximos para la completación. Alternativa a max_tokens, útil para familias de modelos más nuevas con capacidad de razonamiento.
string
Esfuerzo de razonamiento para modelos con capacidad de razonamiento. Opciones: low, medium, high.
integer
Semilla aleatoria para muestreo determinista.
integer
predeterminado:"1"
Número de completaciones a generar (1-128).
boolean
Si se deben retornar las probabilidades logarítmicas.
integer
Número de probabilidades logarítmicas superiores a retornar (0-20). Requiere logprobs: true.
integer
Parámetro de muestreo Top-K (para modelos Anthropic/Gemini).
object
Especificación del formato de respuesta. Use {"type": "json_object"} para modo JSON. Considere {"type": "json_schema", "json_schema": {...}} como una ruta de mejores esfuerzos que depende del modelo seleccionado y del comportamiento de enrutamiento.
object
Modifica la probabilidad de aparición de tokens especificados. Mapee IDs de tokens (como strings) a valores de sesgo de -100 a 100.
string
Un identificador único que representa a su usuario final para la monitorización de abuso.

Respuesta

string
Identificador único para la completación.
string
Siempre chat.completion.
integer
Marca de tiempo Unix de cuando se creó la completación.
string
El modelo usado para la completación.
array
Lista de opciones de completación.Cada opción contiene:
  • index (integer): Índice de la opción
  • message (object): El mensaje generado
  • finish_reason (string): Por qué el modelo se detuvo (stop, length, tool_calls)
object
Estadísticas de uso de tokens.
  • prompt_tokens (integer): Tokens en el prompt
  • completion_tokens (integer): Tokens en la completación
  • total_tokens (integer): Tokens totales utilizados

Ejemplo multimodal