Skip to main content

Corpo da Requisição

string
obrigatório
ID do modelo a ser usado. Veja Models para opções disponíveis.
array
obrigatório
Uma lista de mensagens que compõem a conversa.Cada objeto de mensagem contém:
  • role (string): system, user ou assistant
  • content (string | array): O conteúdo da mensagem
Quando content é um array, a TokenLab dá suporte a blocos multimodais estruturados para modelos compatíveis:
  • text: { "type": "text", "text": "..." }
  • image: { "type": "image_url", "image_url": { "url": "https://..." } }
  • video: { "type": "video_url", "video_url": { "url": "https://..." } }
  • audio: { "type": "audio_url", "audio_url": { "url": "https://..." } }
Para tráfego multimodal de produção, prefira URLs públicas https. TokenLab irá traduzir esses blocos de mídia para a forma de requisição específica do provedor exigida pelo modelo físico roteado.
number
padrão:"1"
Temperatura de amostragem entre 0 e 2. Valores mais altos tornam a saída mais aleatória.
integer
Número máximo de tokens a serem gerados.
boolean
padrão:"false"
Se true, deltas parciais da mensagem serão enviados como eventos SSE.
object
Opções para streaming. Defina include_usage: true para receber uso de tokens em chunks do stream.
number
padrão:"1"
Parâmetro de amostragem Nucleus. Recomendamos alterar este ou temperature, não ambos.
number
padrão:"0"
Número entre -2.0 e 2.0. Valores positivos penalizam tokens repetidos.
number
padrão:"0"
Número entre -2.0 e 2.0. Valores positivos penalizam tokens já presentes no texto.
string | array
Até 4 sequências nas quais a API irá parar de gerar tokens.
array
Uma lista de ferramentas que o modelo pode chamar (chamada de função).
string | object
Controla como o modelo usa ferramentas. Opções: auto, none, required, ou um objeto de ferramenta específico.
boolean
padrão:"true"
Se deve habilitar chamadas de função em paralelo. Defina como false para chamar funções sequencialmente.
integer
Máximo de tokens para a conclusão. Alternativa a max_tokens, útil para famílias de modelos mais novas com suporte a raciocínio.
string
Esforço de raciocínio para modelos com suporte a raciocínio. Opções: low, medium, high.
integer
Semente aleatória para amostragem determinística.
integer
padrão:"1"
Número de conclusões a gerar (1-128).
boolean
Se deve retornar probabilidades logarítmicas.
integer
Número das maiores probabilidades logarítmicas a retornar (0-20). Requer logprobs: true.
integer
Parâmetro de amostragem Top-K (para modelos Anthropic/Gemini).
object
Especificação do formato de resposta. Use {"type": "json_object"} para o modo JSON. Trate {"type": "json_schema", "json_schema": {...}} como um caminho de melhor esforço que depende do modelo selecionado e do comportamento roteado.
object
Modifique a probabilidade de tokens especificados aparecerem. Mapeie IDs de tokens (como strings) para valores de bias de -100 a 100.
string
Um identificador único representando seu usuário final para monitoramento de abuso.

Resposta

string
Identificador único para a conclusão.
string
Sempre chat.completion.
integer
Timestamp Unix de quando a conclusão foi criada.
string
O modelo usado para a conclusão.
array
Lista de opções de conclusão.Cada opção contém:
  • index (integer): Índice da escolha
  • message (object): A mensagem gerada
  • finish_reason (string): Por que o modelo parou (stop, length, tool_calls)
object
Estatísticas de uso de tokens.
  • prompt_tokens (integer): Tokens no prompt
  • completion_tokens (integer): Tokens na conclusão
  • total_tokens (integer): Total de tokens usados

Exemplo Multimodal