Skip to main content

Seleção de Modelo

Escolher o modelo certo pode impactar significativamente o custo e a qualidade.

Recomendações Baseadas em Tarefas

Faixas de Custo

Otimização de Custos

1. Use Modelos Menores Primeiro

2. Defina max_tokens

Sempre defina um limite razoável de max_tokens:

3. Otimize os Prompts

4. Faça Batch de Requisições Semelhantes

Otimização de Performance

5. Use Streaming para UX

Streaming melhora a performance percebida:

6. Escolha Modelos Rápidos para Uso Interativo

7. Defina Timeouts

Confiabilidade

8. Implemente Retries

9. Trate Erros de Forma Elegante

10. Use Modelos de Fallback

Segurança

11. Proteja as API Keys

12. Valide a Entrada do Usuário

13. Defina Limites para API Keys

Crie API keys separadas com limites de gastos para:
  • Desenvolvimento/testes
  • Produção
  • Diferentes aplicações

Monitoramento

14. Acompanhe o Uso

Verifique seu dashboard regularmente para:
  • Uso de token por modelo
  • Detalhamento de custos
  • Taxas de acerto do cache
  • Taxas de erro

15. Registre Métricas Importantes

16. Configure Alertas

Configure alertas de saldo baixo no seu dashboard para evitar interrupção do serviço.

Lista de verificação

  • Usando o modelo apropriado para cada tarefa
  • Definindo limites de max_tokens
  • Prompts concisos
  • Cache habilitado onde apropriado
  • Batch de requisições semelhantes
  • Streaming para UX interativa
  • Modelos rápidos para uso em tempo real
  • Timeouts configurados
  • Lógica de retry implementada
  • Tratamento de erros implementado
  • Modelos de fallback configurados
  • API keys em variáveis de ambiente
  • Validação de entrada
  • Chaves separadas para dev/prod
  • Limites de gastos definidos