跳转到主要内容

模型选择

选择合适的模型会显著影响成本和质量。

基于任务的推荐

成本层级

成本优化

1. 优先使用更小的模型

2. 设置 max_tokens

始终设置合理的 max_tokens 限制:

3. 优化 Prompt

4. 批量处理相似请求

性能优化

5. 为 UX 使用流式输出

流式输出可以改善感知性能:

6. 为交互式使用选择快速模型

7. 设置超时

可靠性

8. 实现重试机制

9. 优雅地处理错误

10. 使用回退模型

安全性

11. 保护 API Key

12. 验证用户输入

13. 设置 API Key 限额

为以下场景创建带有消费限额的独立 API Key:
  • 开发/测试
  • 生产环境
  • 不同应用程序

监控

14. 跟踪使用情况

定期检查你的仪表盘,关注:
  • 按模型统计的 token 使用量
  • 成本明细
  • 缓存命中率
  • 错误率

15. 记录重要指标

16. 设置告警

在你的仪表盘中配置低余额告警,以避免服务中断。

检查清单

  • 为每项任务使用合适的模型
  • 设置 max_tokens 限制
  • Prompt 简洁
  • 在适用场景启用缓存
  • 批量处理相似请求
  • 为交互式 UX 使用流式输出
  • 为实时使用选择快速模型
  • 已配置超时
  • 已实现重试逻辑
  • 已具备错误处理机制
  • 已配置回退模型
  • API Key 存储在环境变量中
  • 输入验证
  • 为 dev/prod 使用独立 Key
  • 已设置消费限额