Skip to main content

模型選擇

選擇合適的模型會大幅影響成本與品質。

依任務類型的建議

成本層級

成本最佳化

1. 優先使用較小型的模型

2. 設定 max_tokens

請務必設定合理的 max_tokens 上限:

3. 最佳化 Prompt

4. 批次處理相似請求

效能最佳化

5. 為 UX 使用串流回應

串流回應可改善使用者感受到的效能:

6. 互動式使用情境選擇快速模型

7. 設定逾時

可靠性

8. 實作重試機制

9. 妥善處理錯誤

10. 使用備援模型

安全性

11. 保護 API Keys

12. 驗證使用者輸入

13. 設定 API Key 限制

為以下用途建立具備支出上限的獨立 API keys:
  • 開發/測試
  • 正式環境
  • 不同應用程式

監控

14. 追蹤使用量

請定期檢查您的 dashboard,以掌握:
  • 各模型的 token 使用量
  • 成本明細
  • 快取命中率
  • 錯誤率

15. 記錄重要指標

16. 設定警示

在您的 dashboard 中設定低餘額警示,以避免服務中斷。

檢查清單

  • 為每項任務使用適當的模型
  • 設定 max_tokens 上限
  • Prompt 保持精簡
  • 在適當情況下啟用快取
  • 批次處理相似請求
  • 為互動式 UX 使用串流回應
  • 即時使用情境採用快速模型
  • 已設定逾時
  • 已實作重試邏輯
  • 已建立錯誤處理機制
  • 已設定備援模型
  • API keys 存放於環境變數中
  • 輸入驗證
  • 為 dev/prod 使用獨立 keys
  • 已設定支出上限