成本問題
典型的 Coding Agent 工作階段消耗 token 的速度非常快:
按高階模型費率計算,每位開發者每小時 500–5,000。
智慧模型選擇
並非每個編碼任務都需要最貴的模型。按任務匹配合適的檔位:快取策略
Coding Agent 非常適合快取,因為它們不斷重複相似的模式。Prompt Cache(提供方級別)
提供方級別的 Prompt Cache 透過 TokenLab 自動生效。長系統提示——Coding Agent 每次都會包含——在提供方層被快取:
由於 Coding Agent 每次呼叫都傳送相同的系統提示 + 專案上下文,Prompt Cache 命中率通常為 70–90%。
組合節省範例
一個 50,000 輸入 token 的請求(典型 Coding Agent 呼叫):真實成本對比
典型 1 小時編碼工作階段(約 3M token)的估算成本:Token 管理技巧
設定 max_tokens
防止生成失控:使用 Auto-Compact
大多數 Coding Agent 支援上下文壓縮——總結舊對話輪次以減少 token 數量:- Claude Code:內建 auto-compact,在上下文達到限制時自動觸發
- Cursor:自動上下文管理
- Codex CLI:使用
--max-context參數
避免上下文膨脹
- 只需要一個函式時不要貼上整個檔案
- 使用
.gitignore風格的模式排除無關檔案 - 切換任務時清除對話歷史