指南
团队如何控制 LLM 成本
把大模型对话当成「免费咖啡」,月底账单就会教育你。费用控制是运维问题:先计量,再设预算,能用小模型完成的事不要默认上最强模型,并减少重试与垃圾上下文。先用本站 Token 费用估算 做预测。
费用从哪来
- 输入 Token — 系统提示、检索片段、历史消息、工具 schema
- 输出 Token — 长回答、带废话的 JSON
- 调用量 — 用户、定时任务、Agent 循环、评测集
- 重试 / 降级 — 超时后再发更大上下文
- 模型档位 — 前沿模型单价通常数倍于中小模型
一条 2000 Token 的系统提示 × 每月 10 万次,仅输入就可能是主要成本。
第一步:先计量再优化
尽量记录(或 10% 采样):模型、输入/输出 Token、功能路由、租户、重试次数、缓存命中。按周汇总「功能 × 模型 × 租户」费用。没有表,就没有优化。
第二步:分层预算
| 层级 | 示例 |
|---|---|
| 公司月度 | 70% 告警,100% 暂停非关键任务 |
| 功能 | 草稿 API:每天 $X |
| 租户 | 免费档每日 Token 上限 |
| Agent | 单任务最多 N 次工具调用 |
触顶时要有产品行为:排队、降级模型或提示人工,而不是静默失败。
第三步:路由表
| 任务 | 优先 | 升级条件 |
|---|---|---|
| 分类 / 打标 | 小模型 | 置信度低 |
| 大纲 / 润色 | 中档 | 品牌/合规风险 |
| 复杂综合 | 前沿 | — |
| 对外敏感文案 | 中档 + 人工 | 始终人工审声明 |
路由写进配置,不要只靠口口相传。
第四步:压缩输入
- 系统提示写短,长说明外置文档
- 历史消息摘要,不要回传 40 轮全文
- RAG 取回 Top 3–5,而非整库粘贴
- 粘贴笔记先走 Prompt 清理
第五步:管住输出与重试
为任务设置合理 max_tokens;能用列表就不用长文。重试设上限(例如 2 次),不要默认「失败就换更贵模型再跑一遍」。
月度估算
月费用 ≈ 调用次数 × (1 + 重试率) × (
平均输入Token × 输入单价/1e6 +
平均输出Token × 输出单价/1e6
)
系统提示或检索变长时要重算——这往往比流量波动更伤预算。
30 天行动
第 1 周计量;第 2 周路由 + max_tokens;第 3 周砍掉最胖的 3 条 Prompt;第 4 周上预算告警。最大收益通常来自「减输入 + 路由」,而不是纠结输出少 5%。
英文深入版:LLM cost control for teams。Token 概念:token counting explained。基础中文:Prompt 与费用入门。
文中工具链接指向本站免费客户端工具。若出现第三方产品链接,可能为联盟链接 — 披露说明.