指南

团队如何控制 LLM 成本

成本Token团队

把大模型对话当成「免费咖啡」,月底账单就会教育你。费用控制是运维问题:先计量,再设预算,能用小模型完成的事不要默认上最强模型,并减少重试与垃圾上下文。先用本站 Token 费用估算 做预测。

费用从哪来

  1. 输入 Token — 系统提示、检索片段、历史消息、工具 schema
  2. 输出 Token — 长回答、带废话的 JSON
  3. 调用量 — 用户、定时任务、Agent 循环、评测集
  4. 重试 / 降级 — 超时后再发更大上下文
  5. 模型档位 — 前沿模型单价通常数倍于中小模型

一条 2000 Token 的系统提示 × 每月 10 万次,仅输入就可能是主要成本。

第一步:先计量再优化

尽量记录(或 10% 采样):模型、输入/输出 Token、功能路由、租户、重试次数、缓存命中。按周汇总「功能 × 模型 × 租户」费用。没有表,就没有优化。

第二步:分层预算

层级示例
公司月度70% 告警,100% 暂停非关键任务
功能草稿 API:每天 $X
租户免费档每日 Token 上限
Agent单任务最多 N 次工具调用

触顶时要有产品行为:排队、降级模型或提示人工,而不是静默失败。

第三步:路由表

任务优先升级条件
分类 / 打标小模型置信度低
大纲 / 润色中档品牌/合规风险
复杂综合前沿
对外敏感文案中档 + 人工始终人工审声明

路由写进配置,不要只靠口口相传。

第四步:压缩输入

  • 系统提示写短,长说明外置文档
  • 历史消息摘要,不要回传 40 轮全文
  • RAG 取回 Top 3–5,而非整库粘贴
  • 粘贴笔记先走 Prompt 清理

第五步:管住输出与重试

为任务设置合理 max_tokens;能用列表就不用长文。重试设上限(例如 2 次),不要默认「失败就换更贵模型再跑一遍」。

月度估算

月费用 ≈ 调用次数 × (1 + 重试率) × (
  平均输入Token × 输入单价/1e6 +
  平均输出Token × 输出单价/1e6
)

系统提示或检索变长时要重算——这往往比流量波动更伤预算。

30 天行动

第 1 周计量;第 2 周路由 + max_tokens;第 3 周砍掉最胖的 3 条 Prompt;第 4 周上预算告警。最大收益通常来自「减输入 + 路由」,而不是纠结输出少 5%。

英文深入版:LLM cost control for teams。Token 概念:token counting explained。基础中文:Prompt 与费用入门

文中工具链接指向本站免费客户端工具。若出现第三方产品链接,可能为联盟链接 — 披露说明.