大模型 API 成本控制实战:从烧钱到省一半的账单

张老师234 阅读

接手项目的时候,每月 API 账单 5 位数,老板问能不能省。我优化了一轮,成本降了 55%,功能没减。这篇文章把这套组合拳写出来,都是实践过的。

1. 按场景选模型(最大的节省)

把业务场景分级:

  • 简单分类、提取、格式化:用最便宜的模型(如 DeepSeek-lite、GPT-4o-mini)
  • 常规对话:中等模型
  • 复杂推理、长文生成:才用旗舰模型

实测:80% 的请求其实不需要旗舰模型。光这一条,成本降了 30%+。

2. 压缩 system prompt

把 system prompt 从 1000 token 压缩到 400:删掉废话、合并规则、精简示例。每次请求省 600 token,量大了很可观。注意:别为了省 token 把关键指令删了。

3. 语义缓存(上一篇讲过)

相似问题直接返回缓存答案。客服类场景命中率 30%+,省 40% 调用。

4. 输入压缩

RAG 的检索上下文,别把 top-5 全塞进去。先粗筛再精排,只喂 top-3,并且每段截断到 300 字。输入 token 直接少 40%。

5. 输出控制

  • 设 max_tokens:别让模型无限发挥,长文任务明确长度
  • 能不用 JSON 就不用 JSON 模式(它消耗更多 token),结构化简单的用格式约定

6. 批量处理

非实时任务(如批量摘要、批量分类)合并请求:一次调用处理多条,摊薄固定开销。配合异步队列,高峰期削峰。

7. 用量监控

每天看 token 消耗分布,哪个场景烧钱最多一眼看清。我用 one-api 的用量报表,按场景打标签。

避坑

  • 别盲目换便宜模型:先跑评估,确认质量达标再切。
  • 别为省 token 牺牲召回:检索质量下降导致的"答错重问"成本更高。
  • 别在缓存上省安全:敏感数据不缓存(前面讲过)。

总结:省钱的核心是"让每个请求只花它该花的钱"。模型分级 + 缓存 + 输入压缩三件套,大部分项目能省 40% 以上。

评论0

还没有评论,来抢沙发~