AI 编程与智能体工程 · 第 3 期

API 账单为什么这么高?

token 账本与预算工程 · token budget

同一个任务,有人花 0.3 美元,有人花 3 美元,差 10 倍——差在缓存计价、批量通道、上下文结构。token 是 AI 编程的油表,不看油表开车必抛锚。多数团队的超支不是用量大,是计价方式没选对。
⏱ 约 11 分钟 🎯 用 AI 编程、关心账单的工程师/技术负责人 📦 源:ai-coding-engineering §2

01一个反共识:贵不是用量大,是计价没选对

很多人看到 API 账单大,第一反应是"少用点"。但同一段对话,三种计价方式价格能差 10 倍:

成本 = token 数 × 单价 × 计价系数

token 数你很难压(任务决定),单价是厂商定的,唯一能控的是计价系数:缓存命中能打到 0.1 折,批量通道能打 5 折,直接调用是 1 倍。同一个任务,选对计价方式,账单直接砍到 1/10。

token 是 AI 编程的油表,
不看油表开车必抛锚。
灏天文库 · AI 编程与智能体工程 P.09

02三种计价:直接 / 缓存 / 批量

主流编程 API 给三种计价通道,适用场景不同:

下面这个计算器把三种计价并排:输入你的任务,看三种方式各花多少、能省多少。

💰 token 账本计算器
输入任务参数,对比直接/缓存/批量三种计价的成本。
(系统提示+repo map,可缓存)
(本轮新内容)
(同一前缀重复)
直接调用
$ —
缓存命中
$ —
批量通道
$ —

03上下文结构:能缓存的放前面

缓存不是"自动生效",它要求前缀逐字相同。所以上下文要按"可缓存 → 不可缓存"排序:

  1. 系统提示(固定,每轮一样)→ 最前,必缓存。
  2. 仓库地图 / 工具 schema(一个会话内不变)→ 紧跟,缓存。
  3. 历史对话(逐轮增长,前缀稳定部分可缓存)。
  4. 本轮新输入(每轮不同)→ 最后,不缓存。

把变动内容放前面、固定内容放后面,缓存全失效;反过来,缓存命中率从 0% 拉到 80%+,账单直接砍到 1/5。这是零成本降本——只改顺序,不改用量。

能缓存的放前面,
变动的放后面。
灏天文库 · AI 编程与智能体工程 P.10

04带走这套清单

✅ token 预算 6 条可执行规则

  1. 建 token 账本:每个任务记 input/output token,按周看分布,别等账单来了才看。
  2. 固定前缀走缓存:系统提示、repo map 放最前,确保逐字相同,命中率 80%+。
  3. 非实时走批量:评测、批量改写、数据标注走 Batch API,5 折。
  4. 上下文按"可缓存→变动"排序:只改顺序不改用量,零成本降本。
  5. 设预算告警:单任务/单用户设 token 上限,超了熔断,防失控烧钱。
  6. 选模型按任务:简单任务用小模型/编程 API(更便宜),复杂任务才上大模型。
省 token 不是少用,
是用对计价。
灏天文库 · AI 编程与智能体工程 P.11