8.3 成本、限速与可靠性


8.3 成本、限速与可靠性

本节摘要:运行面的数字与纪律。成本:输入 $0.042/百万 token、输出免费——300 token 的一次调用约 $0.0000126,百万次约 $12.6 起(state 越大越贵,扇出问题几乎白送);实测参照:1,018 篇论文打标 $0.08、Doom 机器人 10 查询/秒约 $7/小时。限速(早期访问,动态):250K tokens/s、1,200 请求/min;429/529 指数退避重试——调用纯函数无副作用,重试零风险。可靠性四纪律:客户端超时 2~5s 超时走保守分支(Jev 只是 if 的另一边,别让它成为单点);版本钉死(生产用 jev-1.13.0 这类具体版本,jev-latest 只进实验);全量观测落盘(它是第 9 章的全部原料);官方宣称的 193.6 倍/444.6 倍是自报上界,自己的账自己算。

学习目标

阅读完本节,你应当能够:

  1. 为一个场景估算月度成本并知道省钱杠杆在哪。
  2. 配好超时、重试、降级三件套。
  3. 解释版本钉死与全量落盘的理由。

一、成本速算

单价:输入 $0.042 / 百万 token($42/十亿);输出免费(官方说法"便宜到不值得计量")。

用量 成本
一次 ~300 token 的调用 ≈ $0.0000126
百万次小调用 ≈ $12.6
日均 10 万次(月 300 万) ≈ $38~$200(视 state 大小)
实测:1,018 篇论文逐篇打标 ≈ $0.08
实测:Doom 机器人(10 查询/秒持续) ≈ $7/小时

成本结构:钱几乎全在 state 的 token 上——问题(尤其 Noul/Choice 的 criteria)只占几十 token。三个省钱杠杆按效果排序:

  1. 裁 state(第 8.1 节相关性审计——省钱与提质一举两得);
  2. 扇出合并(同 state 的判断合并成一个请求,state 只付一次钱,第 5.1 节);
  3. 缓存(重复输入直接命中,第 8.1 节)。

⚠️ 官方倍数的正确读法:"快 193.6 倍、便宜 444.6 倍"是 workflow 评测的上界(基线为 GPT-6 Astra 与 Fable 5.1 均值),官方自述"预计属真实收益偏高端"。用你的真实流量按上表口径自算一遍,那才是你的数。

二、限速与退避

早期访问期限速(动态调整,以控制台为准):250,000 tokens/s、1,200 请求/min。

  • 429(限速)/ 529(过载):指数退避重试(1s→2s→4s,3 次起);
  • 重试零风险:纯函数调用、无副作用、幂等——这是 Jev 相对"有副作用的 LLM 工作流"的工程红利;
  • 高并发场景(如第 7.1 节排名的批量评估)把并发度压在限速的 ~70%,留退避余量;
  • 持续触发限速:控制台申请提额,而不是加客户端并发(只会更糟)。

三、可靠性四纪律

def jev_with_resilience(state, questions): for attempt in range(3): try: return requests.post(API_URL, headers=HEADERS, json={"model": "jev-1.13.0", # 纪律①:钉版本 "state": state, "questions": questions}, timeout=3).raise_for_status().json() except (requests.Timeout, requests.ConnectionError) as e: # 纪律②:短超时 if attempt == 2: log(state, questions, error=e) # 纪律④:落盘失败也落盘 return CONSERVATIVE_DEFAULT # 纪律③:降级 time.sleep(2 ** attempt)
  1. 短超时 + 降级:端到端 70500ms,客户端超时 25s 足够;超时的正确动作是走保守分支(Jev 只是 if 的另一边——路由降级到默认路径、护栏降级到"需确认"、分类降级到人工队列),而不是阻塞主流程。别让 Jev 成为单点。
  2. 版本钉死:生产请求写 jev-1.13.0 这类具体版本号;jev-latest(稳定别名)只用于实验环境。模型行为随版本变(和 LLM 一样的纪律),升级 = 一次完整的四步上线(第 8.2 节变更表)。
  3. 观测落盘:每条调用记录(state 摘要、问题 ID、答案、probabilities、confidence、最终分支、延迟、错误)——它同时是:成本对账的凭据、第 9 章回归集与校准监控的原料、以及线上事故复盘的唯一真相。
  4. 失败也落盘:超时/错误样本进单独的错误流——它们是"最难判断的输入"的天然采样,回归集里的金子。

四、一份上线前检查单

  • state 过了相关性审计(差集为空)且距容量红线有余量
  • 问题 ID 稳定、instructions 集中为常量、回归集首版入库
  • 同 state 判断已合并扇出;可缓存场景已接缓存
  • 超时 2~5s + 保守分支降级路径已测
  • 429/529 退避重试已测;并发度 ≤ 限速 70%
  • 生产模型版本已钉死;升级流程写入 runbook
  • 全量观测落盘 + 成本告警阈值已设
  • 监控指标与回退条件(第 8.2 节表)进 dashboard

本节要点回顾

  1. 成本:钱在 state;省钱三杠杆——裁 state、扇出合并、缓存;百万次调用约 $12.6 起,但自己的账自己算
  2. 限速:429/529 退避重试零风险;并发压七成;持续触限申请提额。
  3. 可靠性:短超时走保守分支(别成单点)、版本钉死、失败也落盘——四纪律一码到位。

到此,"能上线"的全部工程件齐了。但"放心"还差最后一块:你怎么知道它说的 0.9 真的是九成命中? 下一章,自己量。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U