本节摘要:代码执行工具包是会议的演算席:在受控环境里真实运行代码,把"模型觉得应该是"变成"实际算出来是"。本节讲执行环境的选型谱系、结果回收的姿势、安全边界的三条红线,以及演算席最独特的纪律——跑过才算数。
前两席解决"材料从哪来、读不读得懂",本席解决"算不算得对"。凡是带数字的议题(差价、占比、增长率),都该经过演算席而不是让模型心算——语言模型对算术的自信与其正确率长期不成正比,这是全册反复出现的一条铁律。
演算席的核心配置是"代码在哪里跑"。隔离越强,环境越干净但能力越受限;隔离越弱,能力越完整但风险越高。常见选项从保守到激进:

选型没有标准答案,只有场景匹配:处理外部抓来的数据,容器沙箱最稳妥;多步数据分析需要中间状态延续,笔记本内核顺手;纯粹算个差价,受控解释器最省事。
演算席的回报必须包含实际执行结果,而不是模型对结果的预期。这是它与普通"会写代码的智能体"的本质区别。一次合格的演算回报长这样:
def margin_report(our_price: float, comp_price: float) -> str: """竞品差价演算:由演算席在真实环境中执行后回报。 返回:计算过程与结果的文字纪要。""" if our_price <= 0 or comp_price <= 0: return "失败: 出现非正数价格,无法计算百分比" diff_pct = (comp_price - our_price) / our_price * 100 return (f"计算过程:({comp_price} - {our_price})÷ {our_price} × 100\n" f"结果: 竞品月付价高 {diff_pct:.1f}%\n" f"口径: 均按按月付年费折算,基期为我方定价") # 演算席真实执行的回报(演示环境输出): # margin_report(243, 299) # -> '计算过程:(299 - 243)÷ 243 × 100\n结果: 竞品月付价高 23.0%\n口径: 均按按月付年费折算,基期为我方定价'
回报里带计算过程不是啰嗦:主持人验收时能核对口径(用的什么基期),甲方代表验收时能复核逻辑(差价分母是谁)。只回一个"23.0%"的演算席,等于把验收难度全推给了上游。
笔记本内核模式下,演算席的状态可以跨轮延续:第一轮装载数据,第二轮清洗,第三轮出表。这带来一个新纪律——状态要显式申报。每一轮回报里写明"当前会话中已存在的变量与数据规模",防止主持人误以为每轮从零开始,重复装载浪费轮次;更要防止上游材料变更后,旧状态悄悄污染新计算。
def declare_state(kernel_state: dict) -> str: """演算席每轮回报时申报当前内核状态。""" lines = ["当前内核状态:"] for name, desc in kernel_state.items(): lines.append(f" {name}: {desc}") lines.append("若与议题预期不符,请先指示清理再继续") return "\n".join(lines) # 输出: # declare_state({"prices_df": "五竞品价格表,5行12列", "rate_cache": "汇率缓存,7条"}) # -> '当前内核状态:\n prices_df: 五竞品价格表,5行12列\n rate_cache: 汇率缓存,7条\n若与议题预期不符,请先指示清理再继续'
演算席权限强,红线必须先行。写进系统提示词的三条:
def safety_gate(code_text: str, authorized: set) -> tuple: """演算前安全闸:按三条红线做静态初筛。 authorized: 本议题授权的操作集合,如 {'本地计算','读取输入区'}""" risky = [k for k in ("上传", "删除", "外发", "提权") if k in code_text] if risky: return False, f"命中红线关键词:{risky},退回主持人确认" if not any(a in code_text for a in authorized): return False, "代码用途不在议题授权范围内,退回确认" return True, None # 输出: # safety_gate("上传结果到外部服务器", {'本地计算'}) # -> (False, '命中红线关键词:[上传],退回主持人确认')
⚠️ 静态初筛只是提示性的第一道闸,不是安全保证。真正的隔离靠执行环境本身(容器沙箱),别把"提示词里写了禁止"当成"系统上不可能发生"。
背景:首轮跑会时,主持人图省事让执行侧直接"口算"三组差价百分比,跳过了演算席。结果:三组中两组正确,一组把分母用反(该用我方价格做基期,实际用了竞品价格),纪要里"我们贵 19%"实为"竞品贵 19%",方向性错误——这类错误比算错数字更致命,因为它看起来完全合理。操作(复位):议题补上"所有百分比必须经演算席出具计算过程",心算结果全部作废;演算席按统一口径重算并逐条给出算式。结果:三组差价复算后两正一反(原第三组实为竞品更贵),纪要结论方向修正。解读:演算席的成本是每条多一两轮调用,收益是每条数字都有算式可查——只要任务里有会被决策引用的数字,这笔账都是划算的。
变式:大量重复演算(比如上百行价格对比)不适合逐条开会,让演算席写一段批处理脚本一次算完,回报里只给汇总表与异常行——这也是"跑过才算数"的规模化形态。