第 5 章 · 实验教程:Coding Agent 与代码生成


文档摘要

第 5 章 · 实验教程:Coding Agent 与代码生成 本章对应正文:第 5 章 · Coding Agent 与代码生成 核心命题:代码是「能创造新工具的工具」——当 Agent 会写代码,它就能现场造出解决新问题的工具,从"用现成工具"升级到"造需要的工具"。 普通工具是把固定能力交给 Agent,代码则是把"创造能力"本身交给 Agent。这一章的核心洞见是:把任务重构为代码生成问题后,Agent 不仅更可靠(让代码去算数学、求解约束、跑 SQL),还能自我进化(遇到新格式就现场写解析器、自动热更新)。从数学题、逻辑谜题,到 PPT、视频、ERP 查询,代码生成把"模糊的自然语言推理"换成"确定的程序执行"。

第 5 章 · 实验教程:Coding Agent 与代码生成

本章对应正文:第 5 章 · Coding Agent 与代码生成

核心命题:代码是「能创造新工具的工具」——当 Agent 会写代码,它就能现场造出解决新问题的工具,从"用现成工具"升级到"造需要的工具"。

普通工具是把固定能力交给 Agent,代码则是把"创造能力"本身交给 Agent。这一章的核心洞见是:把任务重构为代码生成问题后,Agent 不仅更可靠(让代码去算数学、求解约束、跑 SQL),还能自我进化(遇到新格式就现场写解析器、自动热更新)。从数学题、逻辑谜题,到 PPT、视频、ERP 查询,代码生成把"模糊的自然语言推理"换成"确定的程序执行"。

本章 12 个实验从两个对照研究(数学、逻辑)起步,逐步走到 PPT/视频生成、自适应解析、生产级 Coding Agent,最后落到动态表单、对话式 UI 等"代码改造世界"的应用。建议先做 code-for-math 和 code-for-logic 两个对照实验,直观感受"代码辅助 vs 纯思维链"的差距,再按兴趣深入。

实验列表

实验 类型 难度 说明
code-for-math ★★ 同模型同题集对比「纯思维链」与「代码辅助」,后者用 sympy/numpy/scipy 在沙箱执行,准确率显著更高
code-for-logic ★★ 把「骑士与无赖」转化为约束满足问题,用 python-constraint 求解,对比自然语言推理与代码辅助
small-model-codified-rules ★★ τ-bench 航空客服对照:把退款规则从提示词搬进代码/工具后,小模型成功率从 88% 提升到 100%
coding-agent ★★★ 基于 Claude 的生产级编码助手,纯 Python 实现 17 个工具(含纯 Python Grep),无命令行依赖
paper-to-ppt ★★ 把「做 PPT」重构为代码生成:Proposer 写 Slidev,Reviewer 真渲染成 PNG 用 Vision LLM 检查迭代
paper-to-video ★★ 在「论文 → PPT」基础上生成讲解词、TTS 合成、ffmpeg 逐页同步成带旁白的讲解视频
video-edit ★★ 一段多场景视频 + 一句自然语言需求,两步 Vision 定位剪出片段,Reviewer 抽帧核对不合格则迭代
adaptive-log-parser ★★ 遇到无法解析的新格式时不报错,交给代码 Agent 生成 parse 函数,测试通过后热更新进引擎
log-diagnosis ★★★ 诊断 Agent 读轨迹日志/架构文档/PRD,定位根因、生成回归测试、重放框架真实验证,并(mock)对接 GitHub
dynamic-form ★★ 信息不全时动态生成含级联逻辑的 HTML 表单让用户一次性补全,汇总 JSON 交回 Agent
erp-agent ★★ 中文自然语言转 SQL 由数据库执行,artifact 模式让 LLM 只生成 SQL 制品不搬运数据,省 token 又防错
conversational-ui ★★ 自然语言提 UI 定制需求(颜色/字体/文案/布局),Agent 改 React 源码借 Vite HMR 即时生效

类型与难度说明

标记 含义
可独立运行:自带完整代码,配好 API Key 即可跑
📖 复现指南:依赖需自行 git clone 的外部仓库
🚧 设计文档:仅含架构方案,可运行代码仍在完善
★ ~ ★★★ 从易到难,★ 为入门级、★★★ 为进阶挑战

阅读建议

  • 入门读者:先做 code-for-math 和 code-for-logic,用对照实验直观看到"代码辅助"相对"纯思维链"的准确率提升。
  • 关注应用落地:paper-to-ppt → paper-to-video 演示了从论文到演示稿、再到讲解视频的完整代码生成链;erp-agent 和 conversational-ui 则展示了"代码改造业务系统"的实战。
  • 关注自我进化:adaptive-log-parser 和 log-diagnosis 是本章"代码作为系统适配器"的精华——Agent 遇到新情况能现场写代码并热更新进系统。

← 返回总目录 · 📖 读本章正文 · 📑 本章索引


发布者: 作者: bojieli 转发
评论区 (0)
U