第 5 章 · 实验教程:Coding Agent 与代码生成 本章对应正文:第 5 章 · Coding Agent 与代码生成 核心命题:代码是「能创造新工具的工具」——当 Agent 会写代码,它就能现场造出解决新问题的工具,从"用现成工具"升级到"造需要的工具"。 普通工具是把固定能力交给 Agent,代码则是把"创造能力"本身交给 Agent。这一章的核心洞见是:把任务重构为代码生成问题后,Agent 不仅更可靠(让代码去算数学、求解约束、跑 SQL),还能自我进化(遇到新格式就现场写解析器、自动热更新)。从数学题、逻辑谜题,到 PPT、视频、ERP 查询,代码生成把"模糊的自然语言推理"换成"确定的程序执行"。
本章对应正文:第 5 章 · Coding Agent 与代码生成
核心命题:代码是「能创造新工具的工具」——当 Agent 会写代码,它就能现场造出解决新问题的工具,从"用现成工具"升级到"造需要的工具"。
普通工具是把固定能力交给 Agent,代码则是把"创造能力"本身交给 Agent。这一章的核心洞见是:把任务重构为代码生成问题后,Agent 不仅更可靠(让代码去算数学、求解约束、跑 SQL),还能自我进化(遇到新格式就现场写解析器、自动热更新)。从数学题、逻辑谜题,到 PPT、视频、ERP 查询,代码生成把"模糊的自然语言推理"换成"确定的程序执行"。
本章 12 个实验从两个对照研究(数学、逻辑)起步,逐步走到 PPT/视频生成、自适应解析、生产级 Coding Agent,最后落到动态表单、对话式 UI 等"代码改造世界"的应用。建议先做 code-for-math 和 code-for-logic 两个对照实验,直观感受"代码辅助 vs 纯思维链"的差距,再按兴趣深入。
| 实验 | 类型 | 难度 | 说明 |
|---|---|---|---|
| code-for-math | ✅ | ★★ | 同模型同题集对比「纯思维链」与「代码辅助」,后者用 sympy/numpy/scipy 在沙箱执行,准确率显著更高 |
| code-for-logic | ✅ | ★★ | 把「骑士与无赖」转化为约束满足问题,用 python-constraint 求解,对比自然语言推理与代码辅助 |
| small-model-codified-rules | ✅ | ★★ | τ-bench 航空客服对照:把退款规则从提示词搬进代码/工具后,小模型成功率从 88% 提升到 100% |
| coding-agent | ✅ | ★★★ | 基于 Claude 的生产级编码助手,纯 Python 实现 17 个工具(含纯 Python Grep),无命令行依赖 |
| paper-to-ppt | ✅ | ★★ | 把「做 PPT」重构为代码生成:Proposer 写 Slidev,Reviewer 真渲染成 PNG 用 Vision LLM 检查迭代 |
| paper-to-video | ✅ | ★★ | 在「论文 → PPT」基础上生成讲解词、TTS 合成、ffmpeg 逐页同步成带旁白的讲解视频 |
| video-edit | ✅ | ★★ | 一段多场景视频 + 一句自然语言需求,两步 Vision 定位剪出片段,Reviewer 抽帧核对不合格则迭代 |
| adaptive-log-parser | ✅ | ★★ | 遇到无法解析的新格式时不报错,交给代码 Agent 生成 parse 函数,测试通过后热更新进引擎 |
| log-diagnosis | ✅ | ★★★ | 诊断 Agent 读轨迹日志/架构文档/PRD,定位根因、生成回归测试、重放框架真实验证,并(mock)对接 GitHub |
| dynamic-form | ✅ | ★★ | 信息不全时动态生成含级联逻辑的 HTML 表单让用户一次性补全,汇总 JSON 交回 Agent |
| erp-agent | ✅ | ★★ | 中文自然语言转 SQL 由数据库执行,artifact 模式让 LLM 只生成 SQL 制品不搬运数据,省 token 又防错 |
| conversational-ui | ✅ | ★★ | 自然语言提 UI 定制需求(颜色/字体/文案/布局),Agent 改 React 源码借 Vite HMR 即时生效 |
| 标记 | 含义 |
|---|---|
| ✅ | 可独立运行:自带完整代码,配好 API Key 即可跑 |
| 📖 | 复现指南:依赖需自行 git clone 的外部仓库 |
| 🚧 | 设计文档:仅含架构方案,可运行代码仍在完善 |
| ★ ~ ★★★ | 从易到难,★ 为入门级、★★★ 为进阶挑战 |
← 返回总目录 · 📖 读本章正文 · 📑 本章索引