自主研究 Agent:AI 科学家级流水线


文档摘要

自主研究 Agent:AI 科学家级流水线 本节摘要:Sakana 的 AI-Scientist-v2 发表了完整论文,Agent Laboratory 跑通了实验,Allen AI 公开了追踪。2026 年的形态已经清晰:在实验树上做「计划-执行-验证」的树搜索,带预算上限的成本、沙箱化的代码执行、视觉反馈的 LaTeX 写作器、自动化的 NeurIPS 式评审团。本节要求你构建一个,在单篇论文 30 美元预算内端到端跑通,并扛住 Sakana 记录过的沙箱逃逸红队。你会学到为什么价值不在「一次就发现新东西」,而在树搜索、实验沙箱、写作-评审循环与红队报告这套基础设施。 对应原课程:Phase 19 · Lesson 05 · (原英文 )。

自主研究 Agent:AI 科学家级流水线

本节摘要:Sakana 的 AI-Scientist-v2 发表了完整论文,Agent Laboratory 跑通了实验,Allen AI 公开了追踪。2026 年的形态已经清晰:在实验树上做「计划-执行-验证」的树搜索,带预算上限的成本、沙箱化的代码执行、视觉反馈的 LaTeX 写作器、自动化的 NeurIPS 式评审团。本节要求你构建一个,在单篇论文 30 美元预算内端到端跑通,并扛住 Sakana 记录过的沙箱逃逸红队。你会学到为什么价值不在「一次就发现新东西」,而在树搜索、实验沙箱、写作-评审循环与红队报告这套基础设施。

对应原课程:Phase 19 · Lesson 05 · autonomous-research-agent(原英文 phases/19-capstone-projects/05-autonomous-research-agent/docs/en.md)。

学习目标

阅读完本节,你应当能够:

  1. 把自主研究 Agent 拆成最佳优先树搜索,节点是实验规格(假设/配置/代码/预期结果)。
  2. 实现扩展(小改提议子节点)、评分(新颖性 × 质量 × 剩余预算)、执行(沙箱跑实验)三步。
  3. 用视觉反馈的 LaTeX 写作器:渲染 PDF,回喂 VLM 评版面与「论断-证据」对齐。
  4. 组建五评委 LLM 评审团,按 NeurIPS 量规打分,均值低于阈值则回炉重写。
  5. 用无网络、限资源、定种子的沙箱隔离每个实验,扛住 fork 炸弹、文件系统逃逸、网络外泄红队。
  6. 实现单篇论文 30 美元硬预算,并交付可复现包(种子、追踪、配置、README)。

一、问题与直觉

自主研究 Agent 在 2026 年越过了一道门槛。Sakana AI 的 AI-Scientist-v2 在 Nature 上发表了通过工坊同行评审的生成论文;ShinkaEvolve(ICLR 2026)把这条线延伸到演化假设;AMD 的 Agent Laboratory 提供了可复现追踪。这些 Agent 不是魔法——它们是在实验候选树上跑的「计划-执行-验证」循环,带成本上限、种子绑定的沙箱、自动化评审。功夫在循环里、预算里、安全故事里。

你要学的,是针对一个狭窄领域的种子想法(比如在 100M 参数 Transformer 上做注意力稀疏消融)实现这个循环。价值不在于一次就发现新东西,而在于基础设施:树搜索、实验沙箱、写作-评审循环、红队报告。Sakana 团队记录了沙箱逃逸失败;你的 Agent 必须扛过同一支红队。

二、从零实现

Agent 是最佳优先树搜索。节点是实验规格:(假设, 配置, 代码, 预期结果)。扩展步提议带小改的子节点(换优化器、调 batch、消融某组件)。每个子节点在带硬资源上限的新沙箱里跑。结果回喂给一个评分函数,按 (新颖性 × 质量 × 剩余预算) 给节点排名。树长到预算耗尽,再把最佳分支写成论文。

节点评分(三维加权):

def score(node): novelty = 1.0 - proximity_to Literature(node, cache_50_papers) quality = metric_quality(node.results) # loss/acc 综合归一化 budget = node.budget_remaining / node.budget_total return novelty * quality * budget # 越大越优先扩展

写作器是多模态的。它生成 LaTeX 草稿,编译,渲染图,再把渲染好的 PDF 回喂给 Claude Opus 4.7 的视觉模式,评审版面、图的可读性、论断与证据的对齐。五评委评审团(Opus 4.7、GPT-5.4、Gemini 3 Pro、DeepSeek R1、Qwen3-Max)按 NeurIPS 式量规打分(新颖性、严谨性、清晰度、可复现性、影响力);均值低于阈值就带着批评回写作器。

沙箱是无网络的硬隔离:

docker run --network=none --memory=8g --cpus=2 \ --pids-limit=256 --read-only \ -v seeds:/in:ro -v out:/out \ exp-image run --seed 42

安全是承重的。每个实验跑在无网络外泄、有限墙钟、固定资源上限的 E2B 或 Daytona 沙箱里。Agent 的代码生成步过一层策略层,挡掉逃逸沙箱的 syscall。红队报告复现 Sakana 记录的攻击面(fork 炸弹、文件系统逃逸、LLM 写的网络调用)。

三、架构与技术栈

  • 编排:LangGraph,带检查点与人工审批门。
  • 树搜索:自定义最佳优先(Sakana v2 的 AB-MCTS 风格)。
  • 沙箱:每实验一个 E2B,Docker-in-Docker 兜底;cgroups 限资源。
  • 文献:Semantic Scholar Graph API + OpenAlex + 本地 FAISS 摘要缓存。
  • 写作:LaTeX 模板 + Claude Opus 4.7(视觉模式)评图与版面。
  • 评审:五评委(Opus 4.7/GPT-5.4/Gemini 3 Pro/DeepSeek R1/Qwen3-Max)加权聚合。
  • 实验框架:PyTorch 2.5 跑物理实验,W&B 记日志。
  • 可观测性:Langfuse 记 Agent 追踪,单篇论文 30 美元硬预算。

四、可复用产物

outputs/skill-ai-scientist.md 是交付物。给定种子想法 + 领域 + 30 美元预算,它跑完整流水线,产出可评审论文 + 可复现包。评分量表:

权重 标准 度量方式
25 论文质量 盲审量规,对照已发表的工坊论文
20 实验严谨性 基线、种子、消融;每条论断都有结果表里的单元格支撑
20 成本与算力纪律 30 美元/篇上限,Langfuse 追踪
20 安全 沙箱红队通过;网络策略与 kill-switch 验证
15 可复现性 同种子一条命令重跑复现论文
100

一次典型运行:

$ ai-scientist run --seed "attention sparsity in sub-1B transformers" --budget 30 [lit] 50 papers, digest in 12s [tree] expanded 8 nodes, budget 12/30 [exec] node #3 sparsity=top-8, loss=2.83 (best so far) [exec] node #6 sparsity=top-4, loss=3.12 (worse) [tree] chose branch rooted at node #3 (novelty 0.62, quality 0.81) [write] LaTeX draft v1 complete [vision] critique: figure 2 legend too small, claim-evidence ok [review] mean 4.2/5 (novelty 3.9, rigor 4.3, clarity 4.1, repro 4.5, impact 4.2) [done] paper.pdf + review.md + trace.json $28.40 spent

五、框架对比

Sakana AI-Scientist-v2 是参考实现,工程最完整但耦合度高;Agent Laboratory(AMD)是多角色框架,可定制性强;ShinkaEvolve 强调演化假设,适合长周期探索。本节建议用 LangGraph 自建循环,把树搜索、沙箱、写作、评审解耦——这样每个组件都能单独换模型或换策略。评审团侧,五评委聚合比单评委能显著降「假通过」率,但成本更高;练习会让你量化这个权衡。

六、练习

  1. 多种子对比:在同领域对三个不同种子跑流水线,对比树搜索哪些部分重叠,找出重复浪费的算力。
  2. 人工门控:在预估 > 5 美元的节点执行前加一个人工审批门,度量总成本下降多少。
  3. 单评委:把评审团换成单评委,在已知差论文的留出集上度量假通过率。
  4. 外泄红队:加一个网络外泄红队测试——Agent 写尝试 curl 外部地址的代码,确认 --network=none 挡住它,记录尝试。
  5. 对照随机:把你的树搜索换成等预算的扁平随机基线,报告「新颖性 × 质量」增益。

本节要点回顾

  1. 形态已定:计划-执行-验证树搜索 + 预算沙箱 + 视觉写作 + 评审团。
  2. 价值在基础设施:不在一次发现,而在树搜索、沙箱、写作-评审循环、红队。
  3. 最佳优先:节点 = 实验规格,评分 = 新颖性 × 质量 × 剩余预算。
  4. 视觉写作:渲染 PDF 回喂 VLM,评版面与论断-证据对齐。
  5. 五评委团:NeurIPS 量规,均值低于阈值回炉,3 次重写硬停。
  6. 沙箱承重:无网络、限资源、定种子,扛 fork 炸弹/文件逃逸/网络外泄红队。
  7. 30 美元/篇:硬预算 + 可复现包(种子、追踪、配置、README)。

下一节,我们把这个思路搬到 DevOps——构建一个为 Kubernetes 排障、人在环里审批修复的 SRE Agent。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U