自主研究 Agent:AI 科学家级流水线 本节摘要:Sakana 的 AI-Scientist-v2 发表了完整论文,Agent Laboratory 跑通了实验,Allen AI 公开了追踪。2026 年的形态已经清晰:在实验树上做「计划-执行-验证」的树搜索,带预算上限的成本、沙箱化的代码执行、视觉反馈的 LaTeX 写作器、自动化的 NeurIPS 式评审团。本节要求你构建一个,在单篇论文 30 美元预算内端到端跑通,并扛住 Sakana 记录过的沙箱逃逸红队。你会学到为什么价值不在「一次就发现新东西」,而在树搜索、实验沙箱、写作-评审循环与红队报告这套基础设施。 对应原课程:Phase 19 · Lesson 05 · (原英文 )。
本节摘要:Sakana 的 AI-Scientist-v2 发表了完整论文,Agent Laboratory 跑通了实验,Allen AI 公开了追踪。2026 年的形态已经清晰:在实验树上做「计划-执行-验证」的树搜索,带预算上限的成本、沙箱化的代码执行、视觉反馈的 LaTeX 写作器、自动化的 NeurIPS 式评审团。本节要求你构建一个,在单篇论文 30 美元预算内端到端跑通,并扛住 Sakana 记录过的沙箱逃逸红队。你会学到为什么价值不在「一次就发现新东西」,而在树搜索、实验沙箱、写作-评审循环与红队报告这套基础设施。
对应原课程:Phase 19 · Lesson 05 ·
autonomous-research-agent(原英文phases/19-capstone-projects/05-autonomous-research-agent/docs/en.md)。
阅读完本节,你应当能够:
自主研究 Agent 在 2026 年越过了一道门槛。Sakana AI 的 AI-Scientist-v2 在 Nature 上发表了通过工坊同行评审的生成论文;ShinkaEvolve(ICLR 2026)把这条线延伸到演化假设;AMD 的 Agent Laboratory 提供了可复现追踪。这些 Agent 不是魔法——它们是在实验候选树上跑的「计划-执行-验证」循环,带成本上限、种子绑定的沙箱、自动化评审。功夫在循环里、预算里、安全故事里。
你要学的,是针对一个狭窄领域的种子想法(比如在 100M 参数 Transformer 上做注意力稀疏消融)实现这个循环。价值不在于一次就发现新东西,而在于基础设施:树搜索、实验沙箱、写作-评审循环、红队报告。Sakana 团队记录了沙箱逃逸失败;你的 Agent 必须扛过同一支红队。
Agent 是最佳优先树搜索。节点是实验规格:(假设, 配置, 代码, 预期结果)。扩展步提议带小改的子节点(换优化器、调 batch、消融某组件)。每个子节点在带硬资源上限的新沙箱里跑。结果回喂给一个评分函数,按 (新颖性 × 质量 × 剩余预算) 给节点排名。树长到预算耗尽,再把最佳分支写成论文。
节点评分(三维加权):
def score(node): novelty = 1.0 - proximity_to Literature(node, cache_50_papers) quality = metric_quality(node.results) # loss/acc 综合归一化 budget = node.budget_remaining / node.budget_total return novelty * quality * budget # 越大越优先扩展
写作器是多模态的。它生成 LaTeX 草稿,编译,渲染图,再把渲染好的 PDF 回喂给 Claude Opus 4.7 的视觉模式,评审版面、图的可读性、论断与证据的对齐。五评委评审团(Opus 4.7、GPT-5.4、Gemini 3 Pro、DeepSeek R1、Qwen3-Max)按 NeurIPS 式量规打分(新颖性、严谨性、清晰度、可复现性、影响力);均值低于阈值就带着批评回写作器。
沙箱是无网络的硬隔离:
docker run --network=none --memory=8g --cpus=2 \ --pids-limit=256 --read-only \ -v seeds:/in:ro -v out:/out \ exp-image run --seed 42
安全是承重的。每个实验跑在无网络外泄、有限墙钟、固定资源上限的 E2B 或 Daytona 沙箱里。Agent 的代码生成步过一层策略层,挡掉逃逸沙箱的 syscall。红队报告复现 Sakana 记录的攻击面(fork 炸弹、文件系统逃逸、LLM 写的网络调用)。
outputs/skill-ai-scientist.md 是交付物。给定种子想法 + 领域 + 30 美元预算,它跑完整流水线,产出可评审论文 + 可复现包。评分量表:
| 权重 | 标准 | 度量方式 |
|---|---|---|
| 25 | 论文质量 | 盲审量规,对照已发表的工坊论文 |
| 20 | 实验严谨性 | 基线、种子、消融;每条论断都有结果表里的单元格支撑 |
| 20 | 成本与算力纪律 | 30 美元/篇上限,Langfuse 追踪 |
| 20 | 安全 | 沙箱红队通过;网络策略与 kill-switch 验证 |
| 15 | 可复现性 | 同种子一条命令重跑复现论文 |
| 100 |
一次典型运行:
$ ai-scientist run --seed "attention sparsity in sub-1B transformers" --budget 30 [lit] 50 papers, digest in 12s [tree] expanded 8 nodes, budget 12/30 [exec] node #3 sparsity=top-8, loss=2.83 (best so far) [exec] node #6 sparsity=top-4, loss=3.12 (worse) [tree] chose branch rooted at node #3 (novelty 0.62, quality 0.81) [write] LaTeX draft v1 complete [vision] critique: figure 2 legend too small, claim-evidence ok [review] mean 4.2/5 (novelty 3.9, rigor 4.3, clarity 4.1, repro 4.5, impact 4.2) [done] paper.pdf + review.md + trace.json $28.40 spent
Sakana AI-Scientist-v2 是参考实现,工程最完整但耦合度高;Agent Laboratory(AMD)是多角色框架,可定制性强;ShinkaEvolve 强调演化假设,适合长周期探索。本节建议用 LangGraph 自建循环,把树搜索、沙箱、写作、评审解耦——这样每个组件都能单独换模型或换策略。评审团侧,五评委聚合比单评委能显著降「假通过」率,但成本更高;练习会让你量化这个权衡。
curl 外部地址的代码,确认 --network=none 挡住它,记录尝试。下一节,我们把这个思路搬到 DevOps——构建一个为 Kubernetes 排障、人在环里审批修复的 SRE Agent。