第 2 章 · 01 研究工作流:从提示到证据


文档摘要

第 2 章 · 01 研究工作流:从提示到证据 本节摘要:第 1 章你认识了 Vibe-Trading 的六层结构,本章要把「一句话提示」真正变成「可复查的证据」。本节先拆解一条标准研究工作流的五步——Plan(规划技能与数据源)→ Ground(运行时拉取真实数据)→ Execute(跑回测/因子分析/导出)→ Validate(挂上指标、基准对比、蒙特卡洛、Bootstrap、Walk-Forward、run card)→ Deliver(返回答案 + 可检查的 artifacts)。重点讲清每一步的输入输出,以及为什么「artifact 痕迹」在金融研究里尤其重要——因为常常需要事后复查「三个月前那个回测到底用了什么参数」。读完本节,你会对研究问题在系统里如何流转有清晰的流程图。

第 2 章 · 01 研究工作流:从提示到证据

本节摘要:第 1 章你认识了 Vibe-Trading 的六层结构,本章要把「一句话提示」真正变成「可复查的证据」。本节先拆解一条标准研究工作流的五步——Plan(规划技能与数据源)→ Ground(运行时拉取真实数据)→ Execute(跑回测/因子分析/导出)→ Validate(挂上指标、基准对比、蒙特卡洛、Bootstrap、Walk-Forward、run card)→ Deliver(返回答案 + 可检查的 artifacts)。重点讲清每一步的输入输出,以及为什么「artifact 痕迹」在金融研究里尤其重要——因为常常需要事后复查「三个月前那个回测到底用了什么参数」。读完本节,你会对研究问题在系统里如何流转有清晰的流程图。

内容来源:英文文档 core-concepts/research-workflow 汉化,补充原项目中文入门教程第 4 章的研究流程视角。

学习目标

阅读完本节,你应当能够:

  1. 复述研究工作流的五步(Plan → Ground → Execute → Validate → Deliver),并说明每步的输入与产出。
  2. 解释为什么 Ground 阶段要在运行时拉取数据,而不是预先固化。
  3. 说清 Validate 阶段挂载的验证工具有哪些(基准对比、蒙特卡洛、Bootstrap、Walk-Forward、run card),以及它们的定位是「证据助手」而非「保证」。
  4. 理解 artifact(产物)痕迹为什么对金融研究至关重要(可复查、可复现、可追责)。
  5. 把五步工作流对应到第 1 章的六层结构,看清两者是「流程视角」与「结构视角」的关系。

一、为什么要把研究流程「拆成五步」

金融研究最怕的不是「算错」,而是「算完就忘」——三个月后你想复盘「当时那个回测到底用了哪段时间、什么参数、哪个数据源」,如果没有留痕,就无从下手。Vibe-Trading 把一次研究运行拆成五个有明确边界的阶段,正是为了让每一步都看得见、留得下、查得到

这五步不是凭空设计的,而是对应了一个研究问题从「想法」到「证据」的自然演化:

💡 五步与六层的关系:第 1 章的六层结构(loader/alpha/backtest/connector/tools/shadow)是结构视角——按代码模块分;本节的五步是流程视角——按时间顺序分。两者是正交的:一次研究的每一步,可能调用多个层的代码。

二、Plan:规划阶段

  • 输入:你的一句话提示。
  • 产出:一个执行计划——选哪些技能(skills)、工具(tools)、数据源(data sources)、是否启用 swarm 团队预设。
  • 对应层:工具层(MCP tools)协助 agent 做决策。

Plan 阶段是 agent 的「思考」环节。当你输入「回测一个 SP500 的动量策略」,agent 不会立刻去拉数据,而是先规划:这个任务需要动量因子、需要 SP500 成分股数据、需要 global_equity 引擎、需要 benchmark 对比……规划完成,才知道后续要调哪些工具。

你: Backtest a momentum strategy on SP500 from 2020 to 2025 │ ▼ Plan 阶段(agent 思考): - 技能:动量因子 - 数据源:SP500 成分股 → yfinance 或 Tushare - 工具:backtest - 引擎:global_equity - 验证:benchmark comparison + drawdown

💡 为什么 Plan 要显式:把规划步骤显式化,意味着你可以检查 agent 的计划是否合理——比如它选的数据源对不对、引擎选对没有、有没有遗漏 benchmark。如果计划错了,后面跑得再快也是错的。

三、Ground:落地阶段

  • 输入:Plan 阶段的执行计划。
  • 产出:真实数据——市场 K 线、文档内容、URL 抓取结果、券商交易日志、本地文件。
  • 对应层:数据层(loader),必要时券商层(connector)读账户。

Ground 阶段是「把计划落到真实数据上」。它在运行时拉取数据,而不是用预先固化的快照——这一点很重要:

  • 运行时拉取,意味着你能拿到当时最新的数据;
  • 但也意味着两次运行可能拿到略有不同的数据(比如数据源更新了复权方式)。

为了对抗「两次运行数据不一致」的问题,Vibe-Trading 会把每次 Ground 拉到的数据沉淀到 run dir 里(作为 artifact),这样事后复查时,用的就是当时那份数据,而不是重新拉一份可能已经变化的。

💡 PIT 原则:Ground 阶段拉取数据时要遵守 Point-in-time(点在时间)——只用当时已公开、已可获得的数据,不能偷看未来。这是回测可信度的红线,第 2 章 04 会专门讲。

四、Execute:执行阶段

  • 输入:Ground 阶段拉到的真实数据 + Plan 阶段的执行计划。
  • 产出:计算结果——回测净值曲线、因子 IC/IR、期权检查结果、导出文件、报告草稿。
  • 对应层:回测层(backtest)、因子层(alpha)、复盘层(Shadow Account)。

Execute 阶段是真正「干活」的环节。典型的执行动作包括:

  • 跑回测:调用 backtest 工具,按 config.jsonsignal_engine.py 模拟历史交易。
  • 做因子分析:调用 factor_analysis 工具,计算 IC、IR、t 统计。
  • 期权检查:对期权组合做 Greeks、边界检查。
  • 导出:把结果导出为 CSV、图表、策略代码文件。
  • 报告生成:汇总指标,生成报告草稿。
Ground 产出(真实数据) │ ▼ Execute 阶段(调用工具): - backtest → 净值曲线、回撤、turnover - factor_analysis → IC/IR 序列 - export → 策略代码、CSV - report → 报告草稿

五、Validate:验证阶段

  • 输入:Execute 阶段的计算结果。
  • 产出:附加上去的验证证据——指标、基准对比、蒙特卡洛、Bootstrap 置信区间、Walk-Forward、警告、run card。
  • 对应层:回测层的验证子模块。

Validate 阶段是研究工作流区别于「问答机器人」的关键。它不满足于「算出一个收益数字」,而是要在结果上挂载多角度的证据,让你能判断「这个结果到底有多可信」。

常见的验证工具包括:

  • 指标(metrics):收益、年化、波动、夏普、最大回撤、胜率、盈亏比等。
  • 基准对比(benchmark comparison):和沪深 300、SPY 等参照物比,看是否跑赢。
  • 蒙特卡洛(Monte Carlo):通过随机扰动检验结果的鲁棒性。
  • Bootstrap 置信区间:用重采样给出收益估计的置信区间,而不只是一个点估计。
  • Walk-Forward:把历史切成多段,逐段拟合 + 样本外验证,检验策略是否过拟合。
  • run card:记录这次运行的全部参数、数据、时间、引擎,便于复查。

⚠️ 验证工具是「证据助手」,不是「保证」:蒙特卡洛跑出来稳健,不代表未来一定稳健;Walk-Forward 通过,不代表实盘一定赚钱。所有验证结果都只是降低不确定性,不能消除不确定性。市场风格切换、黑天鹅事件都可能让历史验证失效。本教程所有内容均不构成投资建议。

六、Deliver:交付阶段

  • 输入:Execute 的计算结果 + Validate 的验证证据。
  • 产出:给用户的答案 + 一组可检查的 artifacts(产物)。
  • 对应层:报告层 + run dir 的文件沉淀。

Deliver 阶段不只是「返回一个数字」,而是把答案和全部产物一起交付:

  • 答案:一段自然语言总结(收益多少、回撤多少、是否跑赢 benchmark)。
  • artifacts:报告文件、图表、生成的 signal_engine.py、run metadata、run card。

七、为什么 artifact 痕迹在金融研究里尤其重要

把五步串起来,你会发现 Vibe-Trading 在每一步都强调「沉淀产物」。这不是繁琐,而是金融研究的内在要求:

💡 为什么 artifacts 痕迹重要:金融研究常常需要事后复查——三个月后你想知道「当时那个回测到底用了什么参数、跑了哪段时间、用的哪份数据」,如果没有留痕,就无从复盘。Vibe-Trading 把每个产物都沉淀到 run dir,这正是「研究工作台」区别于「问答机器人」的地方。

一次典型的 run dir 结构长这样:

my_run/ config.json ← Plan + Ground 的配置 code/ signal_engine.py ← Execute 的策略代码 data/ bars.parquet ← Ground 拉到的行情(沉淀下来) results/ equity_curve.csv ← Execute 的回测结果 metrics.json ← Validate 的指标 benchmark.csv ← Validate 的基准对比 report.html ← Deliver 的报告 run_card.json ← Deliver 的运行身份证

有了这套留痕,你可以做到三件「问答机器人」做不到的事:

  1. 复查:随时回看当时用了什么。
  2. 复现:用同样的数据 + 代码重跑,验证结果一致。
  3. 追责:出了问题能定位是数据、代码还是参数的错。

八、五步工作流对应到一次真实运行

把五步套到一条真实命令上:

vibe-trading run -p "Backtest an equal-weight SPY and BTC-USDT momentum rotation strategy for 2024 with benchmark comparison"
Plan → agent 规划:需要 SPY + BTC-USDT 行情、动量信号、composite 引擎、benchmark Ground → loader 拉 SPY(全球股票)+ BTC-USDT(加密)的 2024 年行情,沉淀到 run dir Execute→ Signal Engine 生成动量轮动信号,composite 引擎跑模拟,产出净值曲线 Validate→ 挂上 benchmark 对比、回撤、turnover、夏普、run card Deliver → 返回收益总结 + 报告 HTML + run card + 可复查 artifacts

💡 对照六层结构:这次运行调用了数据层(loader 拉 SPY 和 BTC-USDT)、回测层(composite 引擎)、工具层(backtest 工具被 agent 调用),还可能涉及券商层(如果读真实账户做对比)。五步流程把六层结构按时间串起来跑了。

本节要点回顾

  1. 五步工作流:Plan(规划)→ Ground(落地数据)→ Execute(执行)→ Validate(验证)→ Deliver(交付产物)。
  2. Plan 阶段:agent 决定用哪些技能、工具、数据源、引擎,显式化便于检查。
  3. Ground 阶段:运行时拉真实数据,并沉淀到 run dir,保证可复现。
  4. Execute 阶段:跑回测、因子分析、导出、报告生成。
  5. Validate 阶段:挂载指标、基准对比、蒙特卡洛、Bootstrap、Walk-Forward、run card——是「证据助手」不是「保证」。
  6. Deliver 阶段:答案 + artifacts 一起交付,支持事后复查、复现、追责。
  7. artifact 痕迹的核心价值:金融研究需要可复查,Vibe-Trading 把每步产物沉淀,这是「研究工作台」区别于「问答机器人」的根本。
  8. 五步与六层正交:五步是流程视角(按时间),六层是结构视角(按模块),一次研究的每步可能调用多层代码。

⚠️ 本节所有研究流程描述均不构成投资建议。验证工具只能降低不确定性,不能消除,实盘前必须经过你自己的判断和模拟盘验证。

下一节,我们将深入策略与 Signal Engine,讲清研究想法如何变成可执行规则——config.jsonsignal_engine.py 的分工,以及新手最常犯的错:把「因子分数高」直接等同于「马上满仓买入」。


发布者: 作者: HKUDS 转发
评论区 (0)
U