第 2 章 · 02 日内 bar 数据 AlgoSeek


文档摘要

第 2 章 · 02 日内 bar 数据 AlgoSeek 本节摘要:本节承接上一节——ITCH 自己重建 tick 既慢又重,有没有人直接把规整好的分钟 bar 数据卖给你?有,AlgoSeek 就是。原项目 章节专门介绍 AlgoSeek 提供的美股分钟级 bar 数据,它把多个交易所的成交与报价合并、规整,并附带一组反映供需动态的丰富属性(开/高/低/收、成交量、买卖盘统计等),原书后续在第 9 章用它做一个 ML 驱动的日内策略。本节讲清 AlgoSeek 数据的形态、与自建 bar 的取舍、以及它在 ML4T 闭环里的位置。读完本节,你能判断什么场景该用 AlgoSeek 这类现成 bar、什么场景必须自建。

第 2 章 · 02 日内 bar 数据 AlgoSeek

本节摘要:本节承接上一节——ITCH 自己重建 tick 既慢又重,有没有人直接把规整好的分钟 bar 数据卖给你?有,AlgoSeek 就是。原项目 02_market_and_fundamental_data/02_algoseek_intraday/ 章节专门介绍 AlgoSeek 提供的美股分钟级 bar 数据,它把多个交易所的成交与报价合并、规整,并附带一组反映供需动态的丰富属性(开/高/低/收、成交量、买卖盘统计等),原书后续在第 9 章用它做一个 ML 驱动的日内策略。本节讲清 AlgoSeek 数据的形态、与自建 bar 的取舍、以及它在 ML4T 闭环里的位置。读完本节,你能判断什么场景该用 AlgoSeek 这类现成 bar、什么场景必须自建。

内容来源:原项目根 README.md 第 2 章描述、02_market_and_fundamental_data/README.md 关于 AlgoSeek 的说明、02_algoseek_intraday/ 目录,汉化并套用体系化模板。

⚠️ 风险提示:AlgoSeek 为商业数据,本节不涉及数据下载或破解;日内策略对手续费与滑点极敏感,回测结果与实盘差异通常大于日频策略。

学习目标

阅读完本节,你应当能够:

  1. 说清 AlgoSeek 分钟 bar 与自建 ITCH bar 的差异。
  2. 列举 AlgoSeek 数据自带的关键属性(OHLCV + 供需字段)。
  3. 描述日内数据在 ML4T 闭环里的位置。
  4. 判断什么场景买数据、什么场景自建
  5. 知道日内策略与日频策略在成本与容量上的关键差别。

一、为什么需要现成的分钟 bar

上一节我们看到,从 ITCH 重建 tick 然后聚合成 bar,流程长、计算重、容错难(任何字节错位后面全乱)。对于绝大多数研究场景,你并不需要「自己重建」,你需要的是一份可信、连续、字段丰富的现成 bar 数据。AlgoSeek 这类专业供应商就是干这个的。

维度 自建 ITCH bar AlgoSeek 分钟 bar
原始数据 单交易所(NASDAQ)tick 多交易所合并成交与报价
处理负担 12GB/天,数小时 直接拿规整 CSV/HDF5
字段丰富度 只有订单簿字段 OHLCV + 大量供需统计
覆盖范围 NASDAQ 单一场所 美股全市场合并
成本 数据免费、计算贵 数据付费、计算省
典型用途 微观结构研究 日内 ML 策略

💡 核心心法:数据的价值在于「省掉你的工程时间」。当你的目标是建模而不是练解析器时,买现成 bar 几乎总是更划算;只有当现成数据无法提供你需要的细粒度(如订单簿失衡、单笔成交识别)时,才回到 ITCH 自建。

二、AlgoSeek 数据的形态

原书第 2 章把 AlgoSeek 描述为「equity minute bar data that contains consolidated trade and quote information」,并强调它「捕捉了供需动态(captures the demand-supply dynamic)」。这是它区别于普通 OHLCV 的关键。一份典型的 AlgoSeek 分钟 bar 包括:

字段类别 示例字段 含义
基础 OHLCV open / high / low / close / volume 标准开高低收与成交量
价格统计 vwap 成交量加权均价
买卖盘 bid/ask 相关统计 反映流动性深度
成交细项 主动买/主动卖成交量 推断订单方向性
时间戳 date / minute 分钟级精确时间

主动买/主动卖成交量这类字段,本质是把 tick 级的「成交发生在 bid 还是 ask」聚合成分钟级方向性指标。它对预测短期价格漂移很有用,是第 9 章日内 ML 模型的重要特征来源。

三、日内数据在 ML4T 闭环里的位置

回到第 1 章的闭环,日内数据属于「数据采集」环节,但它对下游每一个环节都有特殊要求:

闭环环节 日内数据的特殊要求
特征工程 要处理分钟级波动、日内季节性(开盘/收盘效应)
模型 样本量是日频的 ~390 倍(美股每日 390 分钟),适合深模型
组合 持仓时间短,换手极高
回测 必须扣 bid-ask bounce 与手续费,滑点模型要细
执行 实盘要考虑队列位置、市价单冲击

⚠️ 警告:日内策略的回测最容易被「忽略成本」美化。一根 K 线 0.05% 的毛收益,扣完佣金、SEC Fee、bid-ask spread 后往往就是负的。任何日内回测必须显式建模交易成本。

四、买数据还是自建:一个决策清单

实践建议:

  1. 原型阶段:先用免费日频数据(Quandl/Wiki、yfinance)把流程跑通,验证想法。
  2. 日内原型:确实需要分钟级时,优先用 AlgoSeek 这类现成数据,把精力放在建模。
  3. 微观结构研究:只有当你的 alpha 依赖订单簿失衡、单笔成交识别等「无法从 bar 还原」的信息时,才回到 ITCH 自建。

五、与其他市场数据源的关系

原书第 2 章还列了一组其他数据源,与 AlgoSeek 互补或替代:

数据源 类型 备注
Quandl 日频基本面+价格 已被 NASDAQ 收购,本书主力
yfinance 日频,雅虎财经 免费但不稳定
pandas-datareader 多源封装 入门方便
LOBSTER 学术 ITCH 比 NASDAQ 官方更易用,学术常用
IEX Cloud 美股实时/历史 免费额度有限

💡 核心心法:数据源不是越多越好,而是「够用、可信、可复现」三件事。一个干净连续的 AlgoSeek 分钟库,比五份口径不一的免费数据更有价值。

本节要点回顾

  1. AlgoSeek 的定位:现成的美股分钟 bar,合并多交易所成交与报价,带丰富供需字段。
  2. vs 自建 ITCH:数据付费换工程时间,建模场景优先买,微观结构研究才自建。
  3. 关键字段:除 OHLCV 外,主动买/主动卖成交量、买卖盘统计是日内 ML 的重要特征。
  4. 闭环影响:日内数据对回测成本与执行要求远高于日频,必须显式建模滑点。
  5. 决策清单:原型用免费日频 → 日内用 AlgoSeek → 微观结构才自建 ITCH。
  6. 数据源互补:Quandl/yfinance/LOBSTER/IEX 各有定位,选「够用可信可复现」的组合。

下一节,我们看 SEC 财报 XBRL 解析——从市场侧切到基本面侧,讲清怎么从 SEC EDGAR 的 XBRL 电子财报里提取会计科目,为价值因子准备素材。


发布者: 作者: 灏天文库 转发
评论区 (0)
U