第 12 章 · 01 数据源与另类数据
本节摘要:本章是全教程的收束章,讲支撑量化研究的「基础设施」——数据、回测与工具生态。本节先讲数据源与另类数据。数据是量化研究的「原材料」,前 11 章所有方法(因子、ML、组合优化、CTA)都建立在数据之上。数据分两大类:传统数据(行情、财务、宏观数据)和另类数据(alternative data,文本、舆情、卫星、信用卡、电商、供应链等非传统来源)。传统数据是基础,获取渠道成熟(聚宽、米筐、Tushare、AKShare、Wind、Bloomberg);另类数据是前沿,蕴含独特信息优势,但获取难、清洗难、成本高。仓库资料/数据源与另类数据.md 给出了主要数据源链接。本节讲清传统数据的分类与获取渠道、另类数据的种类与价值、另类数据的获取难点,以及选择数据源时的考量(覆盖、质量、成本、合规)。
内容来源:仓库 资料/数据源与另类数据.md(数据源链接清单),结合行业常识,知识结构化整理。
⚠️ 学习提示:数据是量化的「地基」,地基不稳地动山摇。再精巧的模型,喂错数据(前视偏差、 Survivorship bias、复权错误)都会得出虚假结论。在使用任何数据源前,务必先做数据质量检验(对账、缺失值、异常值、复权一致性)。
学习目标
阅读完本节,你应当能够:
- 区分传统数据与另类数据两大类。
- 列举 A 股传统数据的主要获取渠道(聚宽、米筐、Tushare、AKShare 等)。
- 说出另类数据的几大种类(文本、卫星、信用卡、电商)。
- 理解另类数据的信息优势与获取难点。
- 列举选择数据源时的考量维度(覆盖、质量、成本、合规)。
一、数据:量化研究的原材料
量化研究 = 数据 + 模型 + 回测 + 工具。在这四要素里,数据是最基础也最关键的一环——没有好数据,模型再精巧也是空中楼阁。
数据按来源与性质分两大类:
前 11 章的方法大多基于传统数据(行情、财务),而另类数据是前沿与差异化 alpha 的来源。
二、传统数据:行情、财务、宏观
行情数据
- 日频/周频/月频 OHLCV:开高低收成交量,最基础数据。
- 分钟/Tick 数据:更高频率,用于高频因子(第 7 章)。
- Level2 数据:逐笔委托与成交,最深颗粒,用于市场微观结构研究。
- 复权处理:前复权/后复权,做因子必须用复权价格(避免除权除息造成的虚假跳动)。
- 指数数据:沪深 300、中证 500 等成分股与权重。
财务数据
- 财务报表:资产负债表、利润表、现金流量表,用于基本面因子(估值、成长、质量,第 2 章)。
- 业绩预告/快报:正式报表前的预告,信息更早。
- 分析师一致预期:EPS/Revenue 预期,用于一致预期因子(第 2 章)。
- 财务 Quality:审计意见、应计项目等。
宏观数据
- 经济指标:GDP、CPI、PPI、PMI、工业增加值。
- 货币指标:M2、利率、汇率。
- 政策数据:央行操作、财政数据。
宏观数据频率低(月度/季度),主要用于宏观择时与行业轮动(第 11 章第 03 节)。
三、传统数据的获取渠道
仓库 资料/数据源与另类数据.md 列出了主要 A 股数据源:
| 数据源 |
类型 |
特点 |
| 聚宽 JQData |
商业+开源 SDK |
数据全,A 股主流,Python SDK 友好 |
| 米筐 Ricequant |
商业 |
数据全,提供 Datahub,研究平台 |
| Tushare |
免费+付费 |
A 股老牌开源,社区活跃,基础数据免费 |
| AKShare |
开源免费 |
全开源,覆盖广(股/期/汇/宏/数字货币) |
| Wind |
商业 |
机构标配,数据权威,价格高 |
| Bloomberg/Refinitiv |
商业 |
全球数据,海外机构标配 |
| SmoothNLP 金融文本 |
开源 |
专注金融文本数据(另类数据) |
选数据源的考量:
- 覆盖度:是否覆盖你需要的标的与字段(如 Level2、分析师预期)。
- 数据质量:准确性、完整性、一致性(同一字段不同源可能不一致)。
- 历史长度:回测需要足够长历史(如 A 股至少 10 年)。
- 成本:免费(Tushare/AKShare 基础)到昂贵(Wind/Bloomberg)。
- 更新频率:日频、分钟还是 Tick。
- API 友好度:Python SDK 是否好用,文档是否清晰。
💡 实战心法:学习/原型阶段用免费源(AKShare/Tushare)够用;做严肃研究或实盘,需商业源(Wind/聚宽)保证质量。多个源交叉对账是发现数据错误的好习惯——同一只股票的复权价,两个源应该一致,不一致就有问题。
四、另类数据:前沿与差异化
另类数据(alternative data)指传统行情/财务/宏观以外的数据来源。它们蕴含独特信息优势——能捕捉传统数据看不到的信号。
文本数据
- 财经新闻:第 10 章详述,媒体情绪、事件抽取。
- 分析师研报:第 10 章,预期变化、深度分析。
- 社交媒体:雪球、股吧、微博,散户情绪金矿(第 10 章第 01 节)。
- 公司公告:临时公告、监管问询函,事件驱动。
- 会议纪要:央行议息、公司电话会。
文本数据是另类数据里最成熟、应用最广的一类,华泰 AI 37/41 已工业化(第 6 章第 04 节、第 10 章第 03 节)。
卫星与遥感数据
- 停车场卫星图:零售商停车场的车流量,预测销售额(经典案例:沃尔玛)。
- 农作物遥感:预测农产品产量,商品期货交易。
- 夜光数据:经济活动强度,宏观预测。
- 油罐阴影:原油库存,能源交易。
卫星数据昂贵、需图像处理能力,但能提供传统渠道没有的「物理世界快照」。
消费与交易数据
- 信用卡交易:实时消费数据,零售商营收预测。
- 电商数据:销量、价格、评价,消费品公司基本面。
- POS 数据:线下零售流水。
其他另类数据
- 供应链数据:上下游订单、库存,预测公司业绩。
- 专利数据:技术创新动向,科技公司估值。
- 招聘数据:岗位需求,公司扩张信号。
- 政府公开数据:海关进出口、税务、社保。
- 网络痕迹:网页流量、App 下载量。
五、另类数据的获取难点
另类数据虽诱人,获取与使用有几个难点:
- 成本高:卫星、信用卡数据动辄年费数十万美元,远超传统数据。
- 清洗难:另类数据格式杂乱(文本、图像、JSON),需大量清洗工程。
- 历史短:很多另类数据(如 App 下载量)历史只有几年,回测样本不足。
- 覆盖不全:往往只覆盖部分公司(如信用卡数据只覆盖某些消费场景)。
- 合规风险:涉及隐私(GDPR、个人信息保护法)、内幕信息边界。
- 信号衰减快:另类数据一旦被广泛使用,alpha 会迅速消失(拥挤)。
⚠️ 学习提示:另类数据不是「银弹」。它的边际价值依赖你的处理能力——同一份卫星图,顶级团队能挖出 alpha,普通团队可能只是成本负担。对小团队,优先把传统数据用透,再考虑另类数据。
六、A 股另类数据的本土实践
A 股的另类数据有几条本土特色:
- 东方财富/同花顺:股吧讨论、关注度、龙虎榜,散户另类数据源。
- 雪球:高质量投资讨论,情绪与观点数据。
- 淘宝/京东电商数据:消费品公司销量预测。
- 天眼查/企查查:工商变更、关联关系,事件驱动。
- 专利数据库:科技创新动向。
A 股的另类数据研究仍在发展,但已有一批机构(尤其量化私募)在文本、电商、供应链数据上做出差异化 alpha。
七、数据质量检验:用数据前的必做步骤
无论传统还是另类数据,使用前必须做质量检验:
- 对账:同一字段多源对比,发现不一致。
- 缺失值:统计缺失比例,理解缺失原因(停牌、未披露、技术故障)。
- 异常值:用统计方法(3σ、分位数)识别,判断是真实还是错误。
- 复权一致性:行情复权是否正确(除权除息、拆股)。
- Survivorship bias:是否包含退市股票(只看现存股票会高估收益)。
- 前视偏差(look-ahead bias):数据的时间戳是否正确(财报数据要用发布日期而非报告期)。
前视偏差是回测最常见的杀手——误用「报告期」而非「发布日期」对齐财务数据,等于用了未来信息。务必严格用发布日期。
八、数据在本教程各章的角色
数据贯穿本教程:
- 第 2 章因子:行情(动量/反转/波动)、财务(估值/成长/质量)。
- 第 3 章技术指标:行情(OHLCV)。
- 第 4~6 章 ML/深度学习:行情+财务做特征,文本(另类)做 BERT 因子。
- 第 7 章高频:Level2/分钟数据。
- 第 9 章组合:行情算协方差,财务算预期收益。
- 第 10 章情绪:文本(新闻/研报/社媒)是核心。
- 第 11 章 CTA:期货行情。
- 本章:数据本身的获取与工具。
理解每章用的是什么数据,有助于你回头搭建自己的数据 pipeline。
本节要点回顾
- 两大类:传统数据(行情/财务/宏观)与另类数据(文本/卫星/消费/供应链等)。
- 传统数据:行情(OHLCV/Level2/复权)、财务(报表/预期)、宏观(GDP/CPI);基础数据,前 11 章主要用这类。
- 获取渠道:聚宽、米筐、Tushare、AKShare(开源为主),Wind/Bloomberg(商业);考量覆盖/质量/历史/成本/频率/API。
- 另类数据:文本(新闻/研报/社媒,最成熟)、卫星(物理世界快照)、消费(信用卡/电商)、供应链/专利/招聘;蕴含独特 alpha。
- 获取难点:成本高、清洗难、历史短、覆盖不全、合规风险、信号衰减快。
- A 股本土:股吧/雪球(散户情绪)、电商、天眼查、专利数据库。
- 质量检验:对账、缺失值、异常值、复权一致性、Survivorship bias、前视偏差(用发布日期);前视偏差是回测头号杀手。
- 贯穿全教程:每章用不同数据,理解数据来源有助搭建 pipeline。
下一节,我们看回测框架的对比——vectorbt、backtesting.py、zipline,以及向量化 vs 事件驱动的根本差异,还有它们各自的坑。