第 3 章 · 01 另类数据概览 本节摘要:本节是「另类数据获取」的开篇,讲清「另类数据(Alternative Data)」到底是什么。在量化语境里,它指市场与基本面之外、能提供信息优势的一切数据——卫星图、信用卡消费、社交情感、财报电话会议文本、网页爬虫数据等。本节讲三件事:另类数据的三类来源(个人/流程/传感器)、它为什么值钱(早期信息优势)、以及它为什么难用(成本高、合规复杂、噪声大、样本短)。读完本节,你能用一套评估框架判断「这个另类数据集值不值得用」,而不会被供应商的话术带跑。 内容来源:原项目 、根 第 3 章描述,汉化并套用体系化模板。 ⚠️ 风险提示:另类数据噪声大、覆盖期短、合规边界模糊,使用时务必警惕过拟合、数据窥探与隐私合规;本节内容仅供学习研究。
本节摘要:本节是「另类数据获取」的开篇,讲清「另类数据(Alternative Data)」到底是什么。在量化语境里,它指市场与基本面之外、能提供信息优势的一切数据——卫星图、信用卡消费、社交情感、财报电话会议文本、网页爬虫数据等。本节讲三件事:另类数据的三类来源(个人/流程/传感器)、它为什么值钱(早期信息优势)、以及它为什么难用(成本高、合规复杂、噪声大、样本短)。读完本节,你能用一套评估框架判断「这个另类数据集值不值得用」,而不会被供应商的话术带跑。
内容来源:原项目
03_alternative_data/README.md、根README.md第 3 章描述,汉化并套用体系化模板。
⚠️ 风险提示:另类数据噪声大、覆盖期短、合规边界模糊,使用时务必警惕过拟合、数据窥探与隐私合规;本节内容仅供学习研究。
阅读完本节,你应当能够:
传统量化依赖市场数据(价格、成交量)和基本面数据(财报、宏观)。但这两类的边际信息越来越稀薄——大家都用一样的数据,优势就被抹平。另类数据是「信息优势的新前沿」。
原书第 3 章开篇就给了一组关键数字:投资业 2018 年在数据服务上的支出约 20~30 亿美元,且年增长率达两位数。JPM 在 2017 年著名的 Big Data and AI Strategies 报告(Kolanovic & Krishnamachari)更是把另类数据列为对冲基金未来 alpha 的主要来源。
典型应用场景:
| 场景 | 数据 | 用途 |
|---|---|---|
| 通胀实时监测 | 网上商品价格 | 提前于官方 CPI |
| 公司销售预估 | 信用卡消费、门店客流 | 提前于季报 |
| 农业产量 | 卫星图、气象 | 提前于农业部报告 |
| 油田活动 | 卫星图、油罐阴影 | 推断原油库存 |
| 情感与主题 | 社交媒体、新闻文本 | 捕捉市场情绪 |
原书把另类数据的产生主体归为三类,这是评估数据质量的第一个维度——数据是怎么产生的,决定了它的可信度和稳定性。
| 来源 | 优势 | 风险 |
|---|---|---|
| 个体(社交媒体、搜索) | 高频、反映情绪 | 噪声极大、易被水军操纵 |
| 流程(信用卡、供应链) | 与销售强相关 | 覆盖样本有偏、合规复杂 |
| 传感器(卫星、IoT) | 客观、不可操纵 | 解读难、受天气/季节干扰 |
💡 核心心法:数据来源决定可信度。传感器 > 业务流程 > 个体——客观物理信号最难造假,业务流程有审计可追溯,个体情绪最易被操纵。选数据时先看来源类型。
面对一个供应商的推销,用这四个维度拷问:
| 维度 | 关键问题 | 评分信号 |
|---|---|---|
| 信号质量 | 这数据对未来收益有多大预测力? | IC、回测 alpha |
| 覆盖度 | 覆盖多少标的、多长时间、是否 point-in-time? | 标的数、历史长度、可投资性 |
| 成本 | 数据费 + 处理费 + 合规费 | 年费、独家性 |
| 合规 | 隐私、内幕信息、版权? | 个人信息脱敏、NDCA、版权链 |
⚠️ 警告:另类数据最隐蔽的坑是生存偏差(survivorship bias)与回填偏差(backfill bias)——供应商常常只给你「现在还存活/还有数据」的标的,或者把新数据回填到历史。这种数据集看似漂亮,回测必然虚高。
| 陷阱 | 表现 | 对策 |
|---|---|---|
| 噪声大 | 单条信号 IC 接近 0 | 多源融合、平滑、聚合 |
| 样本短 | 只有 1~2 年历史 | 难以做稳健回测,降权重 |
| 生存偏差 | 退市/倒闭标的缺失 | 要求 point-in-time 完整 Universe |
| 回填偏差 | 新数据被回填到过去 | 看 metadata,只信新增日期 |
| 合规风险 | 含个人信息/内幕 | 脱敏 + 法务审查 |
| 成本失控 | 年费侵蚀 alpha | 算清 alpha 减成本的净值 |
💡 核心心法:另类数据的 alpha 必须扣掉数据费与处理工时才算数。一个年化 5% 的 alpha,数据费 3% 就只剩 2%,扣完交易成本可能就是负的。
另类数据之所以和 ML 强绑定,是因为它的特征几乎都需要学习而不是人工规则:
所以原书把另类数据放在第 3 章(数据篇),但其真正的价值兑现要在第 14 章之后的 NLP 与深度学习章节。本节是地图,真正的「用」在后面。
下一节,我们看一个实战案例——财报电话会议抓取,从 Seeking Alpha 抓取 Earnings Call 转录文本,为后续 NLP 情感分析准备语料。