第 6 章 · 04 BERT 与文本情感因子 本节摘要:本节讲 BERT 与文本情感因子,这是 AI 选股里与 GAN 路线平行的另一条前沿。BERT(Bidirectional Encoder Representations from Transformers)基于 Transformer 的编码器,通过预训练-微调范式在海量文本上学习通用语言表示,再针对具体任务(如情感分类)小数据微调,效果远超传统 NLP 方法。华泰 AI 系列第 37 篇把 BERT 用于舆情因子(新闻情感),第 41 篇进一步用于分析师研报情感因子,把「文本」转化为可量化的情感分数,作为选股因子。
本节摘要:本节讲 BERT 与文本情感因子,这是 AI 选股里与 GAN 路线平行的另一条前沿。BERT(Bidirectional Encoder Representations from Transformers)基于 Transformer 的编码器,通过预训练-微调范式在海量文本上学习通用语言表示,再针对具体任务(如情感分类)小数据微调,效果远超传统 NLP 方法。华泰 AI 系列第 37 篇把 BERT 用于舆情因子(新闻情感),第 41 篇进一步用于分析师研报情感因子,把「文本」转化为可量化的情感分数,作为选股因子。核心流程:收集文本(新闻/研报)→ BERT 编码 → 情感分类(正面/负面/中性)→ 聚合成股票级情感因子 → 纳入多因子模型。但文本因子有个致命陷阱——滞后性:文本发布时,信息往往已被股价反映,情感因子可能只是「事后描述」而非「事前预测」。本节讲清 BERT 原理、文本情感因子构建、滞后性陷阱与适用边界。
内容来源:仓库研报 华泰 AI 系列第 37 篇(舆情因子和 BERT)、第 41 篇(分析师研报情感因子),知识结构化整理。
⚠️ 学习提示:文本情感因子看似直观(好消息涨、坏消息跌),但金融文本的有效信息常在发布前就被消化。情感因子的「预测力」很多来自对已发生行情的事后描述,而非真正的领先信号。务必严格做领先-滞后检验,警惕「情感因子其实只是反转因子的伪装」。
阅读完本节,你应当能够:
传统因子多基于财务(低频)和量价(中频),但市场上大量信息以文本形式存在:
这些文本蕴含前瞻信息(如分析师上调评级往往领先于股价),但传统因子无法直接利用。NLP(自然语言处理)技术的进步,尤其是 BERT 这类预训练模型,让从文本中提取可量化信号成为可能。华泰 AI 37/41 正是把 BERT 用于舆情与研报情感,开辟了「文本因子」这条路线。
BERT 的核心是 Transformer 的编码器(Encoder),其关键创新是自注意力机制(Self-Attention)。
传统 RNN/LSTM 处理文本是逐词顺序读,难以捕捉长距离依赖(第 02 节讲过)。Transformer 用自注意力机制并行处理整个序列,且让序列中任意两个词直接「相互关注」:
直觉:自注意力让模型像人读句子一样,理解每个词在上下文中的含义。比如「苹果」在「苹果发布了新手机」和「我吃了一个苹果」里含义不同,自注意力能根据上下文区分。Transformer 编码器堆叠多层自注意力,逐层抽象出更深层的语义。
BERT 由多层 Transformer 编码器堆叠而成(BERT-base 12 层,BERT-large 24 层),输入一段文本,输出每个词(及整段文本)的向量表示。
BERT 的另一大创新是预训练-微调(Pre-training + Fine-tuning)范式,这是它在小数据任务上效果突出的关键。
在大规模无标注文本(如维基百科、图书)上,用两个自监督任务训练 BERT:
预训练后,BERT 学到了通用的语言表示——每个词的向量蕴含丰富的语义信息。这一步耗费大量算力,但只需做一次,训练好的模型可以公开共享。
把预训练的 BERT 拿来,加一个轻量的输出层,在具体任务(如情感分类)的小标注数据上继续训练(微调)。由于 BERT 已经懂语言,微调只需少量数据与几轮迭代就能达到很好的效果。
| 步骤 | 数据 | 目标 | 算力 |
|---|---|---|---|
| 预训练 | 海量无标注文本 | 学通用语言表示 | 极大,做一次 |
| 微调 | 少量标注数据 | 针对具体任务优化 | 小,可多次 |
💡 范式价值:预训练-微调让 NLP 从「每个任务从头训练」变成「站在通用模型的肩膀上微调」,大幅降低了标注数据需求。在金融这种标注数据稀缺的领域尤其宝贵——华泰 37/41 正是利用预训练 BERT,在相对小的金融文本标注集上微调出高质量情感分类器。
华泰 AI 37/41 构建文本情感因子的流程:
关键步骤:
两类文本因子特点不同:
| 维度 | 新闻情感(华泰 AI 37) | 分析师研报情感(华泰 AI 41) |
|---|---|---|
| 信息质量 | 参差不齐,噪声多 | 专业、深度,信息密度高 |
| 时效性 | 快(实时发布) | 慢(研报撰写周期) |
| 覆盖范围 | 广(覆盖大量公司) | 窄(主要覆盖有研究员跟踪的公司) |
| 信息含量 | 多为已知信息的转述 | 含前瞻预测与评级调整 |
| 预测力来源 | 舆情热度、注意力效应 | 盈利预期调整、评级变化 |
💡 实战心法:分析师研报情感因子的核心价值在于预期的变化(评级上调/下调、盈利预测调整),而非情感本身——预期的「边际变化」往往领先于股价,是更可靠的信号。华泰 AI 41 重点挖掘这类「变化型」因子。新闻情感则更多反映市场情绪与注意力,适合做短期情绪因子。
文本因子最大的陷阱是滞后性:文本发布时,信息往往已被股价反映,情感因子可能只是「事后描述」而非「事前预测」。
几种典型情况:
构建文本因子时,务必做领先-滞后检验(lead-lag analysis):
⚠️ 学习提示:滞后性是文本因子的头号杀手。很多看似漂亮的情感因子回测,在严格做领先-滞后检验后会发现「预测力」消失——它们只是在描述已发生的行情。华泰 AI 41 强调用「分析师预期的变化」而非「情感水平」,部分原因就是规避滞后性:变化的拐点往往领先于股价,水平则常常滞后。
BERT 文本因子虽有潜力,但适用边界要清楚:
文本因子不是替代,而是补充。它与基本面、量价因子互补:
多因子模型把三者结合,能捕捉不同维度的信号。华泰 AI 37/41 的实证表明,文本因子在加入多因子模型后,能提供边际的预测力提升(尤其对有研究员跟踪的股票),但提升幅度依赖文本质量与滞后性控制。
本章结束。下一章我们进入第 7 章 高频与量价因子——从更细颗粒的 Level2/分钟数据中提炼主力行为与微观结构信息,先看「高频因子的构建方法」。