第 10 章 · 03 NLP 情感分析在金融 本节摘要:本节系统讲 NLP 情感分析在金融领域的三代方法,以及如何把文本转化为可交易的「情感因子」。前两节讲了情绪指标(综合指数、媒体情绪),但它们的量化手段还比较粗糙。真正把「文本」变成「精细情感分数」的是 NLP 技术的演进:第一代词典法(预设情感词典数词频,简单但金融语境不准)、第二代机器学习(用标注数据训朴素贝叶斯/SVM/随机森林,需标注但更准)、第三代深度学习(BERT 等预训练语言模型,理解上下文,效果最好,呼应华泰 AI 37/41 与第 6 章第 04 节)。
本节摘要:本节系统讲 NLP 情感分析在金融领域的三代方法,以及如何把文本转化为可交易的「情感因子」。前两节讲了情绪指标(综合指数、媒体情绪),但它们的量化手段还比较粗糙。真正把「文本」变成「精细情感分数」的是 NLP 技术的演进:第一代词典法(预设情感词典数词频,简单但金融语境不准)、第二代机器学习(用标注数据训朴素贝叶斯/SVM/随机森林,需标注但更准)、第三代深度学习(BERT 等预训练语言模型,理解上下文,效果最好,呼应华泰 AI 37/41 与第 6 章第 04 节)。本节按这条演进线讲清三代方法的原理、优劣与适用边界,重点在如何构建文本情感因子(文本→打分→聚合→因子),以及所有文本因子的共同陷阱——滞后性:文本发布时信息往往已被股价反映,情感因子可能只是「事后描述」而非「事前预测」。本节是第 6 章第 04 节 BERT 的扩展,从单点扩展到三代方法体系。
内容来源:仓库研报 华泰 AI 系列第 37 篇(舆情因子和 BERT)、第 41 篇(分析师研报情感因子),配合 NLP 通用方法,知识结构化整理。
⚠️ 学习提示:三代方法不是「越新越好」——词典法虽简单但在某些场景(如快速原型)仍实用;BERT 虽强但需大量算力与数据。选方法要看任务、数据量、算力、可解释性需求的权衡。更重要的是,任何方法都躲不开滞后性陷阱。
阅读完本节,你应当能够:
第 01、02 节的情绪指标都用某种「代理」度量情绪,但金融文本(新闻、研报、社媒)本身蕴含丰富的情感信息——只是这些信息是「非结构化文本」,无法直接做因子。NLP 情感分析的任务就是把文本转化为可量化的情感分数,让文本成为可交易的因子。
金融 NLP 的难点:
NLP 技术的演进,正是在逐步解决这些难点。
词典法是最早也最简单的情感分析方法:用预设的情感词典(正面词表、负面词表),统计文本中正负词的出现频率,作为情感分数。
情感分数 = (正面词数 - 负面词数) / 总词数
经典词典:
词典法的优劣:
| 优势 | 劣势 |
|---|---|
| 简单、快速、无需训练 | 金融语境不准(通用词典尤其差) |
| 可解释(每个词的标签透明) | 不懂否定、转折、上下文 |
| 无需标注数据 | 词表覆盖有限,新词/术语漏 |
💡 何时用词典法:数据量小、需快速原型、可解释性要求高、或做基准对比时。Loughran-McDonald 金融词典是金融领域的首选,远好于通用词典。
机器学习方法用标注数据训练分类器,自动学习文本特征与情感的关系。典型流程:
标注数据(文本+情感标签) → 特征提取(TF-IDF/n-gram) → 训练分类器 → 预测新文本
常用模型:
机器学习法的优劣:
| 优势 | 劣势 |
|---|---|
| 自动学习特征权重,比词典准 | 需标注数据(金融标注成本高) |
| 能处理否定、部分上下文 | 特征工程(TF-IDF/n-gram)需手动设计 |
| 可调参优化 | 仍是「词袋」思路,不懂长程依赖 |
华泰 AI 早期研报用 SVM、随机森林等做文本分类,效果优于词典法,但受限于特征工程与标注数据量。
深度学习方法用神经网络自动学习文本表示,无需手动特征工程。关键节点:
BERT 的核心(详见第 6 章第 04 节):
华泰 AI 37 用 BERT 做新闻舆情情感因子,AI 41 用 BERT 做分析师研报情感因子,效果显著优于词典法与传统机器学习。
| 维度 | 词典法 | 机器学习 | BERT |
|---|---|---|---|
| 准确度 | 低(金融语境差) | 中(受限于特征工程) | 高(理解上下文) |
| 数据需求 | 无需标注 | 需标注 | 少量标注(预训练) |
| 算力需求 | 极低 | 低-中 | 高(GPU) |
| 可解释性 | 高(词标签透明) | 中(特征权重) | 低(黑盒) |
| 开发周期 | 短(几天) | 中(几周) | 长(数据+训练) |
| 适用场景 | 快速原型/基准 | 标注数据充足 | 追求最优效果 |
💡 选方法的心法:不是越新越好。若数据少、需解释、快速验证——词典法(LM 词典)够用;若有标注、求平衡——机器学习;若追求最优、有算力——BERT。华泰 AI 37/41 选 BERT,是因为他们有足够标注数据与算力,且追求工业级最优效果。
不管用哪种方法,构建文本情感因子的流程一致:
关键步骤:
所有文本因子都有个致命陷阱——滞后性:文本发布时,信息往往已被股价反映,情感因子可能只是「事后描述」而非「事前预测」。
典型情况:
华泰 AI 41 强调用「分析师预期的变化」而非「情感水平」,部分原因就是规避滞后性。
华泰 AI 37(舆情因子和 BERT)与 AI 41(分析师研报情感因子)是 A 股文本因子的工业级实践:
实证结论:
情感分析只是金融 NLP 的一个任务,其他常见任务:
这些任务都在把「非结构化文本」变成「结构化信号」,是另类数据(下一章第 12 节)的重要组成。
下一节,我们暂离文本,回到行为金融的经典理论——前景理论、过度反应、过度自信,这些理论解释了「为什么情绪/行为因子有效」。