第 1 章 · 02 本仓库资料地图


文档摘要

第 1 章 · 02 本仓库资料地图 本节摘要:本节是你在本仓库的「导航图」。这个仓库是一个 awesome-list 性质的资料汇总,内容按四大类组织:卖方金工研报(华泰 AI 41 篇、华泰多因子 13 篇、海通选股因子 93 篇、另类交易策略 32 篇、广发 125 指标)、学术论文(投资者情绪约 100 篇、行为金融 20 篇)、少量可运行代码(技术指标回测的 main.py/technical.py、4 个 arXiv 爬虫脚本)、以及外部资源链接清单(资料/.md)。本节把这四类资料的分布、主题脉络、阅读优先级讲清楚,让你不会在数百份 PDF 里迷路。读完本节,你拿到一份清晰的「先读什么、后读什么」路线图。 内容来源:本仓库目录结构与 README,知识结构化整理。

第 1 章 · 02 本仓库资料地图

本节摘要:本节是你在本仓库的「导航图」。这个仓库是一个 awesome-list 性质的资料汇总,内容按四大类组织:卖方金工研报(华泰 AI 41 篇、华泰多因子 13 篇、海通选股因子 93 篇、另类交易策略 32 篇、广发 125 指标)、学术论文(投资者情绪约 100 篇、行为金融 20 篇)、少量可运行代码(技术指标回测的 main.py/technical.py、4 个 arXiv 爬虫脚本)、以及外部资源链接清单(资料/*.md)。本节把这四类资料的分布、主题脉络、阅读优先级讲清楚,让你不会在数百份 PDF 里迷路。读完本节,你拿到一份清晰的「先读什么、后读什么」路线图。

内容来源:本仓库目录结构与 README,知识结构化整理。

学习目标

阅读完本节,你应当能够:

  1. 说出本仓库的四大类资料及各自位置。
  2. 记住几个核心研报系列的篇数与主题脉络(华泰 AI 41、华泰多因子 13、海通 93、另类 32)。
  3. 知道仓库里能跑的代码在哪、做什么。
  4. 制定一份阅读优先级路线图。

一、四大类资料鸟瞰

本仓库根目录下的资料分布:

Introduction-to-Quantitative-Finance-main/ ├── README.md # 总入口(导航型) ├── 资料/ # ★ 第一类:资源链接 + 代码 + 卖方研报 │ ├── 卖方金工研报/ # 华泰AI/华泰多因子/海通/另类策略 PDF │ ├── 技术指标回测代码/ # main.py + technical.py + 广发125指标PDF │ ├── 数据源与另类数据.md # 外部链接清单 │ ├── 回测.md # 回测框架链接 │ ├── 因子挖掘.md # 因子挖掘工具链接 │ └── 投资组合优化与风控.md # 组合优化链接 ├── 论文/ # ★ 第二类:学术论文 PDF │ ├── 投资者情绪相关论文/ # 约 100 篇 │ ├── 行为金融学论文/ # 20 篇经典 │ └── AI金融论文整理/ # arXiv 抓取的每日 md ├── scripts/ # ★ 第三类:arXiv 爬虫代码(4 个 .py) └── data/ # arXiv Radar 的数据(papers.json 等)

💡 核心心法:这个仓库的价值不在「能跑」(代码很少),而在「资料成体系」——华泰和海通的研报本身就是按编号序列写的,天然构成教材。本教程的任务就是把这堆 PDF 的知识结构化。

二、第一类:卖方金工研报(核心资产)

这是仓库最有价值的部分,集中在 资料/卖方金工研报/。四个系列都已核实篇数完整:

系列 篇数 位置 主题脉络 对应本教程
华泰人工智能 41(1-41) 华泰人工智能/ 框架→GLM→SVM→随机森林→Boosting→神经网络→AlphaNet→GAN→BERT 第 4/5/6/8 章
华泰多因子 13(1-13) 华泰多因子系列/ 模型体系→各类因子测试→合成→风险模型 第 2/9 章
海通选股因子 93(1-93) 海通报告/ 动量反转→量价→高频因子→因子正交→降维 第 2/7 章
另类交易策略 32(1-32) 另类交易策略系列/ 股指期货的趋势/日内/套利策略 第 11 章

为什么这些研报这么有价值:

  • 体系完整:不是零散论文,而是按编号连载的系统研究,前后呼应。
  • 方法详尽:每个模型/因子都讲清原理、实现、回测、对比。
  • 本土化:针对 A 股市场,比舶来教材更贴近实战。
  • 作者专业:华泰/海通的金工团队是国内顶级的卖方量化研究力量。

⚠️ 学习提示:研报的回测结果普遍偏乐观(卖方有展示亮丽结果的动机)。学方法论,对具体数字保留态度。

三、广发 125 指标(技术指标宝典)

资料/技术指标回测代码/广发金融工程:125 个经典技术指标择时分析.pdf 单独值得一读——它系统测试了 125 个经典技术指标的择时效果,是技术指标章节(第 3 章)的现成素材库。同目录还有 各类技术指标合集.xlsx(指标公式表)和 技术指标编写说明.txt

四、第二类:学术论文

论文/ 下两类:

  • 投资者情绪相关论文(约 100 篇):含 Papers in Teacher's book(30 篇经典)、Top Journals(57 篇,按国内顶刊分类如《经济研究》《管理世界》《金融研究》)、Related、综述类等。是第 10 章的核心素材。
  • 行为金融学论文(20 篇):经典中的经典——Prospect Theory(前景理论)、Does the Stock Market Overreact(市场过度反应)、过度自信系列等。解释「为什么情绪/行为因子有效」。

五、第三类:可运行代码(很少但精)

仓库里真正能跑的代码只有两处:

技术指标回测(资料/技术指标回测代码/)

  • main.py(60 行):遍历 股票数据/ 下所有 CSV,对每只股票算 KDJ 信号,再算未来 1/5/10/20 日涨跌幅,按信号分组统计胜率。本教程第 3 章第 04 节会逐行精读。
  • technical.py(18 行):KDJ 指标计算 + 金叉死叉信号,设计成可替换的钩子。

💡 代码的设计哲学:这份代码刻意把「指标/信号」(technical.py)与「评估」(main.py)分离——你把 KDJ 换成 MACD,只需改 technical.py,评估流程不动。这是很好的教学骨架。

arXiv 爬虫(scripts/)

  • arxiv_crawler.py:抓取 arXiv AI+Finance 论文
  • generate_daily.py:生成每日论文列表
  • generate_topic_index.py:主题分类索引
  • paper_processor.py:用 LLM 做相关性过滤 + 中文摘要

这套脚本驱动了仓库的 arXiv Radar 子站(第 12 章第 04 节详讲),已索引 962 篇论文。

六、外部资源链接(资料/*.md)

这几份 md 是精简的外部链接清单,每个仅 10~40 行:

文件 内容
数据源与另类数据.md 数据源链接(行情/财务/另类)
回测.md 回测框架链接(vectorbt/zipline 等)
因子挖掘.md 因子挖掘工具(含遗传规划/神经网络/LLM)
投资组合优化与风控.md 组合优化/Barra 链接

第 12 章会把它们扩充成体系介绍。

七、阅读优先级路线图

面对这么多资料,建议按这个顺序:

第 1 步(打基础):华泰多因子 1(模型体系初探)→ 海通选股因子 1(动量反转) 第 2 步(学 ML):华泰 AI 1(框架)→ AI 2-7(GLM/SVM/树/Boosting/Python 实战) 第 3 步(学深度学习):华泰 AI 8-9(MLP/RNN)→ AI 32(AlphaNet) 第 4 步(技术指标实战):广发 125 指标 + 跑 main.py 第 5 步(进阶前沿):华泰 AI 31/35/37(GAN/BERT)→ 因子挖掘 21/23 第 6 步(组合与风控):华泰多因子 12(风险模型)→ 投资组合优化资料 第 7 步(情绪与行为):行为金融经典论文 → 投资者情绪论文 → 华泰 AI 37/41 第 8 步(CTA):另类交易策略 1-32 选读 第 9 步(工具):资料/*.md + arXiv Radar

本教程的 12 章正是按这条路线组织的,你可以跟着教程一章章推进。

本节要点回顾

  1. 四大类资料:卖方研报(核心)、学术论文、少量代码、外部链接清单。
  2. 研报系列:华泰 AI 41、华泰多因子 13、海通 93、另类 32——均完整,且成体系,是仓库最大价值。
  3. 可运行代码:main.py+technical.py(KDJ 回测,教学骨架)与 scripts/(arXiv 爬虫,4 个)。
  4. 论文:投资者情绪约 100 篇 + 行为金融 20 篇经典(前景理论、过度反应)。
  5. 阅读优先级:多因子基础→传统 ML→深度学习→技术指标实战→前沿→组合风控→情绪行为→CTA→工具,对应本教程 12 章。

下一节,我们讲清怎么高效读卖方金工研报——它的结构、它的套路、它哪里容易误导你。


发布者: 作者: 灏天文库 转发
评论区 (0)
U