- 文集信息
- 目录大纲
- 最新文档
- 知识宇宙
文集详情
文集导读
因果推断教程导读
「Correlation is not causation」——相关不等于因果,这句行话几乎每个做过数据分析的人都背得出来,可一旦落到实际问题,它究竟在阻止我们犯什么错?本教程以概念筑基为主线,从这句话出发,一层一层把因果推断的知识地基打好:先弄清"相关"与"因果"的本质差别,再学因果之梯、结构因果模型与因果图,然后掌握混杂、对撞、中介这三种图结构,接着进入 do 算子、后门准则与各种估计方法,最后抵达工具变量、敏感性分析、因果发现与机器学习的交叉地带。
这本教程解决什么问题
假设你看到数据:喝咖啡的人心血管病发病率更低。要不要据此建议全民喝咖啡?大多数统计课到这里会说"相关不等于因果"就结束了,剩下的问题——那怎样才能从观察数据里得到因果结论——恰恰是因果推断的全部内容。这本教程不满足于提醒你"小心混杂",而是给你一整套可以落地的语言与工具:用潜在结果定义什么是因果效应,用有向无环图把领域知识写成因果假设,用后门准则与 do 演算判断效应能否识别,用匹配、加权、断点回归、工具变量等方法把它估计出来,并用敏感性分析回答"没测到的混杂要强到什么程度才会推翻结论"。
全册知识地图
第 1 章是地基:辛普森悖论会告诉你,为什么"分层看数据"本身就需要因果假设才能解释。第 2 章把因果关系写成图,这是全册最重要的一步——因果图的三个基本结构(链、分叉、对撞)决定了变量之间哪些关联会流动、哪些被阻断。第 3 章回答"效应能不能算",第 4 章回答"效应怎么算得准",两章合起来就是因果推断的识别与估计两大支柱。第 5 章处理现实世界的复杂性:效应因人而异、个体互相影响。第 6 章把方向反过来,从数据反推因果图。第 7、8 章回到应用与工程,把前面的概念接到 DoWhy、EconML 这些可以在生产环境使用的工具上。
适合谁读
你需要基础的概率统计知识:懂期望、条件概率、回归系数的含义即可,不要求测度论。每节都配了具体数字的例子(例如辛普森悖论的完整列联表、倾向得分的匹配参数、工具变量强度 F 统计量的经验阈值),也配了概念性代码片段帮助把公式落到操作层面。读法上建议按章节顺序:因果推断的概念环环相扣,第 2 章的图结构如果跳过,第 3 章的后门准则会变成死记硬背的规则,而它本该是一条几何上显而易见的推论。
各章一句话导读
第 1 章用悖论和反例建立"为什么需要因果"的直觉;第 2 章给出描述因果的数学语言;第 3 章是全册的理论核心,教你判断一个因果问题在给定假设下是否有唯一答案;第 4 章篇幅最大,把随机实验之外的主要估计武器逐个拆解;第 5 章面向进阶读者;第 6 章适合需要从数据探索因果结构的场景;第 7 章给出三个领域的完整案例复盘;第 8 章收束到工程实践与工具选型。
学完本教程,你应当能独立完成一条完整链路:把一个业务问题翻译成因果问题,画出因果图,判断可识别性,选择并实现合适的估计方法,最后对结论的稳健性做出定量评估。
目录大纲
最新文档
知识宇宙
正在加载知识图谱...