2.3 互信息与相对熵:天平两端的对照读数


2.3 互信息与相对熵:天平两端的对照读数

本节摘要:定义互信息的三种等价形式并解释其对称性;引入相对熵(KL 散度)作为"错误砝码的偏差"量具,演示其非对称与非负;最后导出数据处理不等式,为第 4 章的信道容量定义铺平道路。

「mutual information」:一个名字里带"相互"的量

「mutual information」,中文译作互信息,是信息论里唯一在名字里就声明"双向"的量。它的原始定义是三个熵的加减:接收端的不确定度,减去已知发送端后剩余的不确定度——差值就是观测接收符号能替发送符号消掉的不确定度。沿用上一节的韦恩图语言:互信息就是两个圆的重叠区,称的是"两批货的重量交集"。

这个量有三种等价写法,各有用场。熵差形式便于记忆与韦恩图直观;期望形式(对联合分布取自信息与独立假设下的自信息之差的平均)便于写成代码;KL 形式则揭示本质——互信息等于"真实联合分布"与"假装两变量独立时的乘积分布"之间的相对熵。第三种写法说明:互信息度量的是联合分布对独立假设的偏离程度,相关越强,偏离越大,读数越高。

对称性:互信息不辨因果

把定义里的两个变量对调,读数不变——X 含有关于 Y 的信息,与 Y 含有关于 X 的信息,数量严格相等。这个对称性初看平平无奇,细想相当锋利:它意味着互信息完全无视因果方向。"乌云密布"与"随后降雨"之间的互信息,同"随后降雨"与"乌云密布"之间的互信息是同一个数;至于谁导致谁,这个量一概不知。

在通信场景里这种盲目恰好是美德:信道从发送到接收,物理上单向,但容量定义不需要区分"发送端含有的接收端信息"还是反向表述——对称性免费送了一致性。在特征选择场景里它也好用:特征与标签的互信息高就该入选,不必先问因果。真正的分水岭在因果推断:近年关于"因果出现"的研究干脆用互信息与变量自身熵的比值来刻画"相关强于因果"的涌现现象。工具不辨因果不是缺陷,认清工具的边界才是使用的开始。

相对熵:用错误砝码称重的代价

相对熵(KL 散度)度量两个概率分布的差异:用分布 q 代替真实分布 p 时,平均每个符号多付出的码长。它的定义是两个分布对数比值的期望,数值非负且当且仅当两分布相等时为零——吉布斯不等式的直接推论。但它不对称:用 q 近似 p 的代价,与用 p 近似 q 的代价,一般不同。

# 互信息的三种算法互相验证 + 相对熵的非对称性演示 from math import log2 def ent(ps): return -sum(p * log2(p) for p in ps if p > 0) def kl(p, q): return sum(pi * log2(pi / qi) for pi, qi in zip(p, q) if pi > 0) # 场景一:二进制对称信道(下一章的主角在此预演) # 输入 X 等概,信道以概率 p 翻转比特,求输入输出之间的互信息 H2 = lambda p: ent([p, 1 - p]) for p in [0.02, 0.05, 0.10, 0.20, 0.50]: print(f"翻转概率 p={p:<5} 互信息 I(X;Y) = {1 - H2(p):.4f} 比特") # 输出: # 翻转概率 p=0.02 互信息 I(X;Y) = 0.8586 比特 # 翻转概率 p=0.05 互信息 I(X;Y) = 0.7136 比特 # 翻转概率 p=0.10 互信息 I(X;Y) = 0.5310 比特 # 翻转概率 p=0.20 互信息 I(X;Y) = 0.2781 比特 # 翻转概率 p=0.50 互信息 I(X;Y) = 0.0000 比特 ← 信道报废:观测输出对输入零信息 # 场景二:相对熵的非对称性 p = [0.5, 0.5] # 真实分布:均匀 q = [0.9, 0.1] # 模型分布:倾斜 print(f"KL(p||q) = {kl(p, q):.4f} KL(q||p) = {kl(q, p):.4f}") # 输出: KL(p||q) = 0.7370 KL(q||p) = 0.5310 # 两个方向读数不同:用倾斜模型编码均匀真值,代价更大

两个场景各有一句结论值得写进笔记。场景一里,互信息随翻转概率单调下降,到二分之一处归零——那正是第 1 章仿真里"信道报废"的读数量化版:输出对输入的信息含量精确为零。等概输入下这个读数还是 BSC 的信道容量(第 4 章证明),"容量即互信息的最大值"这个定义在此已经能摸到。场景二里,两个方向的 KL 读数不同——用错砝码称重,代价取决于你拿真值迁就模型还是拿模型迁就真值。这个非对称性后来长出两个重要后代:机器学习里最小化 KL(p||q) 对应平均意义上追平每个真实事件(模式覆盖,缺失即重罚),最小化 KL(q||p) 则对应保守地贴着模型已有质量(模式坍缩的病根之一);另一个后代是变分推断的证据下界,其推导核心就是把一个难算的 KL 拆成可优化的两项。

数据处理不等式:加工只会掉秤

把两个随机变量各自再加工一遍——加密前的混淆、滤波、量化、神经网络的逐层变换——新变量之间的互信息会怎样?数据处理不等式给出判定:若三个变量构成马尔可夫链(X 影响 Y,Y 影响 Z,且给定 Y 时 Z 与 X 独立),则 X 与 Z 的互信息不超过 X 与 Y 的互信息。通俗说法:任何对数据的加工,无论多么聪明,都不会凭空创造信息;最好的加工是无损中转

这条不等式的推论遍布信息处理的每个角落。通信方向:译码器无论多聪明,恢复出的信息不可能超过信道输出本身携带的互信息——改善只能来自信道或编码,不来自译码魔法。机器学习方向:网络逐层变换后,标签与中间表征的互信息逐层不增(在确定性网络里),信息瓶颈理论(第 8 章)正是沿着这条链路把"学习"定义成"压缩输入、保留标签相关"的过程。统计方向:粗糙的量化会永久销毁信息,事后无法弥补——设计特征时"先保真、后压缩"的次序因此有了理论背书。

一个统一的视角:互信息家族的读数表

量具 称什么 关键性质 典型出场
自信息 单事件重量 罕见者重、独立可加 惊讶度、码长分配
信源平均重量 非负、对称、均匀最大 压缩下界、容量组成
联合熵 两变量总重 次可加 码本设计、联合编码
条件熵 已知一侧的剩余 平均不增 逐词分解、译码剩余
互信息 两端重量重叠 对称、非负 信道容量、特征选择
相对熵 错误砝码偏差 非负、不对称 模型评估、变分推断

六件量具至此配齐。它们不是六个孤立的公式,而是同一张韦恩图上的不同区域——边缘、月牙、交集、外溢。后面章节所有大定理(压缩下界、传信上界、保真压缩、容量区域)都是用这张图上的读数拼接出来的。

本节要点回顾

  • 互信息的三种等价形式——熵差、期望、KL——分别服务记忆、编码与本质理解,第三种揭示"相关即对独立的偏离";
  • 互信息天然对称,不辨因果方向:通信里是美德,因果推断里要警惕;
  • 相对熵非负且不对称,量化"用错误砝码称重的代价",两个方向的差异塑造了机器学习中覆盖与坍缩两种行为;
  • 数据处理不等式宣告加工不创造信息,为译码极限、逐层表征压缩、特征保真次序提供统一背书;
  • BSC 的互信息随翻转概率降到零,等概输入时的这个读数就是信道容量的预告。

砝码与量具铸齐,天平两端可以正式对读。第 4 章将给出"容量"的严格定义;在那之前,第 3 章先用这批砝码解决第一线的生产问题——给包裹减重。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U