∑

数学知识体系

Observatory Archive of Mathematics
⌕2026/8/31
概念

互信息

互信息 I(X;Y) 度量一个变量携带的关于另一个变量的信息,相对熵度量两个分布的「距离」,数据处理不等式是信息处理的铁律。

所属主题:信息论与编码 ↗
阅读路径

参考可汗学院 Get ready 机制:先修概念 → 当前概念 → 进阶概念,✓ 表示已读。

01定义

互信息 I(X;Y)I(X;Y) 度量两个变量共享的信息量:已知 YY 后 XX 不确定性减少多少。相对熵(KL 散度)给出分布间的定向「距离」,数据处理不等式断言信息只减不增——一切信号处理都无法凭空创造信息。
H(X|Y) H(Y|X) I(X;Y) H(X) = H(X|Y) + I(X;Y) I(X;Y) = D_KL( P(X,Y) ‖ P(X)P(Y) ) ≥ 0 数据处理不等式:X → Y → Z ⇒ I(X;Z) ≤ I(X;Y) 信息沿处理链只减不增:噪声不可逆
互信息:两个熵圆共享的区域

02核心要点

01

KL 散度

D(P∥Q)=∑plog⁡(p/q)≥0D(P\|Q)=\sum p\log(p/q)\geq 0(Gibbs 不等式),非对称、不满足三角不等式——它是「相对」熵而非真距离;JS 散度与 Wasserstein 距离各有其位。

02

数据处理不等式

X→Y→ZX\to Y\to Z 成马尔可夫链则 I(X;Z)≤I(X;Y)I(X;Z)\leq I(X;Y):任何确定性或随机的后处理不能增加信息——深度学习逐层信息压缩的理论注脚。

03

估计与应用

连续变量的互信息估计是难题(kNN、MINE 神经网络估计);它是特征选择、图像配准、信息瓶颈(压缩表示学习)的核心判据。

03关键公式

I(X;Y)=∑x,yp(x,y)log⁡p(x,y)p(x)p(y)≥0I(X;Y)=\sum_{x,y}p(x,y)\log\frac{p(x,y)}{p(x)p(y)}\geq 0

04历史沿革

香农 1948 年同时定义互信息与相对熵;库尔巴克与莱布勒 1951 年形式化 KL 散度;Tishby 1999 年提出信息瓶颈,使互信息在机器学习中重获中心地位。

05应用与延伸

特征选择与冗余分析、脑科学的功能连接度量、自监督学习的信息最小化目标、信道编码的性能分析。

06交互演示

互信息:两变量的统计耦合强度增大耦合:联合分布越对角化,I(X;Y) 越大

07相关概念