∑

数学知识体系

Observatory Archive of Mathematics
⌕2026/8/31
概念

熵

香农熵 H(X) = -Σp log p 度量不确定性的比特数,联合熵与条件熵满足链式法则 H(X,Y)=H(X)+H(Y|X)。

所属主题:信息论与编码 ↗
阅读路径

参考可汗学院 Get ready 机制:先修概念 → 当前概念 → 进阶概念,✓ 表示已读。

01定义

香农熵 H(X)=−∑plog⁡pH(X)=-\sum p\log p 度量随机变量的平均不确定性:也是无损编码其所需的最短平均码长。熵是信息论的基石——它把「信息」从哲学概念变成可计算、可优化的数学量。
p = 1/2:熵最大 p → 0(确定事件) p → 1 H(p) 二元熵:H(p) = −p log p − (1−p) log(1−p) 链式法则:H(X,Y) = H(X) + H(Y|X) 最不可预测时,每个符号携带最多信息
二元熵曲线:公平硬币的不确定性最大

02核心要点

01

熵作为最短码长

无噪声信源编码定理:平均码长的下界是 HH(比特/符号),霍夫曼/算术编码逼近之——熵既是不可压缩性的度量,也是压缩的极限。

02

联合、条件与互信息

H(X,Y)=H(X)+H(Y∣X)H(X,Y)=H(X)+H(Y|X);互信息 I(X;Y)=H(X)−H(X∣Y)I(X;Y)=H(X)-H(X|Y) 是熵的组合量——信息论的全部基本量都可由熵的加减构成。

03

最大熵原理

给定约束下熵最大的分布最「无偏」:均值约束 → 指数分布,方差约束 → 正态分布——统计力学与机器学习中「最少假设」选择的统一原则。

03关键公式

H(X)=−∑xp(x)log⁡2p(x),I(X;Y)=H(X)−H(X∣Y)H(X)=-\sum_xp(x)\log_2p(x),\quad I(X;Y)=H(X)-H(X\mid Y)

04历史沿革

香农 1948 年《通信的数学理论》引入熵并借用玻尔兹曼的术语与公式;哈特利 1928 年的对数信息量是其先驱;冯·诺依曼建议「叫它熵吧,辩论中你永远占优」。

05应用与延伸

数据压缩的理论极限、决策树的信息增益分裂、物理学的热力学熵联系、NLP 的语言模型困惑度(交叉熵)。

06交互演示

二元熵 H(p):不确定性曲线拖 p:p=1/2 时熵最大(1 bit),两端确定时熵为 0

07相关概念