概率论与数理统计
计算机专业 · 本科阶段随机算法、机器学习与数据挖掘的理论根基。
计算机专业的概率统计是机器学习与随机算法的理论根基:随机变量与分布服务数据建模,条件概率与贝叶斯公式服务推断,统计估计服务参数学习,随机过程初步则通向马尔可夫链蒙特卡洛与强化学习。
§ 01
概率基础与贝叶斯
样本空间、条件概率、全概率公式与贝叶斯公式:。贝叶斯推断是机器学习的基础范式:先验 × 似然 = 后验;朴素贝叶斯分类器、垃圾邮件过滤与医学诊断都由此出发。
§ 02
随机变量与分布
离散分布(伯努利、二项、几何、泊松)与连续分布(均匀、指数、正态),期望、方差、协方差与相关系数。大数定律与中心极限定理:样本均值逼近总体均值、标准化和逼近正态,这是统计学习「训练误差逼近泛化误差」的理论依据。
§ 03
统计推断与学习
最大似然估计(MLE):选择使观测数据出现概率最大的参数,等价于机器学习中最小化交叉熵损失;贝叶斯估计引入先验防止过拟合。置信区间与假设检验服务 A/B 测试与模型评估(显著性检验)。
§ 04
随机过程与随机算法
马尔可夫链(状态转移、平稳分布)通向 PageRank 与 MCMC 采样;泊松过程服务排队系统与网络流量建模。随机算法:随机快速排序期望复杂度 、蒙特卡洛方法求积分、随机化哈希(负载均衡)。
核心公式速查
贝叶斯公式
最大似然
马尔可夫平稳分布
学习建议与易错点
- 贝叶斯公式务必理解「先验更新为后验」的动态含义:新数据到来即更新信念,这就是在线学习。
- 协方差矩阵半正定的证明与「数据白化」处理是 PCA 的前置,建议推导一遍。
- MLE 与最小二乘的联系:正态噪声假设下最大化似然等价于最小化平方误差。
- 随机算法分析常用期望线性性 ,即使 不独立也成立,是利器。