概率与贝叶斯:用数字写「不确定」
WARNING
🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。
模型预测的不是「真理」,而是在数据下更合理的信念。本章只抓四块:随机变量与期望、条件概率、贝叶斯更新、高斯分布——足够读线性回归噪声假设、EM/GMM、PETS 的不确定度、以及世界模型里的先验/后验。常见分布清单见 常见分布;用样本反推参数见 估计;平均为何像高斯见 CLT。领域地图:数学基础。
一、随机变量、期望、方差
- 随机变量
:取值带概率(离散)或密度(连续)。不是「未知常数」——它是一台会吐出不同数字的机器,每次运行的结果按一张固定的表出现。 - 期望
:按概率加权的平均值——「长期玩下去的中心」。 - 方差
:分散程度。标准差是它的平方根,和 同一单位。
离散时把「加权」写开就是求和:
机器学习里的损失,多数是某种期望的样本平均:
大数定律保证:样本够多,平均会靠近真期望——这是「用训练集代理真实风险」的合法借口(还要小心过拟合)。定理表述与直方图见 大数定律与中心极限。
保姆级数字例。 C++ stats.hpp 对集合
| 量 | 算法 | 值 |
|---|---|---|
| 均值 | ||
| 离差平方和 | ||
| MLE / 总体方差 | ||
| 无偏样本方差 |
同一堆数,除以
卡点。 期望不是「最可能出现的值」。公平骰子期望
逐步推导:从「长期平均」到 、 (点击展开)
把
平均就是
方差先算离差平方的平均:
等价地先算二阶矩
这是总体方差(五个点就是整个世界)。若把这五个点看成样本,
训练损失的样本平均,就是把上面的
二、条件概率与独立性
:已知 发生后, 的新概率。分母是「先缩小到 这块」,分子是「 与 重叠的那一块」。 - 独立:
,等价于 ——知道 不改变对 的信念。 - 乘法法则(总是对,不管独不独立):
。链式往下写就是语言模型 。
分类器输出的「类别概率」、语言模型的
保姆级数字例。 公平硬币抛两次。记
无条件下
卡点。
三、贝叶斯:先验 × 似然 → 后验
| 名词 | 含义 |
|---|---|
| 先验 | 看数据前对参数的信念 |
| 似然 | 参数固定时,数据有多「像会被生成」 |
| 后验 | 看完数据后的更新信念 |
| 证据 | 归一化常数,保证后验积分为 1 |

图解说明:先验被似然「拧」成后验。数据越强,后验越尖;先验越强,后验越难被拧走。

图解说明:灰先验、橙似然,乘完再归一化得到蓝后验。数据把信念从「猜」更新成「看过之后的猜」。
demo 用 Beta-Binomial 把这件事做成可画的曲线:先验
保姆级数字例(与 demo.py 同一组)。
| 均值 | |||
|---|---|---|---|
| 先验 | |||
| 后验 |
数据再多,权会压过先验,后验均值贴向
世界模型里的说法几乎一一对应:
- 先验
:不看当前观测的预测; - 后验
:看到 后的修正。
训练时常让先验追后验(KL)——贝叶斯更新的工程版。
卡点。 「似然」不是「
逐步推导:Beta-Binomial 后验为何是 (点击展开)
抛币
先验取
这正是
证据

图解说明:蓝线
对称蹲在 ;橙线 右移且变尖;红虚线是样本频率 。后验均值 ,被先验从 往回拽了一截。
离散版贝叶斯(事件而不是参数)是同一公式。设
分母把「所有能产生
四、高斯:AI 里的默认噪声
一维:
:中心; :胖瘦。demo 画 三条: 翻倍,峰高减半、腰变宽(面积始终为 )。 - 平方误差损失
( 固定时)——所以「最小二乘」常是高斯假设的最大似然。
多维高斯用均值向量与协方差矩阵
两个分量各自方差为

图解说明:同一
、不同 控制分散;2D 椭圆是协方差的几何形状。PETS / RSSM 里的「不确定」经常就是这套语言。
卡点。 高斯的「薄尾」:偏离
逐步推导:平方误差为何是高斯的负对数似然(点击展开)
假设
二维密度多一个行列式:
指数里的
demo 一维曲线用的就是

图解说明:左:
越小峰越尖。右: 的相关云,轴对齐的圆被拧成斜椭圆。
五、代码在做什么
demo.py:
- 用抛硬币的 Beta-Binomial 玩具演示先验 → 后验如何随正面次数移动(先验
,数据 正面,后验 ); - 画不同
的一维高斯,并采样二维相关高斯散点( )。
C++ stats.hpp 不算贝叶斯积分,只把「期望 / 方差是样本的函数」写成循环:对


六、小结
| 概念 | 一句话 |
|---|---|
| 期望 / 方差 | 中心与分散;同一堆数除以 |
| 条件概率 | 已知部分信息后,把样本空间缩小再归一化 |
| 贝叶斯 | 先验被似然更新为后验;Beta 对二项是共轭 |
| 高斯 | 最常用的噪声与不确定模型;固定 |
| 下游 | 回归、EM、贝叶斯深度学习、世界模型先验/后验 |
📥 Code
| File | View | Download |
|---|---|---|
| demo.py | Open | Download |
| stats.hpp | — | Download |
| demo.cpp | — | Download |
| exercise.py | Open | Download |
参考
- Blitzstein & Hwang, Introduction to Probability
- MacKay, Information Theory, Inference, and Learning Algorithms(贝叶斯视角极佳)