大数定律与中心极限:平均会老实,而且长成铃铛
WARNING
🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。
估计 说
是随机变量。本章回答两个「然后呢」:大数定律(LLN)—— 大时 贴向 ;中心极限定理(CLT)——贴的方式是 长成高斯,即使原来的 根本不是高斯。这是「用训练集平均代替真实风险」、以及误差条画成 的许可证。前置:常见分布。
一、大数定律
(依概率;还有几乎处处的强形式,这里不展开)。直觉就一句:独立噪声在平均里互相抵消,中心留下来。
抛币
机器学习里把损失的期望换成样本平均,靠的就是 LLN。SGD 的 minibatch 是「小
保姆级数字例。 伯努利
所以
卡点。 LLN 要的是期望存在。Cauchy 分布没有期望,样本均值会继续乱走——「平均一定收敛」不是宇宙定律。相关样本(马尔可夫链、同一篇文章里的相邻词)让有效样本量变小,收敛变慢,公式里的
逐步推导:为什么 ,以及 Chebyshev 如何推出 LLN(点击展开)
设
——平均作为估计量是无偏的。方差用独立可加:
标准差按
Chebyshev:对任意随机变量(只要方差有限),
指数分布
二、中心极限
设
或等价地

图解说明:三档样本量。LLN 是「中心贴过去」;CLT 是「贴的误差长成高斯」。底栏:原分布不必是高斯。
标准化样本均值
在练习里手写。置信区间
保姆级数字例。
| 直方图看起来 | ||
|---|---|---|
| 还是指数折线 | ||
| 开始鼓包,仍略右偏 | ||
| 已经像铃铛;经验方差应接近 |
卡点。 CLT 说的是
逐步推导:从「独立和的方差」到标准化 (点击展开)
第一步:位置和尺度。
这样
第二步:为什么是高斯(特征函数速写)。 设
(二阶泰勒,用了均值
右边正是
第三步:区间。 若
对
指数的偏度是

图解说明:
的样本均值, ,各 次重复。红线是 ,不是原指数密度。
三、代码在做什么
clt_lln.png:一条 clt_hist.png:指数样本均值的三档直方图,叠一条理论高斯。C++ 用最小 LCG 抽


cd docs/math/clt/code
python demo.py
g++ -std=c++17 demo.cpp -o clt_demo四、小结
| 概念 | 一句话 |
|---|---|
| LLN | |
| CLT | |
| 均值比单点更稳,稳 | |
| 标准正态 | |
| 下游 | 误差条、SGD 噪声、蒙特卡洛 |
下一章 优化与梯度:把「平均损失」写成
,参数怎么下山。
📥 Code
| File | View | Download |
|---|---|---|
| demo.py | Open | Download |
| clt.hpp | — | Download |
| demo.cpp | — | Download |
| exercise.py | Open | Download |
参考
- Durrett, Probability: Theory and Examples(定理表述)
- Blitzstein & Hwang, Introduction to Probability(例题向)