数理统计与估计:数据是随机的,估计量是数据的函数
WARNING
🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。
概率论假定
、 已知,问样本会长什么样。数理统计反过来:样本已经落在桌上,问参数大概是多少。本章只抓三件:点估计、极大似然、偏差(除以 还是 )。前置:常见分布。区间与「平均为何像高斯」见 CLT。贝叶斯把参数也当成随机变量,仍在 概率与贝叶斯。
一、样本与估计量
常见无脑但好用的选择:
- 样本均值
估期望; - 样本方差
估方差。
无偏:

图解说明:左是数据;中是似然山峰,
在山顶;右是高斯云里样本均值对准 ,并标出 。底栏:估计量随数据抖。
保姆级数字例。 demo 硬编码的十次抛币
七个正面,伯努利 MLE mle.hpp 印的就是这个数。它等于样本均值:对
同一颗硬币若真
卡点。 「无偏」不是「最好」。MLE 方差估计除以 mean((x-mu)**2),那是 MLE。两套惯例并存,读代码先看分母。
二、极大似然
似然把参数当变量、数据当常数:
- 伯努利:
, 次正面 。 - 高斯(
都未知): , 。注意 MLE 除以 ,所以对 有偏(略偏小)。无偏方差才除以 。
平方误差损失对应高斯、固定
保姆级数字例。 高斯真值
| 估计 | 分母 | 理论期望 | demo 要对照的现象 |
|---|---|---|---|
| 直方图整体在 | |||
| 中心更正,略更散 |
逐步推导:伯努利似然的山顶在 (点击展开)
对数(扔掉与
求导:
令导数为
二阶导
代入 demo 的十次:
为什么
直方图的宽度大约按
逐步推导:为什么除以 的方差有偏、除以 无偏(点击展开)
设
关键恒等式(把
平方求和后交叉项抵消,得到
两边取期望:
因此
MLE 除以
高斯情形还可以从似然直接推 MLE。
概率章那个

图解说明:
、真 。蓝色 MLE 堆的中心靠近 ;橙色无偏堆的中心靠近 。黑虚线是真值。
三、代码在做什么
左三张直方图:真


C++ mle.hpp 对硬编码的 10 次抛币印
cd docs/math/estimation/code
python demo.py
g++ -std=c++17 demo.cpp -o est_demo四、小结
| 概念 | 一句话 |
|---|---|
| 估计量 | 数据的函数,本身随机 |
| 无偏 | 平均瞄得准;不保证单次准 |
| MLE | 让当前数据最像被 |
| MLE 方差偏小,期望是 | |
| 下游 | 回归、EM、CLT |
下一章 大数定律与中心极限:为什么
大时 会老实,以及为何误差条常画成高斯。
📥 Code
| File | View | Download |
|---|---|---|
| demo.py | Open | Download |
| mle.hpp | — | Download |
| demo.cpp | — | Download |
| exercise.py | Open | Download |
参考
- Casella & Berger, Statistical Inference
- Wasserman, All of Statistics(短而全)