Hebb 与 STDP:权重如何因时序而变
WARNING
🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。
编码 把刺激写成尖峰时刻。学习规则问:这些时刻如何改突触?只背「一起放电就连在一起」会错过时序、稳态、调质。
一、学习规则家族
| 规则 | 一句话 | 典型用途 |
|---|---|---|
| Hebb | 相关活动 → 加强 | 联想记忆直觉 |
| STDP | 谁先谁后决定 LTP/LTD | 时序预测、感受野 |
| BCM | 滑动阈值,防权重爆炸 | 稳态 + 选择性 |
| 三因素 | 前/后突触 + 调质(如多巴胺) | 把奖励接到局部更新 |
本讲垂直深挖 pairwise STDP。下一章用它「长出」方向选择性。
二、时间差就是老师
令
(先 pre 后 post)→ LTP(变强) (先 post 后 pre)→ LTD(变弱)
指数窗:
邻近时刻才有效(

图解说明:pre 先于 post(因果)→ LTP;反过来 → LTD。指数窗只认邻近十几毫秒。
逐步推导:指数窗与痕迹实现是同一件事(点击展开)
连续时间里,每次配对贡献
- post 发放瞬间:
(用「刚才 pre 有多新」做 LTP); - pre 发放瞬间:
(用「刚才 post 有多新」做 LTD)。
这正是把指数窗拆成两个一阶滤波器,适合在线仿真。demo 的

运行
code/demo.py生成。因果一侧为正、反因果为负。
动画说明:左:pre 比 post 早 10 ms,权重变大(LTP)。右:反过来,权重变小(LTD)。窗口上的绿/红点就是这两个
。

固定
的配对会把权重推向上界附近。
三、和反传的关键差别
反传需要全局损失沿计算图回传;STDP 通常只看局部尖峰时序(最多再加多巴胺一类调质)。这不是说 STDP 更高级,而是信用分配的假设完全不同——NeuroAI 会专门对照。
下一章:回路:STDP 长出方向选择性;E–I 网的 raster。
四、三条主线检查单
| 主线 | 过关表现 |
|---|---|
| 生物 | 能解释 STDP 窗为何非对称、为何 |
| AI | 能对比局部时序学习与全局反传 |
| 模拟 | 能指出因果配对如何把权重推向上界 |
📥 Code
| File | View | Download |
|---|---|---|
| demo.py | Open | Download |
| exercise.py | Open | Download |
参考
- Bi, G. Q., & Poo, M. M. (1998). Synaptic modifications in cultured hippocampal neurons.
- Song, S., Miller, K. D., & Abbott, L. F. (2000). Competitive Hebbian learning through STDP.
- Gerstner et al., Neuronal Dynamics,可塑性章节。