Skip to content

Hebb 与 STDP:权重如何因时序而变

WARNING

🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。

编码 把刺激写成尖峰时刻。学习规则问:这些时刻如何改突触?只背「一起放电就连在一起」会错过时序、稳态、调质


一、学习规则家族

规则一句话典型用途
Hebb相关活动 → 加强联想记忆直觉
STDP谁先谁后决定 LTP/LTD时序预测、感受野
BCM滑动阈值,防权重爆炸稳态 + 选择性
三因素前/后突触 + 调质(如多巴胺)把奖励接到局部更新

本讲垂直深挖 pairwise STDP。下一章用它「长出」方向选择性。


二、时间差就是老师

Δt=tposttpre

  • Δt>0(先 pre 后 post)→ LTP(变强)
  • Δt<0(先 post 后 pre)→ LTD(变弱)

指数窗:

Δw(Δt)={A+eΔt/τ+Δt>0AeΔt/τΔt<0

邻近时刻才有效(τ± 常在 10–20 ms);A 常常略大于 A+,有助于稳定。在线实现用 pre/post 痕迹(eligibility trace):pre 尖峰时用 post 痕迹做 LTD,post 尖峰时用 pre 痕迹做 LTP。

STDP:谁先谁后决定突触变强还是变弱

图解说明:pre 先于 post(因果)→ LTP;反过来 → LTD。指数窗只认邻近十几毫秒。

逐步推导:指数窗与痕迹实现是同一件事(点击展开)

连续时间里,每次配对贡献 Δw(Δt)。把所有历史写成卷积:pre 尖峰在突触上留一条衰减痕迹 x(t)x˙=x/τ++kδ(ttprek);post 尖峰留 y(t)。则

  • post 发放瞬间:ΔwA+x(t)(用「刚才 pre 有多新」做 LTP);
  • pre 发放瞬间:ΔwAy(t)(用「刚才 post 有多新」做 LTD)。

这正是把指数窗拆成两个一阶滤波器,适合在线仿真。demo 的 ±10ms 落在窗的中央附近,LTP/LTD 都清楚可见。

STDP 学习窗

运行 code/demo.py 生成。因果一侧为正、反因果为负。

动画说明:左:pre 比 post 早 10 ms,权重变大(LTP)。右:反过来,权重变小(LTD)。窗口上的绿/红点就是这两个 Δt

一对重复配对下的权重轨迹

固定 Δt=+10ms 的配对会把权重推向上界附近。


三、和反传的关键差别

反传需要全局损失沿计算图回传;STDP 通常只看局部尖峰时序(最多再加多巴胺一类调质)。这不是说 STDP 更高级,而是信用分配的假设完全不同——NeuroAI 会专门对照。

下一章:回路:STDP 长出方向选择性;E–I 网的 raster。

四、三条主线检查单

主线过关表现
生物能解释 STDP 窗为何非对称、为何 Δt=0 通常不更新
AI能对比局部时序学习与全局反传
模拟能指出因果配对如何把权重推向上界

📥 Code

FileViewDownload
demo.pyOpenDownload
exercise.pyOpenDownload

参考

  1. Bi, G. Q., & Poo, M. M. (1998). Synaptic modifications in cultured hippocampal neurons.
  2. Song, S., Miller, K. D., & Abbott, L. F. (2000). Competitive Hebbian learning through STDP.
  3. Gerstner et al., Neuronal Dynamics,可塑性章节。