跳转至

Lecture18

LaTeX 源码

\makecscover

来源审计:一堂课、两条神经科学路径

这堂课不是单一论文讲座,而是两位讲者从不同脑区与不同计算层级,分别走向 Transformer-like computation。前 42 分钟,Trenton Bricken 从 Sparse Distributed Memory(SDM,稀疏分布式记忆)的高维几何出发,解释 hypersphere intersection 为什么产生近似 softmax 的指数权重,并提出 cerebellum(小脑)可能实现类似读写电路。后 39 分钟,Will Dorrell 从 cognitive map、hippocampus 与 entorhinal cortex 出发,介绍 Tolman--Eichenbaum Machine(TEM)如何分离结构与内容,以及 modern Hopfield memory 怎样把它改写成 attention。

纠正旧稿的错误视频与错误范围

旧稿链接的 dEFn6nnoC-8 是 Trenton Bricken 于 2025 年 3 月 31 日完成、2025 年 5 月上传的博士答辩,并非本课。正确官方录像是 Stanford Online 的 L4DC7e6g2iI,课堂日期为 2023 年 3 月 7 日。旧稿还只覆盖第一位讲者,并扩写出 MoE 路由、生产 dashboard、治理 playbook、incident response 和跨模态部署等课堂没有出现的内容;这些段落在本次重写中全部删除。

证据层 本地材料 教学职责
官方录像 1:22:13、两位讲者、66 个最终教学状态 决定课堂顺序、公式、手写推导、问答与结论
官方人工字幕 1,950 条 caption 与 timed transcript 恢复动机、类比限制、实验边界和神经科学细节
第一讲论文 Attention Approximates SDM 核对高维交集、指数近似、连续 SDM 与 learned coefficient
第二讲论文 TEM 与 hippocampal Transformer 论文 核对结构/内容分解、记忆更新、grid-like code 与 attention 对应
视觉审计 40 张标准 slide + 26 张手写最终状态 完整覆盖两段讲座,避免每一笔书写都变成重复截图

历史与证据边界

本讲重建 2023-03-07 的课堂。数学对应说明“某种计算可以由另一种形式近似实现”,不等于证明大脑运行训练好的 Transformer;脑区映射说明“电路具备候选实现组件”,不等于已经被实验确认;TEM 与 Transformer 的相似性发生在记忆检索、位置状态与结构泛化层面,也不是逐神经元的解剖同一。

第一讲的研究问题与路线

标题页给出 Bricken 与 Cengiz Pehlevan 的工作;动机页把问题压缩为一句话:Transformer attention 很强,但 softmax 是 heuristic,能否由简单高维向量性质自然产生?Agenda 页坚持先视觉直觉、后数学推导,再讨论 Transformer 组件与生物可实现性。这种顺序很重要,因为高维球面交集若直接写成特殊函数,会掩盖它作为“重叠地址数量”的记忆直觉。

\lecturefigure{slide-01-title-attention-sdm.jpg}{第一讲:Attention Approximates Sparse Distributed Memory}{官方录像恢复幻灯片 V001;00:00:22}

\lecturefigure{slide-02-why-care.jpg}{为什么值得研究:从 heuristic softmax 到高维记忆几何}{官方录像恢复幻灯片 V002;00:01:20}

\lecturefigure{slide-03-presentation-overview.jpg}{第一讲路线:SDM、attention、对应关系与 biological plausibility}{官方录像恢复幻灯片 V003;00:01:52}

\teachervoice{Bricken 明确说自己会先给 high-level visual intuition,再进入数学,并鼓励学生随时打断提问。讲义因此沿用同一顺序:先把写入、读取和交集画清楚,再推导指数权重;这不是回避公式,而是让每个符号先有操作语义。}

两讲共同追问的三层问题

虽然 SDM 与 TEM 来自不同理论传统,两讲都在追问三层关系:算法层上,模型如何检索相关记忆;表示层上,结构与内容怎样编码;实现层上,哪些神经电路或可学习矩阵能够执行计算。课程价值不在于把三层压成一句“脑就是 Transformer”,而在于比较跨层映射何时精确、何时只是启发。

阅读全课的证据阶梯

依次区分:公式等价或近似、训练模型中的经验结果、神经表征相似、候选电路可实现性、真实脑内因果证据。越往后证据要求越高。一个漂亮的 attention 公式不能直接证明脑区功能,一个相似的 grid pattern 也不能直接证明两个系统使用同一算法。

本章小结

正确课程源包含两位讲者和两条互补路线。第一条从高维联想记忆解释 attention 权重,第二条从认知地图与 hippocampal memory 解释结构泛化和 attention-like retrieval。所有后续内容都必须保持算法、表示与生物实现之间的证据层级。

Sparse Distributed Memory:怎样写入并从噪声查询中读出

第一讲先不讨论 Transformer,而是构造一个联想记忆系统。目标不是用精确地址读取一条记录,而是让相近 query 仍能召回正确 pattern,同时获得高容量、故障容忍与分布式存储。SDM 的核心技巧是:固定一组稀疏 hard locations,让每次写入和读取都作用于 query 半径内的一群位置。

设计目标:容量、鲁棒性与 fault tolerance

需求页列出四项:high memory capacity、robustness to query noise、biological plausibility 与 fault tolerance。下一页把 sparse 和 distributed 分开:地址空间维度极高,实际神经元只占极小部分可能位置;但一个 pattern 会同时激活多个近邻位置,因此没有单个地址承担完整记忆。

\lecturefigure{slide-04-brain-memory-requirements.jpg}{大脑式联想记忆的设计要求}{官方录像恢复幻灯片 V004;00:02:12}

\lecturefigure{slide-05-sdm-unique.jpg}{SDM 的 sparse 与 distributed 两层含义}{官方录像恢复幻灯片 V005;00:02:48}

术语表:address、pattern、value 与 hard location

\term{pattern} 是要写入或作为 query 的高维向量;\term{hard location} 是系统预置的稀疏地址;\term{address/key} 决定哪些位置被激活;\term{value} 是被写入并在查询时返回的内容。经典 auto-associative memory 中 key 与 value 可以相同,hetero-associative memory 中二者可以不同。

设二进制地址空间为 \(\{0,1\}^{n}\),第 \(i\) 个 hard location 为 \(h_i\),写入地址为 \(p\),半径为 \(d\)。激活指示量为 $$ a_i(p)=\mathbf{1}!\left[D_H(h_i,p)\le d\right], $$ 其中 \(D_H\) 是 Hamming distance,\(n\) 是向量维度,\(d\) 控制激活位置数量。高维空间使多数随机向量彼此很远,局部半径内仍可包含足够 hard locations 完成分布式计算。

写入:近邻位置与 superposition

第一张写入图让绿色 pattern 激活半径内 hard locations;第二张加入橙色 pattern,两个写入半径可能重叠;第三张再加入蓝色 pattern,重叠位置同时保存多条 value 的贡献。superposition 不是把多条记忆拼接,而是在同一存储向量上累加,读取时再靠许多位置的统计汇总去噪。

\lecturefigure{slide-06-sdm-write-pattern1.jpg}{SDM 写入第一条 pattern:激活半径内 hard locations}{官方录像恢复幻灯片 V006;00:03:26}

\lecturefigure{slide-07-sdm-write-pattern2.jpg}{写入第二条 pattern:地址邻域可以重叠}{官方录像恢复幻灯片 V007;00:03:42}

\lecturefigure{slide-08-sdm-write-superposition.jpg}{多条 pattern 在 hard locations 中叠加存储}{官方录像恢复幻灯片 V008;00:04:14}

若第 \(i\) 个位置保存向量计数器 \(w_i\),把 value \(v\) 写入地址 \(p\) 可写为 $$ w_i\leftarrow w_i+a_i(p)\,v. $$ 其中 \(v\) 可以是 bipolar 向量或实值向量,\(a_i(p)\) 决定该位置是否参与。一个位置累积多条 \(v\),容量与噪声来自同一机制:越多 pattern 共享位置,存储利用率越高,交叉干扰也越大。

SDM 的分布式写入(概念伪代码)
def sdm_write(hard_locations, counters, address, value, radius):
    for index, location in enumerate(hard_locations):
        if hamming(location, address) <= radius:
            counters[index] += value

\teachervoice{讲者不断提醒观众先把这些“neuron”当抽象 hard locations,稍后才映射到 biology。这个顺序避免把一张二维圆圈图误解成真实脑内空间:图上的距离代表高维 Hamming distance,圆形只是教学投影。}

读取:从激活神经元到 pattern 交集

读操作有两种等价视角。neuron view 让 query 激活附近位置,把各位置存储向量相加,再逐维 majority vote;pattern view 则抽象掉 hard locations,直接看 query sphere 与各 write sphere 的交集大小。交集越大,说明越多位置同时在某条 pattern 写入时和当前 query 读取时被激活,该 pattern 的 value 权重越高。

\lecturefigure{slide-09-sdm-read-neurons.jpg}{Neuron view:噪声 query 激活附近位置并汇总存储}{官方录像恢复幻灯片 V009;00:05:02}

\lecturefigure{slide-10-sdm-read-patterns.jpg}{Pattern view:sphere intersection 决定各记忆权重}{官方录像恢复幻灯片 V010;00:05:40}

\lecturefigure{slide-11-circle-intersection.jpg}{两个高维球的交集与距离}{官方录像恢复幻灯片 V011;00:05:56}

读取的连续形式可写成 $$ r(q)=\sum_i a_i(q)w_i, \qquad \hat v_j=g(r_j)=\mathbf{1}[r_j>0], $$ 其中 \(q\) 是 query,\(r(q)\) 是激活位置的总读出,\(g\) 是逐维阈值或 majority decoder。把写入式代入后,每个 pattern \(p_\mu\) 对输出的贡献正比于 $$ I!\left(D_H(p_\mu,q);d,n\right) =\left|B(p_\mu,d)\cap B(q,d)\right|, $$ 即两个 Hamming ball 的交集大小;\(B(p,d)\) 表示以 \(p\) 为中心、半径 \(d\) 的球。

\lecturefigure{slide-12-query-read-equation.jpg}{Query read 的四步公式:交集、加权、归一化与解码}{官方录像恢复幻灯片 V012;00:07:18}

读图:为什么 noisy query 仍能恢复 pattern

query 不必等于原地址,只要仍与正确 pattern 的 sphere 大量重叠,就会激活许多曾写入该 value 的位置。随机错误改变少数 bit 时,正确交集通常仍比无关 pattern 大;majority vote 把独立噪声平均掉。失败发生在 pattern 太密、半径太大或 query 离原 pattern 太远时。

本章小结

SDM 用高维稀疏地址实现分布式写入,用 sphere intersection 实现内容寻址。写入半径同时控制容量和干扰;读取通过激活位置汇总与 majority decoding 去噪。下一章只需证明 intersection weight 具有类似 softmax 的指数形状,就能把这套记忆操作连接到 attention。

Transformer Attention:先把比较对象写清楚

课程没有直接把 SDM 贴到 Transformer 上,而是完整复习了一次 attention。这样做是为了锁定比较对象:query 与 key 的相似度怎样形成权重,softmax 做了什么,value 为什么不同于 key,以及最终更新向量如何写成矩阵式。

Q、K、V 的操作语义

本节先把后续几何比较所依赖的 Q、K、V 操作语义固定下来。章节页之后,语言示例把当前待预测位置视为 query,把上下文 token 的 key 用于匹配,把 value 视为真正被搬运到输出的内容。Q/K/V 页把流程拆成生成投影、query--key 比较、归一化和 value 加权;下一页展示归一化后的权重怎样乘上各 value 再相加。

\lecturefigure{slide-13-transformer-attention-overview.jpg}{Transformer attention 章节过渡}{官方录像恢复幻灯片 V013;00:07:20}

\lecturefigure{slide-14-attention-example.jpg}{语言模型中的 attention 示例}{官方录像恢复幻灯片 V014;00:08:02}

\lecturefigure{slide-15-qkv-steps.jpg}{Keys、queries 与 values 的四步计算}{官方录像恢复幻灯片 V015;00:08:40}

\lecturefigure{slide-16-weighted-value-sum.jpg}{Softmax 权重如何汇总 value vectors}{官方录像恢复幻灯片 V016;00:09:00}

Key 与 value 不能混为一谈

key 回答“这条记忆与 query 有多相关”,value 回答“若相关,应取回什么”。把二者分开后,模型可以按语法或实体身份匹配,却返回对下一 token 有用的不同特征;这也对应 SDM 中 address 与 stored content 可分离的 hetero-association。

虚构例子与完整更新式

Fictional example 页用 “cat”、“sat” 一类 token 说明高相关 key 可以返回包含语义与句法信息的 value。Full query update 页随后把投影与更新写在一起。设输入 token 矩阵为 \(X\),查询位置向量为 \(x_q\),投影矩阵为 \(W_Q,W_K,W_V\),则 $$ q=W_Qx_q,\quad K=XW_K,\quad V=XW_V, $$ $$ \operatorname{Attn}(q,K,V) =V^{\top}\operatorname{softmax}!\left(\beta Kq\right). $$ 其中 \(q\) 是 query,\(K\) 的每一行是 key,\(V\) 的每一行是 value,\(\beta\) 是温度/尺度系数。若采用 scaled dot-product,常见 \(\beta=1/\sqrt{d_k}\)

\lecturefigure{slide-17-fictional-example.jpg}{虚构例子:匹配 key 后返回不同 value 特征}{官方录像恢复幻灯片 V017;00:10:14}

\lecturefigure{slide-18-full-query-update.jpg}{完整 query update 的矩阵表达}{官方录像恢复幻灯片 V018;00:10:30}

Dot product、softmax 与 value summation

三页分别放大 attention 的关键操作。Dot-product 页说明相似度来自 \(k_i^{\top}q\);softmax 页说明指数化会扩大高分差异并归一化;summation 页说明输出是 value 的凸组合。Softmax 的关键不是“产生概率”这个标签,而是权重关于相似度呈指数变化,这正是下一章要从高维球交集中恢复的形状。

\lecturefigure{slide-19-query-key-dot-product.jpg}{Query--key dot product 形成 similarity logits}{官方录像恢复幻灯片 V019;00:10:50}

\lecturefigure{slide-20-softmax.jpg}{Softmax 放大高相似项并完成归一化}{官方录像恢复幻灯片 V020;00:11:44}

\lecturefigure{slide-21-summation-over-values.jpg}{按注意力权重求和 value vectors}{官方录像恢复幻灯片 V021;00:12:02}

\lecturefigure{slide-22-full-attention-equation.jpg}{Attention 全流程与最终更新式}{官方录像恢复幻灯片 V022;00:12:18}

对第 \(i\) 个 key,softmax 权重为 $$ \alpha_i(q)=\frac{\exp(\beta k_i^{\top}q)} {\sum_j\exp(\beta k_j^{\top}q)}, \qquad y(q)=\sum_i\alpha_i(q)v_i. $$ 这里 \(\alpha_i\) 是 normalized retrieval weight,\(v_i\) 是第 \(i\) 条记忆内容。与 SDM 比较时,问题转化为:sphere-intersection count 是否可写成 \(\exp(\text{similarity})\),以及归一化后是否得到同样的 \(\alpha_i\)

Scaled dot-product attention(单 query 示意)
def attention(query, keys, values, beta):
    logits = beta * (keys @ query)
    weights = softmax(logits)
    return weights @ values

\teachervoice{讲者特别提醒“what you pay attention to”和“what you get out”可以不同:query 与 keys 决定相关性,values 决定取回内容。这句话是后面把 cerebellar activation pathway 与 write pathway 分开的关键,也连接了第二讲中的 content/structure factorization。}

本章小结

Attention 是内容寻址记忆:query 与 keys 产生相似度,softmax 将相似度变为指数归一化权重,values 被加权取回。只要 SDM 的 sphere intersection 随距离指数衰减,并能把距离改写成点积,两种读操作就拥有相同的计算骨架。

为什么高维球交集近似 Softmax

现在进入第一讲的核心推导。直觉是:两个半径相同的高维球中心越远,交集体积越小;在相关参数范围内,这个衰减近似指数函数。若向量经过归一化,Hamming distance 又能改写为 cosine/dot-product similarity,于是 intersection weight 变成 softmax logit 的指数形式。

从交集曲线到指数衰减

章节页之后的图把横轴设为两球中心的 Hamming distance,纵轴是 expected intersection size 的对数。点列近似直线意味着原始交集大小近似指数衰减: $$ I(\delta;d,n)\approx c_1\exp(-c_2\delta), $$ 其中 \(\delta=D_H(p,q)\)\(d\) 是写/读半径,\(n\) 是维度,\(c_1,c_2\)\(n,d\) 决定。这个式子不是所有距离都精确,而是在注意力实际使用的相似区域给出有效近似。

\lecturefigure{slide-23-attention-approximates-sdm.jpg}{核心问题:Transformer attention 如何近似 SDM}{官方录像恢复幻灯片 V023;00:12:26}

\lecturefigure{slide-24-exponential-circle-decay.jpg}{高维 sphere intersection 随中心距离近似指数衰减}{官方录像恢复幻灯片 V024;00:12:46}

二维圆图只负责直觉

二维中两个圆的交集面积不会自动呈现高维浓缩现象。真正结论依赖 \(n\) 很大、半径与维度处于合适比例。不能从画面上“看起来像指数”推出定理;课程用数值图和渐近分析共同支持近似。

Hamming distance 怎样变成 cosine similarity

对 bipolar 向量 \(a,b\in\{-1,+1\}^{n}\),每个相同 bit 对点积贡献 \(+1\),不同 bit 贡献 \(-1\),因此 $$ D_H(a,b)=\frac{n-a^{\top}b}{2}. $$ 若进一步令 \(\hat a=a/\sqrt n\)\(\hat b=b/\sqrt n\),则 $$ D_H(a,b)=\frac{n}{2}\left(1-\hat a^{\top}\hat b\right). $$ 把它代入指数衰减:常数项被归一化消去,剩余权重正比于 \(\exp(\beta\hat a^{\top}\hat b)\)。这就是从距离型联想记忆到 dot-product attention 的数学桥梁。

\lecturefigure{slide-25-hamming-cosine-derivation.jpg}{从 Hamming distance 到归一化 dot product}{官方录像恢复幻灯片 V025;00:16:24}

\lecturefigure{slide-26-exponential-fit-regression.jpg}{对 log intersection size 做线性拟合}{官方录像恢复幻灯片 V026;00:17:18}

读图:拟合图支持什么

横轴增加时,log intersection size 近似线性下降,支持指数近似;斜率对应 effective beta,截距在 softmax 归一化中被消去。图不证明所有维度和半径都同样好,弯曲尾部正是近似误差需要检查的区域。

把两套记号逐项对齐

Attention-in-SDM-notation 页先把 query、pattern address 与 stored value 对齐;核心 equivalence 页再把 circle-intersection weight 替换为 exponential dot product。归一化后,SDM pattern view 的读出为 $$ \hat y(q) =\frac{\sum_\mu I(D_H(p_\mu,q);d,n)v_\mu} {\sum_\nu I(D_H(p_\nu,q);d,n)} \approx \sum_\mu \frac{\exp(\beta p_\mu^{\top}q)} {\sum_\nu\exp(\beta p_\nu^{\top}q)}v_\mu. $$ 其中 \(p_\mu\) 是第 \(\mu\) 条 key/pattern,\(v_\mu\) 是 value,\(\beta\) 由维度、半径、向量范数和近似系数共同决定。右侧正是 attention read。

\lecturefigure{slide-27-attention-sdm-notation.jpg}{用 SDM 记号重写 attention}{官方录像恢复幻灯片 V027;00:17:20}

\lecturefigure{slide-28-sdm-attention-equivalence.jpg}{SDM intersection weighting 与 attention softmax 的对应}{官方录像恢复幻灯片 V028;00:17:22}

数值实验与成立条件

Parameter experiments 页比较不同 \(n,d\) 下的真实 intersection 与指数拟合;Mapping conditions 页强调两个实际条件:向量需要近似 \(L^2\) 归一化,常由 LayerNorm 或 norm behavior 支持;effective coefficient 要匹配 intersection slope。若 key/query norms 自由变化,它们也会改变 temperature,不能只把 \(1/\sqrt{d_k}\) 当唯一 beta。

\lecturefigure{slide-29-parameter-experiments.jpg}{不同维度与半径下的 intersection 近似实验}{官方录像恢复幻灯片 V029;00:18:38}

\lecturefigure{slide-30-mapping-conditions.jpg}{映射成立所需的 normalization 与 coefficient 条件}{官方录像恢复幻灯片 V030;00:20:40}

\teachervoice{讲者没有把“约等于”藏起来。他反复区分 close approximation 与 exact identity,并指出稀疏/硬 attention、未归一化向量或不同 coefficient 都会偏离标准映射。真正可迁移的方法是先写出 assumptions,再问训练模型是否满足,而不是看见 softmax 就宣布等价。}

核心结论的最小版本

在高维、合适半径、归一化向量和 coefficient 匹配的条件下,SDM 读写球的交集数量随 pattern--query 距离近似指数衰减;距离可改写为 dot product;归一化后得到 softmax attention。这个结论解释 softmax 的一种几何来源,但不是 softmax 的唯一来源。

本章小结

高维 intersection concentration 产生指数距离权重,bipolar Hamming distance 又等价于归一化 dot product 的仿射变换,因此 SDM pattern read 近似 attention。数值实验支持该近似,但 LayerNorm、向量范数、beta 和参数区域决定映射质量。

Continuous SDM 与 Transformer 组件解释

经典 SDM 使用 binary address 和 hard radius,Transformer 使用 continuous vector 与 softmax。课程接下来把 SDM 连续化,并问一个更开放的问题:训练好的 Transformer 是否真的落在“好用的 SDM 参数区间”,以及 FFN、LayerNorm 和 memory capacity 能否统一放进这套框架。

从 binary radius 到连续 kernel

Continuous SDM 页说明,不必把输入强制量化为 bit。对归一化实值向量,直接使用指数 dot-product kernel 即可定义连续读出: $$ \operatorname{CSDM}(q)= \sum_\mu\operatorname{softmax}\mu(\beta p\mu^{\top}q)v_\mu. $$ 这与 attention 形式相同,也可被多层感知机或 associative-memory network 实现。连续化保留“相近地址贡献更大”的原则,却把硬半径变成平滑权重。

\lecturefigure{slide-31-continuous-sdm.jpg}{Continuous SDM:从 binary Hamming space 到实值向量}{官方录像恢复幻灯片 V031;00:21:32}

什么是 effective beta

\(\beta\) 决定 retrieval sharpness:小 \(\beta\) 让许多 memory 平均参与,大 \(\beta\) 让最相似 memory 占主导。在 Transformer 中,显式 scale、key/query norms 与 LayerNorm 都会共同改变有效温度,所以测量 learned coefficient 应看真实 logits,而不只看公式常数。

训练后的 Attention 像“好”的 SDM 吗?

问题页提出反向检验:如果 attention 实现 SDM,训练后参数是否对应容量与噪声鲁棒性较好的半径/temperature?Learned beta 页展示不同 head 的 coefficient 分布,说明模型并没有统一温度。head 可能承担复制、局部语法、长程检索等不同任务,因此最佳 retrieval sharpness 也可能不同。

\lecturefigure{slide-32-transformer-sdm-question.jpg}{开放问题:训练后的 Transformer 是否对应优秀 SDM 参数?}{官方录像恢复幻灯片 V032;00:22:18}

\lecturefigure{slide-33-learned-beta.jpg}{不同 attention heads 学到的 effective beta}{官方录像恢复幻灯片 V033;00:23:44}

不要把 entropy 当作单调质量指标

高 entropy 可能表示需要整合多条记忆,也可能表示检索不聚焦;低 entropy 可能是精准召回,也可能是错误过度自信。SDM 视角提供容量/噪声解释,但仍要结合 head 的功能和任务损失判断。

FFN、LayerNorm 与 memory framework

Transformer components 页把 broader architecture 放进 SDM 框架:FFN 可被视为一组长期 key--value memory;LayerNorm 帮助稳定向量范数与 coefficient;attention 是显式 pattern-based retrieval。最后 summary 页把结论与未来问题并列,强调这些对应关系能够产生研究假设,却不是一套已经证完的统一理论。

\lecturefigure{slide-34-transformer-components-converge.jpg}{Transformer 组件如何汇入 SDM framework}{官方录像恢复幻灯片 V034;00:25:06}

\lecturefigure{slide-35-sdm-summary.jpg}{第一讲理论部分总结与开放问题}{官方录像恢复幻灯片 V035;00:26:20}

Transformer 组件 SDM/记忆视角 必须保留的限制
Attention 当前上下文中的精确 pattern-based retrieval 受 context window 约束,存储所有 keys/values
FFN 参数中叠加的长期 key–value associations 检索更噪、更难逐条追溯,不等于完整数据集存储
LayerNorm 稳定向量 norm,使距离/点积对应更可控 实际 norms 与 learned scales 仍会改变 temperature
Multi-head 多组不同表示子空间与 retrieval sharpness 不能直接等同于脑区 microzones

\teachervoice{问答中,讲者区分 neuron-centric 与 pattern-centric SDM:attention 保留所有 pattern location,因此相似度精确但有 context window;长期分布式记忆只保留 noisy superposition,容量更大却难以精确三角定位原 pattern。这个 tradeoff 比旧稿虚构的生产监控指标更接近课堂真正的工程启示。}

本章小结

连续 SDM 将硬半径变成指数 kernel,与 attention 共享形式。Learned beta、LayerNorm 和 FFN 解释把框架扩展到完整 Transformer,但每个对应都应作为可检验假设。Pattern memory 的精确短上下文与 distributed memory 的高容量噪声,是课程提出的核心权衡。

Biological Plausibility:小脑能否实现 SDM 式读写

理论对应之后,第一讲把问题推进到实现层:如果 attention-like retrieval 只需要高维激活、独立写入通道与 pooled readout,大脑是否已有类似电路?课程选择 cerebellum,不是声称小脑“就是 Transformer”,而是逐项寻找 address activation、value writing、superposition 与 majority-like pooling 的候选组件。

抽象电路:地址通道与写入通道分开

Circuitry 页从 abstract neuron 开始。输入 pattern 决定哪些地址 neuron firing;另一路 value signal 决定这些 neuron 应存什么;读取时 query 再次激活 neuron,各自输出叠加 value,最后由 pooled unit 汇总。这个 hetero-associative 结构与 attention 的 key/value 分离直接对应。

\lecturefigure{slide-36-circuitry-sdm.jpg}{实现 SDM 的抽象神经电路}{官方录像恢复幻灯片 V036;00:26:38}

\lecturefigure{slide-37-circuitry-mapping-final.jpg}{抽象电路映射到 cerebellar components 的最终状态}{官方录像恢复幻灯片 V037;00:28:22}

术语消化:cerebellar circuit 的候选角色

\term{mossy fibers} 携带输入;\term{granule cells} 形成高维稀疏扩展;\term{parallel fibers} 把 granule activity 广泛送到 Purkinje cells;\term{climbing fibers} 提供强而相对独立的教学/写入信号;\term{Purkinje cells} 汇总大量输入并影响 deep cerebellar nuclei。课程是在功能层对齐这些角色。

小脑解剖与 SDM 操作逐项映射

解剖页展示小脑重复而相对均一的微电路;最终 mapping 页把 abstract read/write 线路叠到具体 cell types。Granule cells 数量巨大且连接稀疏,可作为 hard locations;mossy input 决定激活;climbing fiber 的强信号可改变特定 Purkinje synapse;Purkinje cell 接收极大量 parallel-fiber input,提供 pooled output。

\lecturefigure{slide-38-cerebellum-anatomy.jpg}{Cerebellum 的神经元类型与连接结构}{官方录像恢复幻灯片 V038;00:31:04}

\lecturefigure{slide-39-sdm-cerebellum-mapping.jpg}{SDM read/write 与 cerebellar circuitry 的完整对照}{官方录像恢复幻灯片 V039;00:34:00}

\teachervoice{讲者说 70% 左右的脑神经元位于 cerebellum,并提醒它可能不仅参与精细运动;但他同时把高阶认知证据描述为活跃研究。讲义保留这个探索性语气,不把 fMRI “亮起”改写成某种已确定的语言 attention 模块。}

怎样从“可实现”走向“被证实”

课程问答给出最重要的科学边界:即使电路可以实现 SDM,也不代表大脑实际使用它。真正检验需要在 associative task 中实时记录稀疏 neuron activation、synaptic update 与 behavior change,最好还能写入新关联并观察旧关联消退。讲者提出高速 calcium/voltage imaging 作为候选路线;这是一份实验设计,而不是已有结论。

三种不能跳过的证据差距

第一,解剖连接允许某计算,不代表动力学会执行它;第二,局部读写相似,不代表全脑使用 Transformer training objective;第三,microzone 与 multi-head 的类比很诱人,但讲者明确说不应把类比推得太远。

Q&A 还区分 fast neural activity 与 long-term synaptic plasticity,并讨论 radius 的容量--fidelity 权衡:激活半径大,单次读出聚合更多 neuron、估计更平滑,却增加 pattern 干扰;半径小,区分度高,但噪声 query 可能激活太少位置。attention 中对应参数不是一个固定物理半径,而是 key/query norms 与 beta 共同产生的 effective sharpness。

\lecturefigure{slide-40-first-talk-thank-you.jpg}{第一讲总结、参考资料与致谢}{官方录像恢复幻灯片 V040;00:35:54}

第一讲的最强与最弱结论

最强结论是:在明确条件下,SDM intersection read 与 softmax attention 存在可推导、可数值验证的近似。较弱但有启发的结论是:cerebellar circuit 拥有实现类似 address/value/readout 操作的组件。二者必须分开写,前者是数学证据,后者是神经科学假设。

本章小结

小脑 mapping 展示了 attention-like associative memory 的候选生物实现:稀疏扩展、独立教学信号、分布式存储与 pooled readout 都能找到功能对应。但课堂最重要的 teacher voice 是“可实现不等于被验证”,实验需要直接追踪学习中的连接变化和行为结果。

第二讲转场:从联想记忆到 Cognitive Map

00:42:28 后课程更换讲者。原定嘉宾临时取消,Will Dorrell 在很短准备时间内用平板手写讲解,因此视觉形式从标准 slide deck 变成连续长页。内容却与前半紧密相连:Bricken 问“相似 query 怎样取回 memory”,Dorrell 问“经验中的关系结构怎样被记住,并在新内容上快速复用”。前者强调地址几何,后者强调结构与内容的 factorization。

核心问题:序列经验中的结构能否被复用

开场手写页把 hippocampus、entorhinal system 与 Transformers 放在一起。下一页用一段 sequence/graph 示意一个普遍问题:agent 观察到的对象和奖励会变化,但 transition structure、relative position 或 relational rule 可能保持不变。若模型每到新环境都从头记忆完整 episode,就无法 few-shot generalize;若能抽取 structure,就可把旧规则迁移到新内容。

\lecturefigure{slide-41-cognitive-map-title.jpg}{第二讲:Hippocampus、entorhinal system 与 Transformers}{官方录像手写教学状态 V041;00:43:54}

\lecturefigure{slide-42-one-problem-sequence-structure.jpg}{一个共同问题:从 sequence experience 抽取可复用结构}{官方录像手写教学状态 V042;00:45:36}

\teachervoice{课程主持人说明 Will 是临时接替,并介绍 Gatsby Unit 的 computational neuroscience 背景。Will 随即把自己的工作描述为:一个原本独立研究 hippocampal--entorhinal system 的模型,后来“看起来有点像 Transformer”。这句话强调的是 convergent computation,而非照着 Transformer 设计脑模型。}

Structural generalization 的最小定义

给定不同 observation labels 但共享 transition/relational graph 的环境,系统应在少量新经验后复用已有结构进行 prediction、planning 或 inference。可迁移的是“关系怎样连接”,不是每个节点的感官身份。

本章小结

第二讲把记忆问题从“相似度检索”推进到“结构复用”。认知地图不只要记住发生过什么,还要分离 what 与 where/how-related,使新的对象能够快速绑定到熟悉的关系图中。

Cognitive Map:空间只是结构推理的一个特例

认知地图最初来自 navigation,但课程的目标是把它扩展到任意 relational structure。我们先看空间证据,再看非空间 transitive inference,最后把共同问题抽象为 graph learning:观察内容变化,边关系保持,模型需要重用结构并快速更新内容绑定。

从 Tolman 的地图到树状泛化

Theory/navigation 页把 cognitive map 描述为对环境结构的内部模型,使 agent 能在道路阻断或目标改变时重新规划,而不是只复现一条 cached action sequence。树状例子进一步说明,结构不一定是二维平面;层级、亲属关系和任务状态都可以形成 graph,关键是模型能否推断未直接体验的路径。

\lecturefigure{slide-43-cognitive-map-theory-navigation.jpg}{Cognitive-map 理论:结构模型支持灵活导航}{官方录像手写教学状态 V043;00:47:32}

\lecturefigure{slide-44-tree-structured-generalization.jpg}{树状关系中的结构泛化}{官方录像手写教学状态 V044;00:48:20}

若环境表示为图 \(G=(V,E)\),每个节点 \(i\) 有观察 \(x_i\),边类型/动作 \(a_t\) 决定 transition \(i_t\to i_{t+1}\)。结构泛化要求学习 $$ g_{t+1}=f_{\theta}(g_t,a_t), $$ 其中 \(g_t\) 是与具体 observation identity 尽量解耦的 structural state。换一组 \(x_i\) 时,\(f_{\theta}\) 仍可更新位置/关系;只需重新绑定 \(g_i\) 与新内容。

背景概念:cognitive map 不等于地理地图

地图的本质是关系可组合:A 在 B 左边、B 在 C 左边,可推出 A 与 C 的相对关系;某动作从节点 1 到节点 2,同一动作规则可迁移到新对象。二维空间是最直观案例,但 graph、family tree、任务状态和概念关系都可使用同一结构思想。

Place cells、grid cells 与空间结构证据

Evidence overview 页汇集空间任务、neural recording 和行为结果。讲者口头回顾 place cell:某个 hippocampal neuron 在动物处于环境特定位置时强烈 firing;grid cell 则在多个位置形成 hexagonal lattice。它们不是直接的 GPS 坐标,而是神经活动随位置呈现稳定结构。

\lecturefigure{slide-45-task-evidence-selection.jpg}{认知地图的行为与神经证据概览}{官方录像手写教学状态 V045;00:51:44}

\teachervoice{Will 用 London taxi drivers 的“Knowledge”考试说明空间结构学习的行为代价,并引用 hippocampal size 与驾驶经验的相关证据。他随即转向非空间任务,因为“空间相关”还不能证明脑区表示的是更一般的 relational structure。}

神经 tuning curve 的常见误读

一个 cell 在特定位置 firing,不等于它单独“存储这个位置”;位置通常由 population code 表示。grid pattern 与模型 position encoding 相似,也不代表训练过程、输入来源和生物功能完全相同。应比较可解码信息、变换规律与任务因果作用。

非空间证据:Transitive inference

Transitive-inference 页展示一类非空间关系任务:动物学习 A 比 B、B 比 C 等局部 pair,再被测试未直接训练的 A 与 C。若只记忆 observed pairs,无法稳定推断新组合;若形成 ordered relational map,就能沿结构推导。手写页把行为实验、成像证据和 pair relation 放在同一条论证链上。

\lecturefigure{slide-46-transitive-inference-evidence.jpg}{Transitive inference:从已学 pair 推断未见关系}{官方录像手写教学状态 V046;00:54:54}

\lecturefigure{slide-47-executive-layer-map.jpg}{关系任务中的 observation、structure 与行为读出}{官方录像手写教学状态 V047;00:55:18}

读图:三种策略怎样区分

\term{pair memorization} 只能回答训练过的 pair;\term{scalar ordering} 给每个对象一个一维 rank,适合线性序;\term{relational graph} 表示多种 edge,能处理树、环与二维空间。实验设计要用未见组合和结构改变区分这些策略,而不是只测训练 pair accuracy。

从 graph world model 到通用神经算法

Graph-world 页把环境抽象为节点、边和 observation;下一页列出目标算法:结构应可跨环境复用,内容要快速写入,规划应在 latent graph 上进行,神经表征还应与 hippocampal/entorhinal data 对照。这里的挑战同时包含 representation learning、memory binding 和 model-based inference。

\lecturefigure{slide-48-graph-world-model.jpg}{把环境抽象为可复用 graph 与可变化 observations}{官方录像手写教学状态 V048;00:58:58}

\lecturefigure{slide-49-neural-algorithm-general.jpg}{理想神经算法:结构迁移、快速绑定与推理}{官方录像手写教学状态 V049;00:59:28}

第二讲的任务分解

慢学习负责掌握 transition structure 与可组合规则;快学习负责把新 sensory content 绑定到 structural states;推理负责沿结构传播与规划。TEM 的架构正是把这三项分给不同表示和更新机制。

本章小结

Place/grid cells 和 taxi-driver evidence 支持空间认知地图,transitive inference 等任务则支持更广 relational map。共同计算问题是:把 observation identity 与 reusable structure 分开,再通过快速记忆把二者绑定,使未见组合也可推断。

Tolman–Eichenbaum Machine:What、Where 与 Associative Memory

TEM 是第二讲的模型核心。它把 lateral entorhinal cortex(LEC)类比为 content/what stream,把 medial entorhinal cortex(MEC)类比为 structural/location stream,把 hippocampus 类比为 conjunctive associative memory。结构状态按 action recurrently 更新,内容在新环境中快速绑定,memory 再支持 recall 和 inference。

架构总览:三种状态各司其职

标题页之后,架构图展示三层信息:sensory observation、可复用 structural state 和 conjunctive memory。下方 graph 说明同一结构可承载不同 observation labels。模型不是把 observation 直接塞进一个 RNN,而是让 structure dynamics 与 content encoding 分别学习,再在 hippocampal-like state 中结合。

\lecturefigure{slide-50-tem-title.jpg}{Tolman--Eichenbaum Machine:统一空间与关系记忆}{官方录像手写教学状态 V050;00:59:38}

\lecturefigure{slide-51-tem-architecture.jpg}{TEM 架构:sensory content、structural state 与 memory}{官方录像手写教学状态 V051;01:01:08}

组件 计算角色 神经科学类比
\(x_t\) / sensory code 当前 observation 的内容表示 LEC-like what/content stream
\(g_t\) / structural code 由动作与上一状态更新的位置/关系表示 MEC-like where/structure stream
\(p_t\) / conjunctive code 把当前内容与结构绑定为 episode hippocampal conjunctive representation
\(M_t\) / associative memory 快速写入并按 cue 召回 conjunctive states hippocampal recurrent/associative memory

LEC 与 MEC:内容和结构分离

LEC 页从 observation 提取 sensory code,回答“看到了什么”;MEC 页根据 action/transition 更新 structural code,回答“在结构中的哪里”。这种分离让模型在新环境中保留 transition dynamics,同时替换 object identity。若二者从一开始完全纠缠,每次换 observation 都可能破坏已有地图。

\lecturefigure{slide-52-lec-what-stream.jpg}{LEC-like stream:编码 sensory content}{官方录像手写教学状态 V052;01:01:20}

\lecturefigure{slide-53-mec-where-stream.jpg}{MEC-like stream:更新 reusable structural state}{官方录像手写教学状态 V053;01:02:24}

结构更新可抽象为 $$ g_t=f_{\theta}(g_{t-1},a_t), \qquad x_t=e_{\phi}(o_t), $$ 其中 \(o_t\) 是 observation,\(a_t\) 是 action/edge,\(g_t\) 是 path-integrated structural state,\(x_t\) 是 content encoding。\(\theta\) 跨环境慢速学习,当前环境中的 object binding 则可快速建立。

“Where” 不一定是二维坐标

在 tree 或 transitive-order task 中,\(g_t\) 表示的是 relational position,不必对应欧氏 \((x,y)\)。把 MEC-like state 解释成通用结构码,正是 TEM 从 navigation 推广到 relational memory 的关键;但该推广仍需任务和神经数据支持。

Hippocampal binding 与 Hebbian-style memory

Memory-update 页把 content 与 structure 结合成 conjunctive code,随后写入 associative memory。Hebbian 页给出“共同激活则连接增强”的局部更新直觉。一个抽象写法是 $$ p_t=b(x_t,g_t), \qquad M_t=\lambda M_{t-1}+p_t p_t^{\top}, $$ 其中 \(b\) 是 binding operation,\(p_t\) 是 conjunctive representation,\(M_t\) 是 memory matrix,\(\lambda\) 控制旧记忆保留。真实 TEM 使用更细的 inference/generative 结构,但这个简式揭示快速写入为何不必重训全部参数。

\lecturefigure{slide-54-recurrent-memory-update.jpg}{TEM 的 recurrent state 与 associative-memory update}{官方录像手写教学状态 V054;01:02:58}

\lecturefigure{slide-55-hebbian-memory-equations.jpg}{Hebbian-style binding 与 memory equations}{官方录像手写教学状态 V055;01:03:40}

什么是 fast weights

模型参数 \(\theta,\phi\) 通过许多环境慢速训练,memory matrix \(M_t\) 则在当前 episode 中快速更新,因此常被称为 fast weights。它允许一次或少量 exposure 后保存新内容,而结构 dynamics 仍由长期参数提供。

Graph inference 与 planning

Graph-inference 页展示 agent 如何利用 structural state 和 recalled memory 推断未直接观察的节点或规划路径。关键不是把完整 graph 存成固定 adjacency table,而是让 recurrent transition model 生成候选 structure,再用 memory 补回当前环境的 observation identity。

\lecturefigure{slide-56-graph-inference-plan.jpg}{利用 structural state 与 memory 进行 graph inference}{官方录像手写教学状态 V056;01:06:02}

结构状态与快速绑定的概念流程
def tem_step(structure, action, observation, memory):
    next_structure = transition_model(structure, action)
    content = content_encoder(observation)
    conjunctive = bind(next_structure, content)
    memory.write(conjunctive)
    recalled = memory.read(next_structure)
    return next_structure, recalled

\teachervoice{Will 把目标描述成“结构慢学、内容快绑”。这与前半 SDM 的 address/value 分离形成呼应:structure 像可迁移 address system,sensory content 像要写入的 value,hippocampal memory 则把二者临时结合。}

Grid-like code 与快速适应

Grid-code 两页比较模型 representation 与神经数据中常见的 periodic spatial pattern;learning curve 页显示 agent 在少量访问后迅速改善。正确结论是结构化 recurrent state 与任务训练可以产生 grid-like basis,并支持快速 map learning。它不意味着每个 hidden unit 都对应真实 grid cell,也不证明六角格是唯一可行编码。

\lecturefigure{slide-57-grid-code-evidence.jpg}{TEM 中出现的 grid-like representations}{官方录像手写教学状态 V057;01:08:26}

\lecturefigure{slide-58-grid-code-summary.jpg}{模型与 neural grid codes 的结构比较}{官方录像手写教学状态 V058;01:09:36}

\lecturefigure{slide-59-quick-learning-result.jpg}{在少量节点访问后快速提升的学习曲线}{官方录像手写教学状态 V059;01:10:48}

读图:grid-like 不只看“像不像六边形”

应检查 firing field 的周期性、方向、尺度、相位与环境变化下的稳定性,并比较 population structure。单张热图出现重复斑点可能来自平滑、边界或训练数据;只有多项几何统计与任务因果一致,才是更强证据。

本章小结

TEM 用 content stream、structural recurrent state 与 fast associative memory 实现快速地图学习。结构表示跨环境复用,新的 observation 被快速绑定,memory 支持 graph inference。Grid-like code 和 few-visit learning 是功能证据,但不能被写成解剖身份。

TEM 为什么“看起来像 Transformer”

第二讲最后把 hippocampal associative memory 改写为 modern Hopfield network。现代 Hopfield update 与 softmax attention 共享指数相似度和 value 加权,因此 TEM 的 memory read 可以直接用 query、keys、values 表达。这个 reformulation 不只是一种类比,还改善 outer-product binding 的维度扩张,并允许额外 context 作为独立输入。

从 TEM equation 到 Attention update

第一张手写页把 TEM 的 recurrent/associative update 与 Transformer 公式并列。设当前 cue 为 \(q_t\),历史 memory keys 为 \(K=[k_1,\ldots,k_t]\),values 为 \(V=[v_1,\ldots,v_t]\),则现代记忆读出为 $$ m_t=V\operatorname{softmax}(\beta K^{\top}q_t). $$ 其中 \(q_t\) 是当前 hippocampal/structural cue,\(k_\tau\) 是过去 memory address,\(v_\tau\) 是要召回的 bound content。若只允许 \(\tau\le t\),它也具备 causal attention 的时间约束。

\lecturefigure{slide-60-tem-transformer-equation.jpg}{把 TEM memory update 改写为 Transformer-like equation}{官方录像手写教学状态 V060;01:11:52}

\lecturefigure{slide-61-attention-query-retrieval.jpg}{Query、keys、values 视角下的 associative recall}{官方录像手写教学状态 V061;01:12:34}

Modern Hopfield 与 Attention 的共同计算

当前 neural state 是 query,已存 memories 提供 keys 与 values,dot product 衡量相似度,softmax 选择并混合 memories。差别更多来自表示如何产生、memory 生命周期、训练目标与生物实现,而不是 read equation 的表面形式。

Relational memory 的更新步骤

长手写页把流程拆成 key/query 生成、value encoding、causal mask、memory retrieval 与 recurrent state update。这里的 positional encoding 不是固定 sinusoid,而是 transition model 更新的 structural state;它带有环境 graph 的 inductive bias,因此一个 attention layer 就可能完成普通 Transformer 需要多层学习的关系推理。

\lecturefigure{slide-62-relational-memory-steps.jpg}{Relational memory 的 key/query/value 与 recurrent update}{官方录像手写教学状态 V062;01:14:56}

术语消化:positional encoding 在两种系统中不同

标准 Transformer 常把 sequence index 编成位置;TEM 的 \(g_t\) 更像由 action 累积得到的 latent graph position。两者都让相同 content 在不同结构位置产生不同表示,但 TEM 的位置更新由 transition dynamics 明确约束,归纳偏置更强。

Classic 与 modern Hopfield memory

Neural-memory-softmax 页回顾:classic Hopfield 通过 recurrent energy descent 召回最接近 attractor,容量与干扰受限;modern Hopfield 使用指数相似度和显式 memory patterns,更新式近似 attention,并显著提高容量。课程利用的正是后者,而不是说所有 biological hippocampal recurrence 都使用 softmax。

\lecturefigure{slide-63-neural-memory-softmax.jpg}{Modern Hopfield memory 的 softmax retrieval}{官方录像手写教学状态 V063;01:15:22}

可用一个统一能量直觉表示: $$ E(q)=-\frac{1}{\beta}\log\sum_{\mu}\exp(\beta k_\mu^{\top}q) +\frac{1}{2}|q|^2. $$ 其中第一项鼓励 \(q\) 接近某些 stored patterns,第二项约束状态大小。对能量做更新会得到 softmax-weighted memory combination。该式解释为何 memory capacity 与 retrieval sharpness 可以通过指数 kernel 改变。

架构对应、缩放收益与限制

Comparison 页把 LEC、MEC、hippocampus 与 content encoder、recurrent position state、attention memory 对齐;analysis 页继续比较 graph transitions 与 attention paths。Modern Hopfield 版本避免对 content 与 position 做巨大 outer product 再 flatten,额外 context 也可作为一个新输入流加入,复杂度从乘法式维度膨胀转向多路向量的近线性组合。

\lecturefigure{slide-64-tem-transformer-comparison.jpg}{TEM 与 Transformer-like components 的功能对应}{官方录像手写教学状态 V064;01:17:46}

\lecturefigure{slide-65-tem-analysis-diagrams.jpg}{对 TEM/Transformer correspondence 的结构分析}{官方录像手写教学状态 V065;01:18:20}

\teachervoice{Will 的结论非常克制:强 inductive bias 让任务更容易,因此一层 attention 就够;这不是证明“一层 Transformer 解决一切”。他把价值放在可解释性、神经预测、代码加速和额外 context 的可扩展绑定上。}

强归纳偏置带来的双面性

若任务真由稳定 graph transition 和快速 content binding 构成,TEM 很高效;若结构本身频繁变化、动作不可观测或内容与结构强耦合,固定 factorization 可能成为错误偏置。与通用 Transformer 比较时必须匹配任务范围,而不是只比较层数。

结论与 Grid-cell Q&A

结论页总结双向收益:AI 的 modern memory 给 TEM 更好的 scaling 和实现;neuroscience 的 recurrent position code、content/structure separation 与 grid-like state 为 Transformer 设计和解释提供假设。最后 Q&A 解释单个 grid cell 如何通过 electrode spike sorting 测得,不同 cells 可共享尺度/方向但相位平移,并形成多个 lattice-scale modules。

\lecturefigure{slide-66-conclusions.jpg}{第二讲结论:Neuroscience 与 AI 的双向关系}{官方录像手写教学状态 V066;01:19:42}

\teachervoice{学生问 grid template 是 evolution 还是 learning 的产物。Will 回答其规则结构在幼年动物中很早出现,显示强 developmental/evolutionary bias,但系统是否可被其他 relational tasks co-opt、灵活到什么程度仍不清楚。这个不确定性比一句“grid cells 是位置编码”更有教学价值。}

本章小结

Modern Hopfield retrieval 把 TEM memory 写成 attention:当前 state 是 query,历史 conjunctive memories 提供 keys/values,softmax 完成召回。Recurrent structural code 类似任务化 positional encoding。相似性产生可解释桥梁和实现收益,但 TEM 的强结构偏置、短任务范围与神经假设都限制了外推。

总结与延伸

两段讲座从不同方向解释 Transformer-like computation。SDM 路线从高维几何出发:distributed addresses 的 intersection count 近似指数相似度,进而得到 softmax retrieval;cerebellar circuit 提供候选 read/write implementation。TEM 路线从认知需求出发:分离 reusable structure 与 changing content,用 fast associative memory 绑定,再把 memory read 改写成 modern Hopfield attention。

两条路线的统一比较

下面的表不是把 cerebellum 与 hippocampus 合并成一个脑模型,而是比较它们分别解释 attention 的哪一部分。第一讲更关注 weighting kernel 与存储几何,第二讲更关注 positional/structural state、rapid binding 与 compositional inference。二者共同强调 key/content separation、distributed memory 与 uncertainty about biological implementation。

路线 主要问题 Transformer 对应 最强证据
SDM geometry noisy query 怎样按相似度召回记忆 softmax attention weights 高维交集近似与数值实验
Cerebellar mapping 神经电路怎样分离激活、写入与读出 keys/values 与 pooled retrieval 解剖可实现性和候选实验
Cognitive map / TEM 怎样复用关系结构并快速绑定新内容 recurrent position state + memory 行为、模型与神经表征比较
Modern Hopfield TEM associative read 怎样扩容并接入 context query/key/value attention 公式 correspondence 与实现收益

课程真正的“neuroscience-inspired”方法

不是复制某个脑区名字,而是先找计算问题,再提出具有明确 inductive bias 的模型,最后在数学、任务行为、内部表征、神经数据和干预实验之间建立可证伪联系。Brain analogy 只有能生成新预测时才比隐喻更有价值。

对 Transformer 研究的六条启示

  1. 解释 softmax 的几何条件。 检查 norm、temperature、dimension 与 approximation region,而不是把 softmax 当神秘默认值。
  2. 区分短期 pattern memory 与长期 distributed memory。 Context precision 和 parameter capacity 面临不同干扰与可追溯性。
  3. 把 key 与 value 分离写清楚。 匹配线索和返回内容不同,是 attention、SDM 和 hippocampal binding 的共同机制。
  4. 让位置表示反映任务结构。 Sequence index 只是最简单结构;graph transition、action 与 relational state 可提供更强 positional dynamics。
  5. 为快速绑定保留 fast state。 新环境内容不应总靠慢速参数更新,memory/fast weights 可承担 episode-specific knowledge。
  6. 把 biological plausibility 变成实验。 说明要记录哪些 cell、何时写入、怎样干预、什么结果会否定 mapping。

本讲最容易被夸大的三句话

“Attention approximates SDM”不等于 attention 与 SDM 在所有参数下完全相同;“小脑可实现 SDM”不等于小脑被证实运行 Transformer;“TEM 约等于 Transformer”不等于 hippocampus 是语言模型。每句话都必须附上比较层级、假设和反例空间。

拓展阅读

阅读时可以固定同一套检查表:计算对象是什么、表示如何因子化、memory 如何写入/读取、哪些等价是 exact/approximate、哪些结果来自模型、哪些来自 neural data、什么实验能否定 mapping。这样才能把 neuroscience 转化为模型设计与科学预测,而不是给已有架构贴脑区标签。