跳到主要内容
起居室老虎
返回

Nested Learning: The Illusion of Deep Learning Architectures

3,565 字约 13 分钟

原文:arXiv:2512.24695 · Behrouz et al., NeurIPS 2025

摘要: 在过去的几十年里,开发更强大的神经网络架构,并同时设计能够有效训练这些架构的优化算法,一直是提升机器学习模型能力的研究核心。尽管近年来取得了显著进展,尤其是在语言模型的发展方面,关于这类模型如何持续地学习/记忆、实现自我改进,并找到 “有效解” 等问题,依然存在根本性的挑战与未解之谜。本文提出一种新的学习范式 Nested Learning,它将一个模型一致地表示为一组嵌套的、多层级的和/或并行的优化问题,每个问题都拥有其自身的 “context flow”。NL 揭示了现有深度学习方法是如何通过压缩其自身的 context flow 来从数据中学习,并解释了 in-context learning 在大模型中如何涌现。NL 进一步指出了一条路径,即通过引入更多 “层级” 来设计更具表达力的学习算法,从而获得更高阶的 in-context learning 能力。除了在神经科学上具有合理性、在数学上具备白盒特性之外,我们通过三项核心贡献来强调 NL 的重要性:1. Deep Optimizers:基于 NL,我们表明,广为人知的基于梯度的优化器(如 Adam、SGD with Momentum 等)其实是以梯度下降对梯度进行压缩的关联记忆模块。基于这一洞见,我们提出了一组更具表达力的优化器,具备更深的记忆和/或更强的学习规则;2. Self-Modifying Titans:利用 NL 对学习算法的洞见,我们提出一种新型序列模型,它通过学习自身的更新算法来学习如何修改自己;3. Continuum Memory System:我们提出一种新的记忆系统表述,推广了传统关于 “long-term/short-term memory” 的观点。将我们的自修改序列模型与该连续体记忆系统结合,我们提出一个名为 HOPE 的学习模块,并在语言建模、持续学习以及长上下文推理任务上展现出有前景的结果。

1. Intro

image.png

Deep Learning 中堆叠多层网络带来了更大的容量、更强的复杂表征能力,更多的 #FLOPs。“更深” 的网络不一定能在多个方面提升模型的表达能力,如:

  1. 模型的 “计算深度” 不一定随着层数增加,其中很多层数在训练过程中可能会 “消失”/被 bypass,导致它相比于更简单的模型并不能改善表达能力;
  2. 某些参数类别的容量在加深/加宽中出现边际效益递减的情况;
  3. 由于超参数、优化器等各种问题,训练可能熟练到次优解;
  4. 模型的持续学习、新任务的快速适应能力、OOD 数据的泛化能力等不会随着模型的简单堆叠而改善11

为了克服以上挑战、解决问题,当前的工作主要集中在:

  1. 发展更有表达力的神经网络架构;
  2. 提出更贴合任务的目标函数;
  3. 设计更有效的优化算法;
  4. 在架构、目标、优化算法合适的前提下,在规模上进行 scaling 以增强表达性。

这样的研究方案塑造了 Scaling Law,奠定了当前 LLM 的研究基础。LLM 的发展是 Deep Learning 的一个重要里程碑,使得研究范式从面相特定任务的特定模型,转向了更通用的系统,并由此涌现出了多种能力。

然而,LLM 在部署后,大体上仍然是 “静止” 的:它们能很好地执行在 pre-training/post-training 中学到的任务,但很难在即时上下文中获得新的能力。在这个方面,LLM 唯一的能力是它在 in-context learning 中的能力,能够进行 zero-shot/few-shot 的任务。但是这个能力实际上仍然是显然不足的,并且近期尝试克服此问题的方案,要么计算代价高昂、要么依赖外部组件(本质上还是在 scaling 而不是获取新能力)、要么泛化能力不足,或者严重🫡灾难性遗忘的影响。

这促使研究者重新思考:是否需要重新设计 机器学习模型,以及是否需要一种超越 “堆层” 的新学习范式,以在持续学习 情境中真正释放 LLMs 的潜力。 当前模型只 “经历” 即时当下。 为更好地说明 LLM 的静态性,我们借用顺行性遗忘(anterograde amnesia) 的类比——这是一种神经学状况:自发病起,个体无法再形成新的长期记忆,而既有记忆依旧完好。这种状况将个体的知识与体验限制在短窗口的现在与发病之前的久远过去,于是当下不断被体验成 “新的”。当前 LLM 的记忆处理系统存在类似的模式:它们的知识要么局限于可装入其 context window 的即时上下文,要么来自 MLP 层中存储的久远过去(即在 “end of pre-training” 之前)。这一类比促使我们转向神经生理学文献,考察大脑如何巩固短期记忆。

1.1. Human Brain Perspective and Neurophysiological Motivatgion

人脑在做 continual learning 的时候十分高效,一般归结于其 “神经可塑性(neuroplasticity)”。近期研究支持长期记忆的形成至少设计两种相互补充的巩固过程:

  1. 在线巩固(突触巩固),在学习时立刻/很快开始发生;此时,新的、起初脆弱的记忆痕迹得以稳定,并开始从短期转移到长期存储;
  2. 离线巩固(系统巩固),在海马体的 sharp-wave ripples(SWRs,尖波 - 涟漪) 期间反复重放近期编码的模式,并与皮层睡眠纺锤波与慢振荡协调,从而加强与重组记忆,并支持其向皮层部位的转移

回到顺行性遗忘的类比,证据显示该状况会影响这两个阶段,尤其是 “在线” 巩固,主要因为海马体是新陈述性记忆编码的入口,其受损意味着新信息永远无法写入长期记忆。正如上文所述,LLMs——更具体地说,基于 Transformer 的骨干——在 pre-training 结束后呈现出类似情形:上下文中的信息无法影响长期记忆参数22(如前馈层),因此模型无法获得新的知识或技能,除非这些信息仍然保存在短期记忆(如注意力/attention)之中。为此,尽管第二阶段在记忆巩固中同样(或更)关键,其缺失也会破坏过程并可能导致记忆丢失,本文聚焦第一阶段:将记忆巩固视作在线过程。

Notations

输入:x∈ℝN×dinx\in \mathbb R^{N\times d_{in}},MtM_t表示模型在tt时刻的记忆;K,V,QK, V, Q;𝐤𝐭,𝐯𝐭,𝐪𝐭\bold{k_t, v_t, q_t}是对应的列向量;p(f)p(f)是ff的分布,采用带残差连接的简单 MLP 作为记忆模块M(⋅)M(\cdot);θM⊇{W1,W2,...,WLM}\theta_M\supseteq\{W_1, W_2, ..., W_{L_M}\}是参数;W(𝓁)W^{(\mathcal l)}中上标圆括号是不同的层级的参数。

2. Nested Learning

image.png

2.1. Associative Memory

Associative memory——即在事件之间形成并提取连接的能力——是一种基本的心理过程,也是人类学习不可分割的组成部分。

给出以下记忆与学习的定义:

Learning vs. Memorization:
Memory is a neural update caused by an input, and learning is the process for acquiring effective and useful memory.

本文认为,所有的 “Cmoputational Sequence Model”(包括优化器 + 网络本身)都是压缩自身 context flow 的 associative memory system。

定义 Associative Memory: 给定K⊆ℝdkK\subseteq \mathbb R^{d_k}与 V⊆ℝdvV\subseteq \mathbb R^{d_v},associative memory 是一个算子M:K→VM:K\rightarrow V,用来在两者间建立映射。为了学习此映射,引入目标函数ℒˆ(⋅;⋅)\hat{ \mathcal L}(\cdot;\cdot)来度量映射的质量。MM可以定义为:

ℳ∗=arg⁡minℳ⁡ℒ~(ℳ(𝒦);𝒱)\mathcal{M}^{*}=\arg \min _{\mathcal{M}}\tilde{\mathcal{L}}(\mathcal{M}(\mathcal{K}) ; \mathcal{V})

算子本身就是一种记忆,而优化过程就是学习过程。

A Simple Example of MLP Training

考虑在任务τ\tau、数据集𝒟train={x1,...,x|𝒟train|}\mathcal D_\text{train}=\{x_1, ..., x_{|\mathcal D_\text{train}|}\},优化目标ℒ(⋅;⋅)\mathcal L(\cdot;\cdot),优化问题:

W∗=arg⁡minW⁡ℒ(W;𝒟train ),W^{*}=\arg \min _{W} \mathcal{L}\left(W ; \mathcal{D}_{\text {train }}\right),

梯度下降的更新:

Wt+1=Wt−ηt+1∇Wtℒ(Wt;xt+1)=Wt−ηt+1∇yt+1ℒ(Wt;xt+1)⊗xt+1, where xt+1∼𝒟train ,\begin{aligned}W_{t+1} & =W_{t}-\eta_{t+1} \nabla_{W_{t}} \mathcal{L}\left(W_{t} ; x_{t+1}\right) \\& =W_{t}-\eta_{t+1} \nabla_{y_{t+1}} \mathcal{L}\left(W_{t} ; x_{t+1}\right) \otimes x_{t+1}, \quad \text { where } x_{t+1} \sim \mathcal{D}_{\text {train }},\end{aligned}

令ut+1=∇yy+1ℒ(Wt;xt+1)u_{t+1}=\nabla_{y_{y+1}}\mathcal L(W_t;x_{t+1}),反向传播过程就是一个寻找最优的 associative memory,将𝒟train={xt}t=1|𝒟train|\mathcal D_\text{train}=\{x_t\}_{t=1}^{|\mathcal D_\text{train}|}映射到对应的ut+1=∇yy+1ℒ(Wt;xt+1)u_{t+1}=\nabla_{y_{y+1}}\mathcal L(W_t;x_{t+1})。也就是说,令M(⋅)=WtM(\cdot)=W_t,参数化了记忆,点积相似度衡量映射质量,可以写得:

Wt+1=arg⁡minW⁡⟨Wxt+1,ut+1⟩+12ηt+1‖W−Wt‖22=arg⁡minW⁡⟨Wxt,∇yt+1ℒ(Wt;xt+1)⟩+12ηt+1‖W−Wt‖22\begin{aligned}W_{t+1} & =\arg \min _{W}\left\langle W x_{t+1}, u_{t+1}\right\rangle+\frac{1}{2 \eta_{t+1}}\left\|W-W_{t}\right\|_{2}^{2} \\& =\arg \min _{W}\left\langle W x_{t}, \nabla_{y_{t+1}} \mathcal{L}\left(W_{t} ; x_{t+1}\right)\right\rangle+\frac{1}{2 \eta_{t+1}}\left\|W-W_{t}\right\|_{2}^{2}\end{aligned}

ut+1=∇yy+1ℒ(Wt;xt+1)u_{t+1}=\nabla_{y_{y+1}}\mathcal L(W_t;x_{t+1})在上面的公式中类似一种局部的 “惊讶信号”,刻画了当前输出与目标所施加结构的不匹配程度。

因此,这一路径把训练阶段 翻译为:获取一种有效记忆,把数据样本映射到其在表征空间的 LSS (由目标函数施加的结构约束所定义的不匹配)。

进一步地,引入带动量的变体:

Wt+1=Wt−𝐦t+1,𝐦t+1=𝐦t−ηt+1∇Wtℒ(Wt;xt+1)=𝐦t−ηt+1∇yt+1ℒ(Wt;xt+1)⊗xt+1.\begin{array}{l}W_{t+1}=W_{t}-\mathbf{m}_{t+1}, \\\mathbf{m}_{t+1}=\mathbf{m}_{t}-\eta_{t+1} \nabla_{W_{t}} \mathcal{L}\left(W_{t} ; x_{t+1}\right)=\mathbf{m}_{t}-\eta_{t+1} \nabla_{y_{t+1}} \mathcal{L}\left(W_{t} ; x_{t+1}\right) \otimes x_{t+1} .\end{array}

注意到∇Wtℒ(Wt;xt+1)\nabla_{W_t}\mathcal L(W_t;x_{t+1})与递推无关,可以预先计算。令ut+1=∇Wtℒ(Wt;xt+1)u_{t+1}=\nabla_{W_t}\mathcal L(W_t;x_{t+1}),可以进一步:

Wt+1=Wt−𝐦t+1𝐦t+1=arg⁡min𝐦⁡−⟨𝐦,∇Wtℒ(Wt;xt+1)⟩+ηt+1‖𝐦−𝐦t‖22=arg⁡min𝐦⁡−⟨𝐦xt+1,∇yt+1ℒ(Wt;xt+1)⟩+ηt+1‖𝐦−𝐦t‖22\begin{aligned}W_{t+1} & =W_{t}-\mathbf{m}_{t+1} \\\mathbf{m}_{t+1} & =\arg \min _{\mathbf{m}}-\left\langle\mathbf{m}, \nabla_{W_{t}} \mathcal{L}\left(W_{t} ; x_{t+1}\right)\right\rangle+\eta_{t+1}\left\|\mathbf{m}-\mathbf{m}_{t}\right\|_{2}^{2} \\& =\arg \min _{\mathbf{m}}-\left\langle\mathbf{m} x_{t+1}, \nabla_{y_{t+1}} \mathcal{L}\left(W_{t} ; x_{t+1}\right)\right\rangle+\eta_{t+1}\left\|\mathbf{m}-\mathbf{m}_{t}\right\|_{2}^{2}\end{aligned}

优化问题变为一个带自适应学习率ηt+1\eta_{t+1}的梯度下降过程。动量项可以解释为:

  1. 一个无 key 的 associative memory,将梯度压缩到它的参数中,或是
  2. 一个学习将数据点映射到对应的 LSS-Value 上的 associative memory。

可以看到带动量的训练本身形成量两层优化过程,即又有优化自己本身的记忆,还有 “优化优化记忆的过程”(即调整动量/自适应学习率)的优化过程。

归纳上述的描述,我们在训练一个 MLP 的过程中:

  1. 纯梯度下降是单层的 associative memory;学习把数据点映射到 LSS 值;
  2. 带动量的梯度下降时两层 associative memory;内层学习把梯度存入其参数,外层使用内层记忆更新 slow weight WtW_t。

尽管这些在架构与优化器层面都是最简单的例子,但我们可以进一步追问:在更复杂的设定下,是否仍能得到相似结论?

An Example of Architectural Decomposition

将 MLP 换成 Linear Attention,更复杂的例子。回顾一下 Linear Attention:

𝐤t=xtW𝐤,𝐯t=xtW𝐯,𝐪t=xtW𝐪ℳt=ℳt−1+𝐯t𝐤t⊤yt=ℳt𝐪t\begin{array}{l}\mathbf{k}_{t}=x_{t} W_{\mathbf{k}}, \quad \mathbf{v}_{t}=x_{t} W_{\mathbf{v}}, \quad \mathbf{q}_{t}=x_{t} W_{\mathbf{q}} \\\mathcal{M}_{t}=\mathcal{M}_{t-1}+\mathbf{v}_{t} \mathbf{k}_{t}^{\top} \\y_{t}=\mathcal{M}_{t} \mathbf{q}_{t}\end{array}

MtM_t也可以理解为一个 associative memoryMt(⋅)M_t(\cdot)的优化过程,目标是将 key 和 value 的映射压缩到参数中。更具体地,若令ℒˆ(ℳt−1;kt,vt):=−⟨ℳt−1kt,vt⟩\hat{\mathcal L}(\mathcal M_{t-1};k_t, v_t):=-\langle \mathcal M_{t-1}k_t, v_t\rangle,并用梯度下降优化该记忆,设ηt=1,∇ℒˆ(ℳt−1;kt,vt)\eta_t=1, \nabla\hat{\mathcal L}(\mathcal M_{t-1};k_t, v_t),则记忆更新的过程为:

ℳt+1=arg⁡minℳ⁡⟨ℳ𝐤t+1,𝐯t+1⟩+‖ℳ−ℳt‖22 with gradient descent ,⇒ℳt+1=ℳt−∇ℒ~(ℳt;𝐤t+1,𝐯t+1)=ℳt+𝐯t+1𝐤t+1⊤,\begin{aligned}\mathcal{M}_{t+1} & =\arg \min _{\mathcal{M}}\left\langle\mathcal{M} \mathbf{k}_{t+1}, \mathbf{v}_{t+1}\right\rangle+\left\|\mathcal{M}-\mathcal{M}_{t}\right\|_{2}^{2} \quad \text { with gradient descent }, \\\Rightarrow \mathcal{M}_{t+1} & =\mathcal{M}_{t}-\nabla \tilde{\mathcal{L}}\left(\mathcal{M}_{t} ; \mathbf{k}_{t+1}, \mathbf{v}_{t+1}\right)=\mathcal{M}_{t}+\mathbf{v}_{t+1} \mathbf{k}_{t+1}^{\top},\end{aligned}

和上面的式子形式相同,可以看到 Linear Attention 本身的 memory 就也可以看作是一种 associative memory 更新的过程。

2.2. Nested Optimization Problems

受脑电节律层级启发——不同脑区的信息处理具有不同频率——我们用各个优化问题的更新速率来在多层级中为组件排序。为此,我们令 “对单个数据点的一次更新” 为时间单位,从而提出:

定义 2 Update Frequency:对于任意组件AA(不管是带参数 weight/动量,的还是非参数化的如 attention block),定义单位时间内该组件的更新次数为它的频率fAf_A。

拥有频率后可以进一步定义偏序关系(⋅≻⋅)(\cdot \succ \cdot),A≻BA \succ B表示fA≥fBf_A\ge f_B,但若fA=fBf_A=f_B时,时刻tt计算BB的状态需要计算AA的状态,则A⊁B,B⊁AA\nsucc B , B\nsucc A,记作A=BA=B。

据此操作,可以将组件分入一个有序层级集合中:

  1. 同一层内的组件具有相同的更新频率;
  2. 层级越高,更新频率越低。

基于上述嵌套学习问题的定义,我们将 Neural Learning Module 定义为一种新的模型表征方式:它把一个机器学习模型表示为由相互连接的组件构成的系统,且每个组件都有其独立的梯度流。需要强调的是,这与 deep learning 是正交的:nested learning 允许我们定义层级更多的神经学习模型,从而得到更具表达力的架构。 Nested learning allows computational models that are composed of multiple (multi-layer) levels to learn from and process data with different levels of abstractino and time-scales.

2.3. Optimizers as Learning Modules

回顾带动量的梯度下降:

Wi+1=Wi+𝐦i+1𝐦i+1=αi+1𝐦i−ηt∇ℒ(Wi;xi)\begin{aligned}W_{i+1} & =W_{i}+\mathbf{m}_{i+1} \\\mathbf{m}_{i+1} & =\alpha_{i+1} \mathbf{m}_{i}-\eta_{t} \nabla \mathcal{L}\left(W_{i} ; x_{i}\right)\end{aligned}

其中𝐦i\bold m_i时状态ii下的动量,αi,ηi\alpha_i, \eta_i分别是自适应的学习率和动量。令αi+1=1\alpha_{i+1}=1的假设下,动量项是

min𝐦⁡⟨𝐦∇ℒ(Wi;xi)⊤,𝐈⟩.\min _{\mathbf{m}}\left\langle\mathbf{m} \nabla \mathcal{L}\left(W_{i} ; x_{i}\right)^{\top}, \mathbf{I}\right\rangle .

的梯度下降的优化结果,即动量本身是一个 meta memory,学习如何将目标函数的梯度记忆到自己的参数重。

Extention: More Expressive Association

考虑到动量是一个没有 value 相关的 associative memory,一个直观的提升其表达能力的方法是让 value 参数vi=Piv_i=P_i,动量进一步变成最小化

min𝐦⁡⟨𝐦∇ℒ(Wi;xi)⊤,𝐏i⟩,\min _{\mathbf{m}}\left\langle\mathbf{m} \nabla \mathcal{L}\left(W_{i} ; x_{i}\right)^{\top}, \mathbf{P}_{i}\right\rangle,

的问题。梯度下降的视角下更新写作:

Wi+1=Wi+𝐦i+1𝐦i+1=αi+1𝐦i−ηt𝐏i∇ℒ(Wi;xi).\begin{array}{l}W_{i+1}=W_{i}+\mathbf{m}_{i+1} \\\mathbf{m}_{i+1}=\alpha_{i+1} \mathbf{m}_{i}-\eta_{t} \mathbf{P}_{i} \nabla \mathcal{L}\left(W_{i} ; x_{i}\right) .\end{array}

等价于在 momentum GD 中引入了 preconditioning。

实际上,预条件化意味着:动量项是一个关联记忆,学习如何将PiP_i和∇ℒ(Wi;xi)\nabla\mathcal L(W_i;x_i)之间的映射压缩到其参数中。哪怕使用 “合理” 的(例如 random features)预条件化,也能改进 “原始版、无 value 的动量记忆”(即把所有梯度映射到同一个 value)的表达性;而上述视角进一步提示:什么样的预条件化更有用——动量作为记忆要把梯度映射到相应的 values,因此 “梯度的函数”(例如包含 Hessian 信息)能为记忆提供更有意义的映射。

Extention: More Expressive Objectives

点积相似度可能不够好,一个自然的修改是改用 L2 Loss 优化‖𝐦∇ℒ(Wi;xi)⊤−𝐏i‖22\left\|\mathbf{m} \nabla \mathcal{L}\left(W_{i} ; x_{i}\right)^{\top}-\mathbf{P}_{i}\right\|_{2}^{2}:

Wi+1=Wi+𝐦i+1𝐦i+1=(αi+1𝐈−∇ℒ(Wi;xi)⊤∇ℒ(Wi;xi))𝐦i−ηt𝐏i∇ℒ(Wi;xi),\begin{array}{l} W_{i+1}=W_{i}+\mathbf{m}_{i+1} \\ \mathbf{m}_{i+1}=\left(\alpha_{i+1} \mathbf{I}-\nabla \mathcal{L}\left(W_{i} ; x_{i}\right)^{\top} \nabla \mathcal{L}\left(W_{i} ; x_{i}\right)\right) \mathbf{m}_{i}-\eta_{t} \mathbf{P}_{i} \nabla \mathcal{L}\left(W_{i} ; x_{i}\right), \end{array}

这个更新由 Hebbian 规则变成 Delta-Rule,更有效管理动量记忆的优先容量。

Extention: More Expressive Memory

将一个 memory 换成 MLP 等,可以扩展:

Wi+1=Wi+𝐦i+1(𝐮i),𝐦i+1=αi+1𝐦i−ηt∇ℒ(2)(𝐦i;𝐮i,𝐈),W_{i+1}=W_{i}+\mathbf{m}_{i+1}\left(\mathbf{u}_{i}\right),\\\mathbf{m}_{i+1}=\alpha_{i+1} \mathbf{m}_{i}-\eta_{t} \nabla \mathcal{L}^{(2)}\left(\mathbf{m}_{i} ; \mathbf{u}_{i}, \mathbf{I}\right),

其中ui=∇ℒ(Wi;xi)u_i=\nabla\mathcal L(W_i;x_i),∇ℒ(2)(⋅)\nabla\mathcal L^{(2)}(\cdot)是动量的内层目标,这个变体称为 Deep Momentum Gradient Descent。

Extention: None Linear Outputs

进一步在动量记忆上叠加非线性,即

Wi+1=Wi+σ(𝐦i+1(𝐮i)),𝐦i+1=αi+1𝐦i−ηt∇ℒ(2)(𝐦i;𝐮i,𝐈),W_{i+1}=W_{i}+\sigma\left(\mathbf{m}_{i+1}\left(\mathbf{u}_{i}\right)\right), \\ \mathbf{m}_{i+1}=\alpha_{i+1} \mathbf{m}_{i}-\eta_{t} \nabla \mathcal{L}^{(2)}\left(\mathbf{m}_{i} ; \mathbf{u}_{i}, \mathbf{I}\right),

如果取σ(⋅)=Newton-Schulz(⋅)\sigma(\cdot)=\text{Newton-Schulz}(\cdot),就变成 Muon 优化器。

Going Beyond Simple Backpropagation

Wt+1=Wt−ηt+1∇Wtℒ(Wt;xt)=Wt−ηt+1∇ytℒ(Wt;xt)⊗xt, where xt∼𝒟train \begin{align*}W_{t+1}&=W_{t}-\eta_{t+1} \nabla_{W_{t}} \mathcal{L}\left(W_{t} ; x_{t}\right)\\&=W_{t}-\eta_{t+1} \nabla_{y_{t}} \mathcal{L}\left(W_{t} ; x_{t}\right) \otimes x_{t}, \quad \text { where } x_{t} \sim \mathcal{D}_{\text {train }}\end{align*}

从关联记忆的角度,等于对

minW⁡⟨Wxt,∇ytℒ(Wt;xt)⟩.\min _{W}\left\langle W x_{t}, \nabla_{y_{t}} \mathcal{L}\left(W_{t} ; x_{t}\right)\right\rangle .

做一步梯度下降,但是相当于没有考虑到xtx_t和其他样本之间的关系,可以改写为:

minW⁡‖Wxt−∇ytℒ(Wt;xt)‖22\min _{W}\left\|W x_{t}-\nabla_{y_{t}} \mathcal{L}\left(W_{t} ; x_{t}\right)\right\|_{2}^{2}

对应的梯度下降:

Wt+1=Wt(𝐈−xtxt⊤)−ηt+1∇Wtℒ(Wt;xt)=Wt(𝐈−xtxt⊤)−ηt+1∇ytℒ(Wt;xt)⊗xt, where xt∼𝒟train ,\begin{aligned}W_{t+1} & =W_{t}\left(\mathbf{I}-x_{t} x_{t}^{\top}\right)-\eta_{t+1} \nabla_{W_{t}} \mathcal{L}\left(W_{t} ; x_{t}\right) \\& =W_{t}\left(\mathbf{I}-x_{t} x_{t}^{\top}\right)-\eta_{t+1} \nabla_{y_{t}} \mathcal{L}\left(W_{t} ; x_{t}\right) \otimes x_{t}, \quad \text { where } x_{t} \sim \mathcal{D}_{\text {train }},\end{aligned}

后文提出的 HOPE 架构就使用这个方法作为对应的内部优化器。

3. HOPE: A Self-Referential Learning Module with Continuum Memory

image.png

正文内容全在附录里,问题是 Open Review 上也看不到附录啊

4. Experiments

image.png

前面那些故事讲的太久了,但说实话真的没什么新的东西,内容在现在 Linear Attention/Test Time Training 社区里面讲过很久了。benchmark 也没什么和 Continual Learning 相关的。

脚注

  1. 对吗?只考虑 OOD 的话似乎和现在的 scale up 的想法是相冲突的。 ↩

  2. 这个角度似乎也是 Test Time Training/Linear Attention 可以进行例证说明的部分,Fast Weight 也是一种短期记忆。 ↩