跳到主要内容
起居室老虎
返回

Kimi Linear: An Expressive, Efficient Attention Architecture

4,873 字约 18 分钟

原文:arXiv:2510.26692 · Zhang et al., 2025

摘要:我们提出了 Kimi Linear,这是一种混合型线性注意力架构。在公平对比下,它首次在多种场景(包括短上下文、长上下文,以及强化学习(RL)扩展范式)中超越了全注意力(full attention)。其核心是 Kimi Delta Attention(KDA):一个具有强表达能力的线性注意力模块。KDA 以更细粒度的门控机制扩展了 Gated DeltaNet,使有限状态 RNN 的 “记忆”(memory)得以更高效地利用。我们定制的分块式(chunkwise)算法采用 Diagonal-Plus-LowRank(DPLR) 转移矩阵的特化变体,实现了高硬件效率;与通用 DPLR 形式相比,它显著降低计算量,同时与经典的 delta 规则更加一致。我们基于逐层混合的 KDA 与 Multi-Head Latent Attention(MLA) 预训练了一个 Kimi Linear 模型,具有 3B 激活参数与 48B 总参数。实验表明,在相同训练配方下,Kimi Linear 在所有评测任务上均以显著优势超过纯 MLA;同时 KV 缓存占用最多可降低 75%,在 1M 上下文下的解码 吞吐最高可达 6×。这些结果表明,Kimi Linear 可以作为全注意力架构的 即插即用替代方案,在性能与效率上更优,且适用于更长输入与输出长度的任务。为支持进一步研究,我们开源了 KDA 内核与 vLLM 实现,并发布了 预训练与指令微调的模型检查点。

1. Intro

Transformer 在推理阶段的瓶颈越来越限制,包括在做 RL/长文本任务的时候,Test Time Scaling 的需求非常高。Linear Attention 提供了一条系统化的降低复杂度的路径,但表达力受限。近日,这种差距逐渐缩小,主要得益于:

但是纯 Linear Attention 结构的方法从根本上受限于有限状态容量,因此理论上使得长序列建模与上下文内检索任务在 Linear Attention 上依旧是受限的。为了解决这种问题,结合 softmax 与线性注意力的混合架构是一种综合效率与质量的选择。

先前的混合架构工作规模受限、缺乏完整的研究和评测。

关键挑战依旧在于:设计一种在质量上能匹配或超越全注意力,同时在速度与内存上实现显著效率收益的注意力架构——这对支撑新一代以智能体与重解码为特征的 LLM 至关重要。

本文提出 Kimi Linear,是一种为满足智能体与 Test Time Scaling 需求而设计、且不牺牲质量的混合线性注意力架构。核心是 Kimi Delta Attention(KDA),一个硬件高效的线性注意力模块。KDA 以更细的 Gating 机制扩展了 Gated DeltaNet。Mamba2 采用 head-wise 的遗忘门,而 KDA 则采用 Channel-wise 的变体。这种细粒度设计能更精确地调控有限状态 RNN 的记忆,从而释放 RNN 风格模型在混合架构中的潜力。

进一步地,KDA 引入了对角 + 低秩(DPLR)的一种特化变体,参数化其状态转移算法,实现了一个定制的 chunkwise parallel 算法,显著减少计算量的同时与经典的 Delta Rule 保持一致。

Kimi Linear 采用经典的 3:1 固定比例将 KDA 和 Full Attention 交替排列。在长序列任务重使得 KV Cache 的使用量降低最高 75%,同时保留全局信息流。通过与训练与评测,Kimi Linear 在短上下文、长上下文、RL Post-training 上都能稳定地匹配活超越强力的 Full Attention Baseline,并在 1M 上下文长度下实现了最高6×6\times的 Decode 吞吐提升。

Contributions:

image.png

2. Preliminary

2.1. Notation

记□t∈ℝdk/ℝdv,s.t.,□∈{𝐪,𝐤,𝐯,𝐨,𝐮,𝐰}\square_t\in \mathbb R^{d_k}/\mathbb R^{d_v}, \text{s.t.}, \square\in\{\bold{q, k, v, o, u, w}\}s 的第tt列;St∈ℝdk×dvS_t\in \mathbb R^{d_k\times d_v}是 Hidden State/记忆状态;𝐌,𝐌−\bold M, \bold M^-是包含/不包含对角线的下三角矩阵掩码,分别写作 Tril 和 StrictTril。

Chunk-wise Formulation

假设将序列分为L/CL/C个分块,每块长度为CC。定义□[t]∈ℝC×d,□∈{𝐐,𝐊,𝐕,𝐎,𝐔,𝐖}\square_{[t]}\in \mathbb R^{C\times d}, \square \in \{\bold{Q, K, V, O, U, W}\}是对应分块内所有的列向量形成的矩阵,记□[t]r=□tC+r\square_{[t]}^r=\square_{tC+r},注意需要t∈[0,L/C),r∈[1,C]t\in [0, L/C),r\in[1, C]。另外,约定S[t]:=S[t]0=S[t−1]CS[t]:=S^0_{[t]}=S^C_{[t-1]},即一个分块的起始元素是上个分块的结束元素。

Decay Formulation

定义累计衰减:γ[t]i→j:=∏k=ijα[t]k\gamma_{[t]}^{i\rightarrow j}:=\prod^j_{k=i}\alpha^k_{[t]},简写γ[t]1→r:=γ[t]r\gamma^{1\rightarrow r}_{[t]}:=\gamma^r_{[t]}。另外地,记A[t]:=A[t]i/j∈ℝC×CA[t]:=A^{i/j}_{[t]}\in\mathbb R^{C\times C},是γ[t]i/γ[t]j\gamma^i_{[t]}/\gamma^j_{[t]}构成的矩阵。Diag(αt)\text{Diag}(\alpha_t)表示细粒度衰减的对角矩阵,且Diag(γ[t]i→j):=∏k=1jDiag(α[t]k)\text{Diag}(\gamma_{[t]}^{i\rightarrow j}):=\prod^j_{k=1}\text{Diag}(\alpha^k_{[t]}),Γ[t]i→j∈ℝC×dk\Gamma^{i\rightarrow j}_{[t]}\in \mathbb R^{C\times d_k}是从γ[t]i\gamma^i_{[t]}到γ[t]j\gamma^j_{[t]}形成的堆叠矩阵。

2.2. Linear Attention and the Gated Delta Rule

Linear Attention as Online Learning

Linear Attention 维护一组矩阵状态,累计 Key-Value 关联:

St=St−1+ktvt⊤,ot=St⊤qt.S_t=S_{t-1}+k_tv_t^\top,\quad o_t=S_t^\top q_t.

从 Fast weight 角度,StS_t作为 associative memory,存储 key 到 value 的瞬时映射,更新等驾驭对 unbounded correlation objective 做一次梯度下降:

ℒt(S)=−⟨S⊤kt,vt⟩\mathcal L_t(S)=-\langle S^\top k_t, v_t \rangle

不断强化最近一次 key-value 对,但不能遗忘之前的内容导致对上下文造成干扰。

DeltaNet: Onlinen Gradient Descent on Reconstruction Loss

DeltaNet 进一步扩展到:

ℒt(S)=12||S⊤kt−vt||2\mathcal L_t(S)=\frac{1}{2}||S^\top k_t-v_t||^2

以学习率βt\beta_t进行一步更新:

St=St−1−βt∇Sℒt(St−1)=(I−βtktkt⊤)St−1+βtktvt⊤S_t=S_{t-1}-\beta_t\nabla_S\mathcal L_t(S_{t-1})=(I-\beta_tk_tk_t^\top)S_{t-1}+\beta_tk_tv_t^\top

就是最经典的 DeltaRule。这种更新结构是广义 Householder 变换,支持硬件高效的分块并行化。

Gated DeltaNet as Weight Decay

Gated DeltaNet 引入标量遗忘门αt∈[0,1]\alpha_t\in[0, 1],得到:

St=αt(I−βtktkt⊤)St−1+βtktvt⊤S_t=\alpha_t(I-\beta_tk_tk^\top_t)S_{t-1}+\beta_tk_tv_t^\top

αt\alpha_t对 Fast Weight 做了类似 weight decay 的作用,提供了有效的遗忘机制。另一个角度来说,GDN 也可被视为一种乘性位置编码:其状态转移矩阵数据依赖且可学习,从而放宽了 RoPE 的正交性约束。

3. Kimi Delta Attention: Improving Delta Rule with Fine-grained Gating

我们提出 Kimi Delta Attention,这是一种新的 Gating Linear Attention 变体,将 Gated Delta Net 的标量 decay 替换对对角化的细粒度 GatingDiag(αt)\text{Diag}(\alpha_t),从而对记忆衰减和位置感知进行更细粒度的控制。

KDA 的递推与读出为:

St=(I−βtktkt⊤)Diag(αt)St−1+βtktvt⊤∈ℝdk×dv,ot=St⊤qt∈ℝdvS_t=\Big(I-\beta_t k_t k_t^\top\Big)\mathrm{Diag}(\alpha_t)S_{t-1}+\beta_t k_t v_t^\top\in\mathbb{R}^{d_k\times d_v},\\ o_t=S_t^\top q_t\in\mathbb{R}^{d_v}

image.png

3.1. Hardware-Efficient Chunkwise Algorithm

将上面的递推按照分块的模式下部分展开,可以得到:

Sr[t]=∏i=1r(I−βi[t],ki[t]ki[t]⊤)Diag(αi[t])⏟Pr[t]S0[t]+∑i=1r(∏j=i+1r!(I−βj[t]kj[t]kj[t]⊤)Diag(αj[t]))βi[t]ki[t]vi[t]⊤⏟:=Hr[t]. \begin{aligned} S_r[t] &=\underbrace{\prod_{i=1}^{r}\Big(I-\beta_i[t],k_i[t]k_i[t]^\top\Big)\mathrm{Diag}\big(\alpha_i[t]\big)}_{P_r[t]}S_0[t]\\ &+\underbrace{\sum{i=1}^{r}\left(\prod_{j=i+1}^{r}!\Big(I-\beta_j[t]k_j[t]k_j[t]^\top\Big)\mathrm{Diag}\big(\alpha_j[t]\big)\right)\beta_i[t]k_i[t]v_i[t]^\top}_{:=H_r[t]}. \end{aligned}

WY Representation

WYB 表示经常用来打包表示一系列的 rank-1 更新。遵循 Comba 的PP表述,以避免后续额外的矩阵求逆:

Pr[t]=Diag(γ[t]r)−∑i=1rDiag(γ[t]i→r)ki[t]wi[t]⊤,Hr[t]=∑i=1rDiag(γ[t]i→r)ki[t]ui[t]⊤.\begin{aligned} P_r[t]&=\mathrm{Diag}\big(\gamma^r_{[t]}\big)-\sum_{i=1}^{r}\mathrm{Diag}\big(\gamma^{i\to r}_{[t]}\big)k_i[t]w_i[t]^\top,\\ H_r[t]&=\sum_{i=1}^{r}\mathrm{Diag}\big(\gamma^{i\to r}_{[t]}\big)k_i[t]u_i[t]^\top. \end{aligned}

其中的辅助向量wt∈ℝdk,ut∈ℝdvw_t\in \mathbb R^{d_k}, u_t\in \mathbb R^{d_v}:

w[t]r=β[t]r(Diag(γ[t]r)k[t]r−∑i=1r−1wi[t](k[t]i⊤Diag(γ[t]i→r)k[t]r))w^r_{[t]}=\beta^r_{[t]}\left(\mathrm{Diag}\big(\gamma^r_{[t]}\big)k^r_{[t]}-\sum_{i=1}^{r-1} w_i[t]\big(k^{i\top}_{[t]}\mathrm{Diag}\big(\gamma^{i\to r}_{[t]}\big)k^r_{[t]}\big)\right)
u[t]r=β[t]r(v[t]r−∑i=1r−1u[t]i(k[t]i⊤,Diag(γ[t]i→r)k[t]r)) u^r_{[t]}=\beta^r_{[t]}\left(v^r_{[t]}-\sum_{i=1}^{r-1} u^i_{[t]}\big(k^{i\top}_{[t]},\mathrm{Diag}\big(\gamma^{i\to r}_{[t]}\big)k^r_{[t]}\big)\right)

UT Transform

为了减少非矩阵成的 FLOPs、提升训练时的硬件利用率,采用 UT 变换构造三角系统,并用前向代替求拟。

𝐌[t]=(𝐈+StrictTril⁡(Diag⁡(β[t])(Γ[t]1→C⊙𝐊[t])(𝐊[t]Γ[t]1→C)⊤))−1Diag⁡(β[t])𝐖[t]=𝐌[t](Γ[t]1→C⊙𝐊[t]),𝐔[t]=𝐌[t]𝐕[t]\begin{array}{l}\mathbf{M}_{[t]}=\left(\mathbf{I}+\operatorname{StrictTril}\left(\operatorname{Diag}\left(\beta_{[t]}\right)\left(\Gamma_{[t]}^{1 \rightarrow C} \odot \mathbf{K}_{[t]}\right)\left(\frac{\mathbf{K}_{[t]}}{\Gamma_{[t]}^{1 \rightarrow C}}\right)^{\top}\right)\right)^{-1} \operatorname{Diag}\left(\beta_{[t]}\right) \\\mathbf{W}_{[t]}=\mathbf{M}_{[t]}\left(\Gamma_{[t]}^{1 \rightarrow C} \odot \mathbf{K}_{[t]}\right), \quad \mathbf{U}_{[t]}=\mathbf{M}_{[t]} \mathbf{V}_{[t]}\end{array}

相应地,更新也可以写作 chunk-wise 的形式:

𝐒[t+1]=Diag⁡(γ[t]C)𝐒[t]+(Γ[t]i→C⊙𝐊[t])⊤(𝐔[t]−𝐖[t]𝐒[t])∈ℝdk×dv\mathbf{S}_{[t+1]}=\operatorname{Diag}\left(\gamma_{[t]}^{C}\right) \mathbf{S}_{[t]}+\left(\Gamma_{[t]}^{i \rightarrow C} \odot \mathbf{K}_{[t]}\right)^{\top}\left(\mathbf{U}_{[t]}-\mathbf{W}_{[t]} \mathbf{S}_{[t]}\right) \in \mathbb{R}^{d_{k} \times d_{v}}

image.png

而输出阶段,采用块内并行、块间递归的策略,最大化矩阵乘法/Tensor Core 的吞吐:

𝐎[t]=(Γ[t]1→C⊙𝐐[t])𝐒[t]⏟inter chunk +Tril⁡((Γ[t]1→C⊙𝐐[t])(𝐊[t]Γ[t]1]C)⊤)⏟intra chunk (𝐔[t]−𝐖[t]𝐒[t])⏟"pseudo"-value term ∈ℝC×dv\mathbf{O}_{[t]}=\underbrace{\left(\Gamma_{[t]}^{1 \rightarrow C} \odot \mathbf{Q}_{[t]}\right) \mathbf{S}_{[t]}}_{\text {inter chunk }}+\underbrace{\operatorname{Tril}\left(\left(\Gamma_{[t]}^{1 \rightarrow C} \odot \mathbf{Q}_{[t]}\right)\left(\frac{\mathbf{K}_{[t]}}{\Gamma_{[t]}^{1] C}}\right)^{\top}\right)}_{\text {intra chunk }} \underbrace{\left(\mathbf{U}_{[t]}-\mathbf{W}_{[t]} \mathbf{S}_{[t]}\right)}_{\text {"pseudo"-value term }} \in \mathbb{R}^{C \times d_{v}}

image.png

3.2. Efficient Analysis

image.png

表征能力上,KDA 与广义 DPLR 形式St=(D−atbt⊤)St−1+ktvt⊤S_t=(D-a_tb_t^\top)S_{t-1}+k_tv_t^\top等效,二者都体现了细粒度衰减。但细粒度衰减会在某些除法步骤引入数值精度问题。之前的 GLA 等采用对数计算、二级分块且全精度的做法来缓解,但对吞吐影响很大;KDA 通过把a,ba, b都绑定到kk,缓解了该瓶颈。

4. The Kimi Linear Model Architecture

Backbone 遵循 Moonlight,除了细粒度 Gating 之外,还引入了若干组件进一步增强 Kimi Linear 表达能力。

image.png

Neural Parameterization

设xt∈ℝdx_t\in \mathbb R^d是第tt个 token 的输入表达,KDA 每个 headhh的输入:

𝒒th,𝒌th=L2⁡Norm⁡(Swish⁡(Short⁡Conv⁡(𝐖q/kh𝒙t)))∈ℝdk𝒗th=Swish⁡(Short⁡Conv⁡(𝐖vh𝒙t))∈ℝdvαth=f(𝐖α↑𝐖α↓𝒙t)∈[0,1]dkβth=Sigmoid⁡(𝐖βh𝒙t)∈[0,1]\begin{aligned}\boldsymbol{q}_{t}^{h}, \boldsymbol{k}_{t}^{h} & =\operatorname{L2} \operatorname{Norm}\left(\operatorname{Swish}\left(\operatorname{Short} \operatorname{Conv}\left(\mathbf{W}_{q / k}^{h} \boldsymbol{x}_{t}\right)\right)\right) \in \mathbb{R}^{d_{k}} \\\boldsymbol{v}_{t}^{h} & =\operatorname{Swish}\left(\operatorname{Short} \operatorname{Conv}\left(\mathbf{W}_{v}^{h} \boldsymbol{x}_{t}\right)\right) \in \mathbb{R}^{d_{v}} \\\alpha_{t}^{h} & =f\left(\mathbf{W}_{\alpha}^{\uparrow} \mathbf{W}_{\alpha}^{\downarrow} \boldsymbol{x}_{t}\right) \in[0,1]^{d_{k}} \\\beta_{t}^{h} & =\operatorname{Sigmoid}\left(\mathbf{W}_{\beta}^{h} \boldsymbol{x}_{t}\right) \in[0,1]\end{aligned}

试验中dk,dv=128d_k, d_v=128,对𝐪,𝐤,𝐯\bold{q, k, v}都先做 ShortConv 再接 Swish 激活,然后对𝐪,𝐤\bold{q, k}做 L2Norm,提升稳定性。逐通道的遗忘系数αth\alpha_t^h通过 low-rank projection(𝐖α↓,𝐖α↑\bold W^\downarrow_\alpha, \bold W^\uparrow_\alpha的 rank 等于 head 的维度)并配合衰减函数f(⋅)f(\cdot)来参数化。输出前按头 RMSNorm 和 Data Dependent Gating,并最终通过Wo∈ℝd×dW_o\in\mathbb R^{d\times d}做输出投影。

Hybrid model architecture

纯线性注意力在长上下文检索上仍是主要瓶颈,因此我们将 KDA 与少量全局注意力(Full MLA) 层混合。出于实现简单与训练稳定的考虑,Kimi Linear 采用 按层交替(layerwise) 而非按头混合(headwise) 的策略。实证显示,3:1 的均匀比例(3 个 KDA 层 + 1 个 Full MLA 层循环)可在质量—吞吐之间取得最佳折中。

No Position Encoding (NoPE) for MLA Layers

Kimi Linear 对所有 Full MLA 层采用 NoPE。这意味着位置/新近性偏置 完全交由 KDA 承担——KDA 成为主要的位置感知算子,其作用类似或强于短卷积、SWA 等辅助组件。我们的发现与一致:全局 NoPE 注意力 配合专门的 “位置感知” 机制,同样可获得有竞争力的长上下文表现。NoPE 还带来两点工程优势:其一,推理时便于将 MLA 转换为高效的纯 MQA;其二,简化长上下文训练流程——无需对 RoPE 做基频调参或采用 YaRN 等方法。

5. Experiments

5.1. Synthetic tests

image.png

比较小规模的合成实验,2 层 2head,head dim=128,训练最多 20000 步。任务包括:

  1. Palindrome 回文,要求模型将给定的随机 token 序列逆序复制,对 Linear Attention 类很难,因为需要从固定容量的压缩记忆中精确回溯历史;

image.png

  1. MQAR,Multi-Query Associative Recal,多查询关联检索,主要评估模型在上下文不同位置,对多个 query 的关联 value 的检索能力

image.png

  1. Stack,LIFO,评估状态跟踪能力,模型需要在一系列<push> 1 G, <pop> 0 E 这样的操作中准确维护多个栈的状态,并且在每次<pop>的时候给出正确元素。

随着序列长度由 256 提升到 2,048,KDA 在三类任务上一致取得最高准确率;在回文与检索密集的 MQAR 上,KDA 的收敛速度明显快于 GDN,验证了细粒度衰减有助于选择性遗忘无关信息、更精确地保留关键信息。此外,在我们的设置下,仅用乘性衰减、且缺乏 delta 规则的 Mamba2 在这些任务上均未收敛。

5.2. Ablation on Key Components of Kimi Linear

在 16 层、16head 上直接做对比,所有模型共享 FLOPs 与超参:

image.png

我们推测:这源自位置偏置在深度上的分配差异。RoPE 版本里,全局注意力层承载强显式相对位置信号,而线性注意力(如 GDN)仅提供弱隐式偏置,导致全局层过度强调短程顺序——有利于短上下文,却削弱了中途扩展上下文时的灵活性。相反,Kimi Linear 在层间诱导更均衡的位置偏置,带来更强的长程鲁棒性与外推。在长上下文基准上的平均分,Kimi Linear 也最佳。

image.png

5.3. Scaling Law of Kimi Linear

image.png

j

image.png

若进一步精调超参,KDA 的 Scaling 曲线还能更优。

5.4. Experimental Setup

Kimi Linear and baseline settings

将 Kimi Linear 与 全注意力 MLA、以及混合 GDN(GDN-H)做对比。这三者在架构、参数量与训练配置上保持一致以保证公平;整体与 Moonlight 对齐,主要区别是 MoE 稀疏度设为 32。

Benchmarks

5.4.1. Pretraining recipe

最终发布的 Kimi Linear checkpoint 使用相同流程,但将总 token 扩至 5.7T(与 Moonlight 匹配),并支持最长 1M 上下文。

5.4.2. Post-training recipe

SFT:在 K2 的 SFT 数据上扩充,加入更多推理任务,形成覆盖多领域、重数学与代码的大规模指令调优集。采用多阶段 SFT:先广域通用指令学习,再计划性地聚焦推理密集数据以增强推理能力。

RL:提示集重点整合数学、代码与 STEM 三类数据,以提升推理。在 RL 前,基于起始 checkpoint 预选中等难度样本。

5.5. Main results

5.5.1. Kimi Linear@1.4T results

image.png

image.png

image.png

image.png

5.6. Efficiency Comparison

image.png

6. Discussions

6.1. Kimi Delta Attentino as learnable positin embeddings

标准的 Self Attention 自己没办法感知到序列的顺序,因此需要显示的位置编码。像 RoPE 这样的乘性的位置编码,可以通过如下的广义注意力进行分析:

st,i=𝒒t⊤(∏j=i+1t𝐑j)𝒌is_{t, i}=\boldsymbol{q}_{t}^{\top}\left(\prod_{j=i+1}^{t} \mathbf{R}_{j}\right) \boldsymbol{k}_{i}

其中第tt个查询qtq_t与第ii个 key kik_i的相对位置关系,由累计矩阵乘结果反应。RoPE 将RjR_j定义为块对角矩阵:

Rj(k)=[cos⁡(jθk)−sin⁡(jθk)sin⁡(jθk)cos⁡(jθk)]R_{j}^{(k)}=\left[\begin{array}{cc}\cos \left(j \theta_{k}\right) & -\sin \left(j \theta_{k}\right) \\\sin \left(j \theta_{k}\right) & \cos \left(j \theta_{k}\right)\end{array}\right]

共dk/2d_k/2个,每对二维特征分配个字的角频率,由于旋转的性质(如Rt−i=Rt⊤RiR_{t-i}=R_t^\top R_i),绝对位置(作用在q,kq, k上的Rt,RiR_t, R_i)可以各自独立地施加,并在注意力计算的过程中自动转换为相对位置t−it-i:

∏j=i+1tRj=[cos⁡((t−i)θk)−sin⁡((t−i)θk)sin⁡((t−i)θk)cos⁡((t−i)θk)]\prod_{j=i+1}^{t} R_{j}=\left[\begin{array}{cc}\cos \left((t-i) \theta_{k}\right) & -\sin \left((t-i) \theta_{k}\right) \\\sin \left((t-i) \theta_{k}\right) & \cos \left((t-i) \theta_{k}\right)\end{array}\right]

从这个角度看,带 Delta Rule 的 Linear Attention 和上面的广义注意力的机制很相似,

image.png

𝒐t=∑i=1t(𝒒t⊤(∏j=i+1t𝐀j(𝐈−βj𝒌j𝒌j⊤))𝒌j)𝒗j\boldsymbol{o}_{t}=\sum_{i=1}^{t}\left(\boldsymbol{q}_{t}^{\top}\left(\prod_{j=i+1}^{t} \mathbf{A}_{j}\left(\mathbf{I}-\beta_{j} \boldsymbol{k}_{j} \boldsymbol{k}_{j}^{\top}\right)\right) \boldsymbol{k}_{j}\right) \boldsymbol{v}_{j}

因此,Gated Delta Net 可以被解释为一种乘性的位置编码,状态转移矩阵是 input dependent 的,并且可学习,放宽了 RoPE 的正交约束性,理论上更强.

这也为 RoPE 的已知外推问题提供潜在解法:RoPE 的固定频率容易对训练时见过的上下文长度发生过拟合。一些工作采用部分 RoPE,甚至直接取消显式位置编码(NoPE)。鉴于 GDN 与 RoPE 角色相近,我们在模型中为全局 Full Attention(MLA)选择 NoPE,把位置信息的建模交给所提出的 KDA 来动态学习。

6.2. Relation to DPLR

Gated DeltaNet 可以推广为更具表达力的 DPLR 结构,形式为D−atbt⊤D-a_tb^\top_t,S4 是静态的 DPLR。DPLR 引入了更好的表达,但是并行能力很差。

为此,KDA 提出一种受约束的 DPLR 变体:

St=(Diag⁡(αt)−βtktkt⊤Diag⁡(αt))St−1+βtktvt⊤S_{t}=\left(\operatorname{Diag}\left(\alpha_{t}\right)-\beta_{t} k_{t} k_{t}^{\top} \operatorname{Diag}\left(\alpha_{t}\right)\right) S_{t-1}+\beta_{t} k_{t} v_{t}^{\top}

对应地一般 DPLR:

𝐒t=(𝐃−𝒂t𝒃t⊤)𝐒t−1+𝒌t𝒗t⊤, s.t., 𝐃=Diag⁡(𝜶t),𝒂t=βt𝒌t,𝒃t=𝒌t⊙𝜶t.\mathbf{S}_{t}=\left(\mathbf{D}-\boldsymbol{a}_{t} \boldsymbol{b}_{t}^{\top}\right) \mathbf{S}_{t-1}+\boldsymbol{k}_{t} \boldsymbol{v}_{t}^{\top} \text {, s.t., } \quad \mathbf{D}=\operatorname{Diag}\left(\boldsymbol{\alpha}_{t}\right), \boldsymbol{a}_{t}=\beta_{t} \boldsymbol{k}_{t}, \boldsymbol{b}_{t}=\boldsymbol{k}_{t} \odot \boldsymbol{\alpha}_{t} .

进一步地,通过共享αt\alpha_t,将它提到式子外面:先对StS_t施加细粒度衰减,再通过接近 DeltaNet 的 HouseHolder 风格变换,实现高效的状态更新。

image.png

上面的 PyTorch 风格伪代码给出了分块 DPLR 与 分块 KDA 的实现,关键改进如下:

6.3. 复杂度分析

FLOPKDA⁡(T;C,dh)=6Tdh2+3TCdh+TC2\operatorname{FLOP}_{\mathrm{KDA}}\left(T ; C, d_{h}\right)=6 T d_{h}^{2}+3 T C d_{h}+T C^{2}

相比于 FullAttention:

FLOPsAttn ⁡(T;dh)=2T2dh\operatorname{FLOPs}_{\text {Attn }}\left(T ; d_{h}\right)=2 T^{2} d_{h}

7.1. Efficient Subquadratic Attention

Linear Attention

image.png

精细的记忆控制、效率权衡、FastWeight。

Gated Linear Attention

LA 缺乏 softmax 的选择性,表达能力不足,因此 Gating 机制尤为关键。

Sparse Attention

最近的工作趋向于做软硬件协同设计。

Discussion

线性注意力与稀疏注意力是高效长上下文的两条路径。稀疏 在细粒度回溯 上更强,但需保存全量 KV cache 以做选择,因此在推理效率上往往不如仅维护常量状态的线性模型;且稀疏仅做信息选择,其表达上限仍受全注意力约束。相反,线性注意力遵循 “压缩即智能” 的理念:用定长状态实现泛化;结合 Delta 学习规则,其表达能力在理论上可更强。尽管线性注意力常被批评检索性弱,但可通过状态扩展等技术缓解。需要指出,线性注意力仍受硬件实现与推理基础设施限制。我们的工作用 Kimi Linear(与 vLLM 集成)弥补这一点:与全注意力基线竞争,在 100 万 token 的上下文上实现 >2× 的解码加速。两条路径并非互斥,未来可探索线性 × 稀疏的混合模型:既利用线性的压缩与泛化,又吸收稀疏的精细检索,进一步提升性能与效率。

7.2 Hybrid Model

Intra Layer or Inter Layer

Discussion

近来的结果显示,混合模型对 RoPE 基频 调整可能敏感,从而使扩展上下文窗口变得困难。为应对此问题,趋势转向引入 NoPE:例如 Falcon-H 采用极高基频(如 b≈1011b\approx10^{11})把位置编码推向近似 NoPE;SwanGPT 在架构上交错 RoPE-based 层与 NoPE-based 全注意力层。与此方向一致,我们发现将 KDA 层与 NoPE 全注意力混合也是一种高效方案,可更直接地扩展上下文窗口。

8. Conclusion

我们提出 Kimi Linear:一种满足智能体与推理时扩展(test-time scaling)需求、且不牺牲质量的混合线性注意力 架构。其核心 KDA 是带按通道门控的高级线性注意力模块,增强了记忆控制,并在混合架构中激活了 RNN 风格模型的潜力。通过以 3:1 的比例交错 KDA 与全局注意力,Kimi Linear 将内存占用降低至最多 75%,在解码吞吐上实现最高 6.3× 的提升,并超越全注意力基线。我们开源了 KDA 内核与预训练检查点,为后续研究提供可扩展、高效的 LLM 方案。