Skip to main content
Aggregate 雷锋网 综合科技 27 Aug 2026 - 21:08

像素级对标?智谱、Kimi 底层参数「撞衫」背后,藏着线性注意力的黄金窗口

RSS 官方收录 · 可信分层展示

关键摘要

国产大模型内卷到算子底层。作者丨高允毅 编辑丨岑 峰 昨晚,智谱 AI 认领了最近一周在 OpenRouter 盲测榜上风头最盛的“牛来”模型,正式命名GLM-5.3-Flash。…

  • 这款上线首日就登顶 OpenRouter 调用量榜单,刷新全网长文本性价比斩杀线的国产模型,在底层架构上展现出“集百家之长”的特质。
  • 它采用了混合架构,将 DeepSeek 的稀疏注意力机制(NSA) 与 Kimi 赖以成名的线性注意力机制结合 ,再叠加DeepSeek的流…
  • 今天早上,月之暗面核心研究员、“注意力残差”论文作者陈广宇,仔细研究了 GLM-5.

摘要引擎:抽取

正文提要

国产大模型内卷到算子底层。

    作者丨高允毅

    编辑丨岑   峰

                                                                                                       

昨晚,智谱 AI 认领了最近一周在 OpenRouter 盲测榜上风头最盛的“牛来”模型,正式命名GLM-5.3-Flash。

这款上线首日就登顶 OpenRouter 调用量榜单,刷新全网长文本性价比斩杀线的国产模型,在底层架构上展现出“集百家之长”的特质。

它采用了混合架构,将 DeepSeek 的稀疏注意力机制(NSA) 与 Kimi 赖以成名的线性注意力机制结合 ,再叠加DeepSeek的流形约束超连接(mHC)技术,可以大幅降本提效。

今天早上,月之暗面核心研究员、“注意力残差”论文作者陈广宇,仔细研究了 GLM-5.3-Flash 的模型配置文件后,贴出一张 Kimi K3 和 GLM-5.3-Flash 的底层代码对比图。

他发现两者不仅都采用了 KDA 线性注意力,排布逻辑高度重合,连核心参数“遗忘门下界”(gate_lower_bound) 同样是 - 5

从 Kimi K3 公开技术报告到智谱上新,还不到一个月。有人感叹:哪怕是参考了 Kimi 的公开参数,短短 20 天内就能推出这么强的模型,也太惊人了。

这背后其实是一种技术必然。在大模型长文本的深水区,KDA,尤其是它的核心参数,一直是实现“长记忆”和“训练稳定性”的关键。线性注意力发展到今天,数值稳定的最优区间本就极度狭窄。即便是顶尖团队各自独立试错,最终也往往会收敛到同一个数值。

-5数值背后,既是Kimi K3在开源领域的巨大辐射力,也揭开了中国最顶尖的大模型团队,正不约而同迈进了同一个底层算子优化的技术深水区。

图片

01


KDA的核心参数,为什么都选择-5?

为什么两家顶尖大模型团队,会不约而同地把 KDA 的核心参数设为 -5?要解答这个问题,得先搞懂大模型在长文本赛道经历了什么。

过去,传统 Transformer 架构用的是 Softmax 注意力机制,它保留了大模型的完整记忆。大模型会把每一个 Token 都存进 KV 缓存,随着对话拉长,计算量会呈平方级()暴涨,KV 缓存的显存占用也随上下文长度线性攀升,当上下文拉到百万级别,光 KV 缓存就能吃掉几十 GB 显存,推理成本高到无法商业化。

为了把成本打下来,行业开始转向“线性注意力”路线。月之暗面的 KDA 正是其中代表。

它不再保存全量 KV 缓存,而是用一块固定大小的状态矩阵压缩历史信息,模型一边写入新内容,一边用一个名为 “遗忘门” 的组件来控制旧信息的衰减。这样无论后续涌入多少文本,占用的显存基本保持恒定。这也是近期百万级长文本 API 能卖出“白菜价”的底层逻辑。

但这套 “压缩记忆”的模式 也有自己的天然缺陷,那就是数值溢出

线性注意力靠循环乘法来更新状态,当它每处理一个新 Token,旧状态就要乘一次遗忘门系数。当上下文越来越长,乘法次数多了,数值要么不断变小直到彻底归零,要么反向暴涨成无穷大。这个过程,只要算出一个错误结果(NaN),训练直接崩溃,千万级算力直接打水漂。这就是线性注意力过去没有被广泛使用的原因。

这个瓶颈卡了很多年,直到一个名叫杨松霖的哈佛博士生,发表门控线性注意力(GLA)论文,系统提出门控状态衰减方案,这一问题才有了系统性的学术解决思路。他首次系统提出必须给状态衰减设一个“下限”,不允许它无限趋近于 0。

但从学术成果到大规模工业落地,仍有不少问题。

当月之暗面(Kimi)团队基于 GLA 演进出自研的 KDA 架构,试图将上下文推向 100 万字时,直接撞上了底层芯片的物理极限。

在大规模预训练中,万卡集群普遍使用的是 fp16 或 bf16 半精度浮点数,其数值动态范围极其狭窄。而线性注意力需要对超长序列进行数万次循环累乘,在这种递推计算中,任何微小的数值发散,都会在半精度芯片的反复乘法中被迅速放大。最终触发 NaN(非数)崩溃,导致高昂的训练算力成本折损。

为了规避这种因数值不稳定带来的算力风险,Kimi 的底层架构团队直接下潜到硬件算子层,在自研的 FlashKDA CUDA 内核里,设定 gate_lower_bound = -5。

-5 经过激活函数转换后,大约对应 0.67% 的留存率。这意味着,哪怕模型决定遗忘某段信息,也会被强制保留 0.67% 的旧信息。

至于为何是 - 5 这个数值,这是靠海量工程试错找出的黄金平衡点

如果设得太高,比如设在 - 3,对应的留存比例约为 5%,旧信息在矩阵中过度堆积,会导致网络过载、梯度爆炸或上下文混杂幻觉。

如果数值太低,比如设在 - 8,对应留存比例仅约 0.03%,模型会出现严重的 “健忘症”,长文本读到后面就忘记前面的关键信息,在长代码调试、长财报分析等需要精准召回的任务直接失效。

-5 恰好卡在中间。在预训练中,它为算子底层的稳定性“保驾护航”;在推理端,它则是性价比之王,让线性注意力机制得以在极低的显存开销下稳住长文本召回率,使百万级长文本的商业化落地真正成为可能。

图片

02


同样是 -5,

Kimi和智谱又走出不同的路

但同样选择 - 5 的遗忘门下界,对于Kimi 和智谱又是不同的意味。

对于Kimi K3而言,它采用的是混合注意力架构,用线性注意力承接长上下文的记忆压缩,把显存和推理成本打下来;同时,它也用传统 Softmax 注意力,处理复杂逻辑推理,保证核心能力不打折。

在这套架构里,gate_lower_bound=-5从预训练启动的第一天就已嵌入,是原生设计的一部分。这个数值是 Kimi 团队在自身万卡级预训练中,通过大量试错踩出来的稳定解。 这些都在Kimi K3公开技术报告里体现了出来,底层算子怎么实现、配置怎么设、工程上踩过哪些坑,全部公开。

而智谱 GLM-5.3 Flash 的配置文件中,虽然出现了完全一致的 gate_lower_bound=-5,但陈广宇猜测这很有可能是“中途注入”

这种操作在工程逻辑上完全成立,甚至是很高明的策略。在预训练中后期追加门控约束,再用调低后的学习率续训一段时间,不需要推倒重来重置权重,就能让一个原本就在相近区间摸索的模型,快速对齐行业验证过的最佳实践。这种打法省下的是动辄数亿的底层试错算力,体现的是智谱极强的工程落地效率。

当然这并不意味着仅靠改一个数字就能迭代出新模型,智谱本身在线性注意力方向已有数月研发积累,更合理的逻辑是,团队原本就在相近区间内做实验,看到 Kimi 报告明确验证了 - 5 在大参数量级下的稳定性后,直接采用了这一经过工业验证的最佳实践,省去了大量重复试错的成本。

那么,中途加入这样一个底层约束,到底会不会影响模型的实际表现?

评论区有一位开发者Oliver Sieberling认为,这属于 “非侵入式改动”。遗忘门本身是模型自适应学习的结果,加一个下限只是卡住了极端取值,并不会改变遗忘门本身的学习目标,对模型主体的扰动极小,更像加了一道安全护栏,性价比很高。

但这一取舍也有一定的风险,比如隐性分布偏移的危害。 模型经过几千万步预训练,已经形成了 “遗忘门可以调到极低” 的内在行为模式,中途突然锁死下限,相当于半路修改了底层运行规则。表面上看训练损失、公开基准跑分都正常,但模型内部的记忆分布其实已经悄悄发生了偏移。

这种偏移很难通过常规测试发现,但在 50 万字以上的超长代码、超长文档这类极端长尾场景中,可能会因为残留信息持续累积出现 “慢性中毒”,产生一些逻辑错误。

事实上,在长文本底层优化这条赛道上,并非只有这一条路线。国内另一家顶尖玩家 DeepSeek,就走出了完全独立的技术路径。

他们没有采用 Delta Rule 谱系下的 - 5 门控方案,而是沿着自研的 MLA(混合潜在注意力)与 NSA(原生稀疏注意力)持续演进,通过低秩压缩和硬件级算子优化,在另一套数学框架里实现了长序列的数值稳定。

为什么中国最顶尖的大模型团队,都集体下潜到算子层,死磕长文本的底层计算瓶颈?答案藏在大推理模型时代的算力账本里。

自 o1 与 DeepSeek-R1 开启强化学习大推理时代以来,模型在后台进行深度推导时需要自主生成几十万字的“思维链(CoT)”Token。如果还固守传统 Transformer 平方级增长的算力成本,超长思维链带来的显存黑洞,会直接吞掉任何一家公司的商业毛利。

谁能用线性的成本守住长文本的体验底线,谁就能在推理时代拿到最高的利润空间。而当行业都在相近的模型规模、相近的训练框架下做超参搜索时,基于 Delta Rule 的线性注意力,其数学收敛的物理极限区间,天然就指向这个窄小的黄金带。

从这个角度看,参数 “撞衫” 从来不是抄袭的佐证,而是行业集体挺进技术深水区时,必然会出现的技术趋同。

图片

03


参数战之后,

是品味、效率与创新的真正较量

回到最初的问题:智谱有没有“参考”Kimi的参数?

在“exe文件比txt文件重要”的工业界,这个问题其实已经不重要。大语言模型的技术日新月异,如果一直固守传统Transformer架构,在强调只讲究数学规律和商业ROI的产业界完全行不通。-5这个参数,不是属于谁的专利,而是在攀登技术高峰中,目前唯一一条被探明、不会摔得粉身碎骨的安全道路

当大模型公司的竞争下沉到算子优化、数值边界、训练工程细节这些看不见的底层功夫。参数战之外,还有品味战、效率战、创新之战。这本身就是行业成熟的信号。

任何经受住万卡集群实战检验的“最佳实践”,都会在最短的时间内沦为行业的通用基建。这也解释了为什么国产大模型在长文本处理与超低成本推理上,能在极短时间内逼近甚至斩落国际顶尖闭源模型的身位。

因为在极致的算力压迫下,中国最顶尖的顶尖大脑,正在以一种惊人的敏捷度,最终都会不约而同地攀上统一做山峰的极顶,向物理极限不断发起挑战。

参考链接:https://x.com/nathancgy4/status/2092626984362725877

https://x.com/Zai_org/status/2092616204787626030

上车,雷峰网带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击阅读原文关注专区。

打开官方原文 站点原文页 可信分区 本信源更多 今日简报 分享图 RSS 稍后再看列表