新闻动态

首页 > 新闻动态 > 「十万卡」论文精读 | 推理优先,性能拉满!Mamba-3三大革新,反超Transformer?
2026-07-20

「十万卡」论文精读 | 推理优先,性能拉满!Mamba-3三大革新,反超Transformer?

编者按


今年是“十五五”规划的开局之年,全国一体化算力网建设全面提速,为科学研究筑牢算力根基。国家超算互联作为全国一体化算力网代表性实践,以国产普惠算力赋能科研创新,驱动科研成果高效产出。在此,我们推出「十万卡」论文精读专栏,聚焦 AI、HPC、AI4S 等前沿领域,持续解析顶尖科研成果。


本月「十万卡」论文精读带来三篇前沿成果解读,涵盖计算流体力学、Mamba 架构、AI 图像模型 Qwen-Image-Flash 三大主题。


本篇聚焦 Mamba 架构解读:Mamba-3 沿着连续动力系统的离散化、复数状态表示和多输入多输出系统三个方向改造状态更新,使模型在质量、能力和硬件效率之间形成新的帕累托前沿。更多前沿论文解读陆续更新,敬请关注!


文 | 浙江理工大学在读博士研究生徐慈强


随着链式思维、迭代推理和智能体工作流不断增加推理阶段的计算量,语言模型架构不仅要追求更高精度,也必须控制生成时的延迟与显存开销。Transformer 依赖自注意力和随序列增长的 KV Cache:训练与预填充阶段的计算量随序列长度呈二次增长,解码阶段的缓存则近似线性增长,因此在长上下文和大批量推理场景中成本较高。


状态空间模型(State Space Model,SSM)和线性注意力通过固定规模的循环状态压缩历史信息,理论上能够实现线性计算和常数级解码状态。Mamba-1、Mamba-2 已证明此类模型可以在语言建模中取得较强性能,但仍存在三方面不足:一是为了获得更快、更规整的训练算法,Mamba-2简化了状态更新,模型表达能力有所下降;二是实值、非负衰减难以表示旋转型状态变化,导致奇偶校验等简单状态跟踪任务也可能失败;三是解码虽然 FLOPs 较低,却严重受限于显存带宽,GPU 计算单元并未得到充分利用。


为解决上述问题,Mamba 架构原班人马——卡内基梅隆大学与普林斯顿大学团队,交出最新答卷:Mamba-3,相关论文《Mamba-3: Improved Sequence Modeling using State Space Principles》发表在 ICLR 2026 上。


论文从“推理优先”的视角重新审视 SSM,提出 Mamba-3。其核心并非简单扩大参数量,而是沿着连续动力系统的离散化、复数状态表示和多输入多输出系统三个方向改造状态更新,使模型在质量、能力和硬件效率之间形成新的帕累托前沿


20260720-1.png

Mamba-2 与 Mamba-3 模块结构对比


研究贡献:


  1. 提出指数调整离散化框架:从时变 SSM 的连续解出发,对状态转移与状态输入分别近似,首次为 Mamba-1、Mamba-2 实际采用的启发式更新给出“指数-Euler”解释。

  2. 提出指数-梯形离散化:同时融合相邻两个时刻的状态输入,形成更有表达力的三项递推,并可解释为作用在 SSM 状态输入上的数据依赖宽度为 2 的隐式卷积。

  3. 引入复值状态空间与数据依赖 RoPE:用二维旋转块表示复数状态转移,使模型能够跟踪奇偶性、模运算等需要周期性状态变化的任务。

  4. 提出 MIMO SSM:将原有外积状态写入改为矩阵乘法,在状态大小和解码延迟基本不变的情况下提高算术强度与建模能力;同时发布面向训练、预填充和解码的高效内核。


在1.5B规模下,Mamba-3 SISO 的下游平均准确率达到 56.4%,MIMO 版本达到 57.6%,均优于 Mamba-2、Gated DeltaNet 和 Transformer;MIMO 版本相对 Gated DeltaNet 提升 1.8 个百分点。


Mamba-3 框架解读稿全文及论文原文已上线超算互联网 AI 社区「知识广场」—「十万卡·AI论文精读」,可点击访问下方链接获取:

https://www.scnet.cn/ui/aihub/knowledge/openaimodels/TVoiylLmgWQN?id=2069598252726706178


20260720-2.png