编者按
今年是“十五五”规划的开局之年,全国一体化算力网建设全面提速,为科学研究筑牢算力根基。国家超算互联作为全国一体化算力网代表性实践,以国产普惠算力赋能科研创新,驱动科研成果高效产出。在此,我们推出「十万卡」论文精读专栏,聚焦 AI、HPC、AI4S 等前沿领域,持续解析顶尖科研成果。
本月「十万卡」论文精读带来三篇前沿成果解读,涵盖计算流体力学、Mamba 架构、AI 图像模型 Qwen-Image-Flash 三大主题。
本篇聚焦 Mamba 架构解读:Mamba-3 沿着连续动力系统的离散化、复数状态表示和多输入多输出系统三个方向改造状态更新,使模型在质量、能力和硬件效率之间形成新的帕累托前沿。更多前沿论文解读陆续更新,敬请关注!
文 | 浙江理工大学在读博士研究生徐慈强
随着链式思维、迭代推理和智能体工作流不断增加推理阶段的计算量,语言模型架构不仅要追求更高精度,也必须控制生成时的延迟与显存开销。Transformer 依赖自注意力和随序列增长的 KV Cache:训练与预填充阶段的计算量随序列长度呈二次增长,解码阶段的缓存则近似线性增长,因此在长上下文和大批量推理场景中成本较高。
状态空间模型(State Space Model,SSM)和线性注意力通过固定规模的循环状态压缩历史信息,理论上能够实现线性计算和常数级解码状态。Mamba-1、Mamba-2 已证明此类模型可以在语言建模中取得较强性能,但仍存在三方面不足:一是为了获得更快、更规整的训练算法,Mamba-2简化了状态更新,模型表达能力有所下降;二是实值、非负衰减难以表示旋转型状态变化,导致奇偶校验等简单状态跟踪任务也可能失败;三是解码虽然 FLOPs 较低,却严重受限于显存带宽,GPU 计算单元并未得到充分利用。
为解决上述问题,Mamba 架构原班人马——卡内基梅隆大学与普林斯顿大学团队,交出最新答卷:Mamba-3,相关论文《Mamba-3: Improved Sequence Modeling using State Space Principles》发表在 ICLR 2026 上。
论文从“推理优先”的视角重新审视 SSM,提出 Mamba-3。其核心并非简单扩大参数量,而是沿着连续动力系统的离散化、复数状态表示和多输入多输出系统三个方向改造状态更新,使模型在质量、能力和硬件效率之间形成新的帕累托前沿。

Mamba-2 与 Mamba-3 模块结构对比
研究贡献:
提出指数调整离散化框架:从时变 SSM 的连续解出发,对状态转移与状态输入分别近似,首次为 Mamba-1、Mamba-2 实际采用的启发式更新给出“指数-Euler”解释。
提出指数-梯形离散化:同时融合相邻两个时刻的状态输入,形成更有表达力的三项递推,并可解释为作用在 SSM 状态输入上的数据依赖宽度为 2 的隐式卷积。
引入复值状态空间与数据依赖 RoPE:用二维旋转块表示复数状态转移,使模型能够跟踪奇偶性、模运算等需要周期性状态变化的任务。
提出 MIMO SSM:将原有外积状态写入改为矩阵乘法,在状态大小和解码延迟基本不变的情况下提高算术强度与建模能力;同时发布面向训练、预填充和解码的高效内核。
在1.5B规模下,Mamba-3 SISO 的下游平均准确率达到 56.4%,MIMO 版本达到 57.6%,均优于 Mamba-2、Gated DeltaNet 和 Transformer;MIMO 版本相对 Gated DeltaNet 提升 1.8 个百分点。
Mamba-3 框架解读稿全文及论文原文已上线超算互联网 AI 社区「知识广场」—「十万卡·AI论文精读」,可点击访问下方链接获取:
https://www.scnet.cn/ui/aihub/knowledge/openaimodels/TVoiylLmgWQN?id=2069598252726706178

相关新闻
-
2026-04-15
天津算力券政策:企业免费算力红利这样领
-
2026-07-18
十万卡上线1周“跑满”,超算互联网推多项“生态共创”
-
2026-07-09
国家超算互联网核心节点正式上线
-
2026-07-06
成员风采|上海交大物理与天文学院赴国家超算互联网交流学习
-
2026-06-29
万卡聚力·热AI有光!国家超算互联网启动万卡共创者激励计划
