MiniMax M3 发布:MSA 稀疏注意力机制使百万 Token 上下文计算量降至上代 1/20,SWE-Bench Pro 超越 GPT-5.5
2026/06/02
MiniMax 发布新一代旗舰开源大模型 M3,成为国内首个同时具备前沿编程能力、百万 Token 长上下文和原生多模态三项能力的开源模型——即业界所称的"Frontier 三件套"。M3 在 SWE-Bench Pro 软件工程基准测试中超越 GPT-5.5 和 Gemini 3.1 Pro,并独立复现了 ICLR 2025 获奖论文。
MSA:稀疏注意力机制如何解决超长上下文的算力瓶颈
实现百万 Token 上下文的技术障碍通常在于二次方级的计算复杂度——上下文长度翻倍,计算量扩大四倍。M3 的核心创新是自研 MiniMax Sparse Attention(MSA)稀疏注意力机制:通过稀疏化注意力计算,每 Token 的实际计算量降至上一代模型的 1/20,prefilling(预填充)速度提升超 9 倍。
据 CSDN 的技术拆解报道,MSA 架构还支持 1M Token 的上下文窗口,相当于同时处理 15 本长篇小说。在长程协作任务上,M3 引入了基于"交互式用户模拟器"的训练方法,使模型能够完成需要跨多轮状态追踪的长期任务。
SWE-Bench Pro 与论文复现:超越 GPT-5.5 的编程表现
M3 在 SWE-Bench Pro(软件工程真实任务基准)上的得分超越了 GPT-5.5 和 Gemini 3.1 Pro,这是国内开源模型首次在该基准上正面领先主流闭源模型。
据十字路口 Crossing 的测评报告,M3 还成功独立复现了 ICLR 2025 获奖论文。在更具挑战性的 CUDA 算子优化任务中,M3 也展现出明显的代码能力。SWE-Bench Pro 的评测方式侧重真实工程任务(而非教学级代码题),M3 的领先成绩因此更具工程参考价值。
MiniMax Code:Agent Team 架构与多智能体协作
与 M3 同期发布的 MiniMax Code 是面向工程实践的代码智能体产品,引入了 Agent Team 架构:多个 Agent 可以并行协作处理同一任务,并支持动态调整团队构成(添加、移除或替换特定 Agent)。十字路口 Crossing 测评报告指出,在多文件重构和长任务拆解场景中,Agent Team 的协调机制使 M3 能够以更低的 Token 消耗完成上下文量更大的任务。
为什么 1/20 的计算量值得关注
稀疏架构对计算成本的影响不仅体现在推理速度,还直接影响 API 定价和实际部署门槛。在 Uber、微软等大客户因 AI Token 成本失控紧急叫停使用的同期,M3 的 MSA 架构提供了另一条路径:不是通过限制用量来控制成本,而是从架构层压缩每 Token 的计算开销。M3 同步更新了 Token 定价方案(Token Plan),具体定价尚未披露。