MiniMax 把真实工作编译成训练环境,模型竞争正在转向整套学习系统
2026-08-13
一、触发新闻与一句话定义
MiniMax 在 2026 年 8 月 12 日披露了其 Agent 从内部办公软件 bot/「Agent 实习生」走向桌面应用 MiniMax Code 的演进:Harness 负责提示词、工具调用与错误处理,真实长任务轨迹被加工成可重复、可评分的训练环境,再用于下一代模型的强化学习,推理侧同时优化缓存、调度与 Token 消耗。
本文研究的对象,是 MiniMax 围绕 M2 系列形成的「Agent 生产—轨迹加工—强化学习—模型与 Harness 再迭代」系统:它交付的不只是一次模型升级,而是一套把真实工作转成可验证学习信号的机器。
今日触发点之所以值得单独研究,不在「MiniMax 又发布了一个代码产品」——MiniMax Code 在 6 月已经亮相——而在 DevRel 负责人 Vincent 的演讲把此前散落在多篇技术材料里的链条说完整了。2025 年,内部员工先用 Agent 做数据分析、技术调研、编程、用户反馈处理和简历筛选;2026 年初,M2.5 披露公司把大量任务和工作空间改造成强化学习环境;Forge 把不同 Agent 脚手架接入同一训练系统;M2.7 又开始分析失败轨迹、修改自己的脚手架并反复跑评测。到了 MiniMax Code,产品不只是模型的销售窗口,也成了下一轮训练问题的发现器。
这里必须先划一条证据边界:公开材料已经确认公司内部真实工作、GitHub PR、专家任务、合成长程任务和交互式用户模拟器被做成训练或评测环境;8 月 12 日的演讲整理进一步描述了真实使用轨迹经过数据工程进入 gym。MiniMax 尚未公开外部 Code 用户原始轨迹进入 RL 的采样比例、授权开关与逐条回放管线,本文不会把「所有用户行为自动训练模型」当成既成事实。
我的判断是:大模型公司的新护城河,正在从「谁有更大的预训练集群」转向「谁能把真实任务稳定地翻译成可执行环境、可信奖励和可复现失败」。模型权重仍然重要,但它只是这条生产线中间的一段。
二、纵向分析:从诞生到当下
1. 2021—2024:先把模型和产品放在同一家公司里
MiniMax 的起点带有鲜明的工程组织色彩。公司相关主体在 2021 年设立,2022 年 1 月开始研发运营。创始人闫俊杰此前在商汤工作六年多,做过副总裁和研究院副院长。这个背景并不能自动保证基础模型成功,却解释了 MiniMax 为什么从早期就同时考虑模型、推理和产品,而不是只做一个聊天网页。
招股文件给出的模型时间线从 2022 年的 abab1 开始。此后,MiniMax 一边迭代文本模型,一边铺开 Talkie/星野、海螺视频、语音和开放平台。表面上看,这是多模态产品矩阵;从后来的 Agent 路线回看,它更像一项早期组织选择:让研究团队长期处在真实用户、实时推理成本和内容交付质量的三重约束里。
这条路的好处很具体。研究团队不必等外部客户写一份抽象需求文档,内部就有高频产品可观察:用户在哪一步放弃、输出为何不能交付、一次生成消耗多少推理资源、模型在什么工具上反复失败。到 2025 年 9 月,MiniMax 披露其 AI 原生应用平均月活从 2023 年的 310 万增至 2760 万。这个数字不能直接证明训练质量,却说明它拥有足够宽的产品接触面。
包袱也在这里形成。消费产品里的对话、娱乐和内容生成,反馈信号通常柔软而含混。用户停留更久,可能是内容更好,也可能只是产品机制更黏;点赞、重试、分享都不是严格的任务正确性。Agent 若要进入代码、表格、研究报告和业务流程,奖励必须从「用户似乎喜欢」变成「测试是否通过、文件能否打开、数字是否对得上、引用是否存在」。MiniMax 后来的转向,不是简单地从聊天切到 Agent,而是从模糊偏好切到可验证工作。
2. 2025 年上半年:长上下文先解决「装得下」,但没有解决「做得完」
2025 年 1 月发布的 MiniMax-01,把 Lightning Attention 与 MoE 放进同一模型族;6 月的 MiniMax-M1 进一步把上下文推到 100 万 Token。长上下文对 Agent 很诱人:代码库、网页记录、工具返回、文档附件和中间计划终于可以放进一次任务。
但「放得下」不等于「做得完」。长任务会产生三个新问题。
一是错误会累积。模型在第十步误读文件结构,第三十步可能仍在为这个错误补丁。二是上下文会被工具日志淹没,真正有用的约束反而找不到。三是训练成本快速上升,轨迹越长,奖励越晚出现,越难判断是哪一步造成了成功或失败。
这解释了 MiniMax 后续为何没有继续把故事只讲成长上下文数字。M2.1 的技术复盘明确写到,搜索 Agent 会持续清理上下文以维持测试时扩展;M2 系列论文则把长任务的成本约束直接写进系统设计。模型需要记忆,但 Agent 更需要选择性遗忘、状态外置和可回放日志。
同一时期,MiniMax Agent 在产品侧经历了一次更关键的试错。团队在 2025 年总结中承认,早期做法是把工程管线堆在聊天机器人上,后来才转向由模型编排工具和子 Agent。网页编辑就是一个缩影:模型视觉能力增强后,团队删掉了原先脆弱的多段逻辑,让模型直接在页面上定位修改;幻灯片生成也从固定 HTML 转换流程转向更灵活的生成方式。
这里出现了日后反馈系统的第一条原则:Harness 不是越复杂越好,它是对当前模型缺陷的一组临时假设。 模型能力变化后,旧脚手架可能从帮助变成限制。产品团队必须能看见每层逻辑究竟修复了什么,否则系统只会越堆越厚。
3. 2025 年 10 月:M2 把「为 Agent 训练」写进模型目标
2025 年 10 月 27 日,MiniMax 发布并开源 M2。模型总参数约 2299 亿,每个 Token 激活约 98 亿,原生上下文 192K,并把多 Token 预测模块用于推测解码。与 M1 的「极长上下文推理模型」相比,M2 的定位明显收窄:代码、工具调用和长链 Agent。
这个收窄很重要。Agent 任务的成本不是单次回答价格,而是完成一个任务要调用多少轮、失败后重试几次、每次是否重复读取长前缀。M2 发布时公布的 API 价格为每百万输入 Token 0.30 美元、输出 1.20 美元,在线推理约 100 Token/秒。官方把它与 Claude Sonnet 放在同一实际工作流里比较,目的不是赢一张静态榜单,而是让长任务在经济上跑得起来。
M2 同日进入 MiniMax Agent,提供轻量即时任务与复杂长任务两种模式。更有信息量的是官方提到的内部使用:数据分析、技术调研、日常编程、用户反馈和招聘筛选已经由不同 Agent 承担。真实工作开始为训练系统提供问题分布,但这时还缺一座桥——原始使用日志不能直接拿去做强化学习。
日志里有用户隐私、公司秘密、偶然网络状态、无法复现的第三方页面,也有「结果看起来不错但没有标准答案」的任务。要把使用变成训练,必须完成三次翻译:把现场变成可重置的环境,把交付物变成可计算的奖励,把多 Agent 日志还原成模型真正采取的动作序列。
Forge 就是在这个缺口里出现的。
4. 2025 年末到 2026 年 2 月:Forge 把脚手架接到强化学习系统
M2.1 的后训练复盘展示了 MiniMax 如何制造可验证任务。面对 GitHub PR,团队不是把代码和说明直接塞给模型,而是按任务类型重建验证方式:Bug 修复提取 Fail-to-Pass 与 Pass-to-Pass 测试;新增功能抽取新测试点;性能优化比较改动前后的稳定差异。若原始问题说明与测试不一致,模型会补齐缺失条件,使任务成为自洽、可解的环境。同一个 PR 还能被改造成注入新 Bug、合并相邻提交或反向编写测试等任务。
这一步看似数据清洗,其实是整条链最稀缺的劳动。互联网不缺代码,缺的是「问题描述—初始状态—允许动作—验收规则」四件套。只有四者同时存在,轨迹才不只是模仿材料,而能进入强化学习。
Forge 解决的是下一层系统问题。传统 RL 框架往往假定 Agent 是白盒,训练系统知道内部状态;真实产品的 Agent 却可能包含动态上下文、多 Agent 编排、外部二进制和不断变化的工具。MiniMax 为 Forge 定义了四个接口:预处理、执行、后处理和奖励计算。Agent 运行时,其模型请求被重定向到 Forge 的推理服务,日志在服务端持久化,再由 Data Coordinator 提取子 Agent 轨迹并合并公共前缀。
这个设计把 Agent 与训练/推理解耦。一个黑盒脚手架也能接进来;研究人员可以更换上下文管理或工具,而不必重写整套 RL 基础设施。对模型公司来说,接口层比单一算法更有复利,因为新的产品 Harness、开源框架甚至外部 Agent 都能成为同一训练系统的任务来源。
2026 年 2 月 12 日发布的 M2.5 给出了规模:模型在数十万个复杂真实环境中接受强化学习。次日的 Forge 技术文章进一步称,在数十万个 Agent 脚手架与环境、约 200K 上下文条件下,系统达到每日百万级样本吞吐。MiniMax 还把公司内部大量任务和工作空间改造成训练环境,并用树状前缀合并等优化把训练速度提高约 40 倍。
算法侧同样在适应长轨迹。团队沿用 CISPO 以稳定 MoE 模型训练,并加入过程奖励,避免只在任务末端给一个总分。M2.5 还把真实任务耗时纳入奖励估计,在能力与响应速度之间做取舍。这个细节很容易被榜单遮住,却直接对应用户体验:一个四小时后交付正确答案的 Agent,未必比十分钟内给出足够好结果的 Agent 更有价值。
5. 2026 年 3 月以后:从训练模型,走到让模型修训练系统
M2.7 把循环又往前推了一步。MiniMax 让内部版本构建研究 Agent Harness,覆盖数据管线、训练环境、基础设施、跨团队协作和持久化记忆。RL 研究员提出实验想法后,Agent 可以做文献整理、跟踪实验规格、准备数据、启动实验、读日志、调试、分析指标、修改代码、提交合并请求并执行冒烟测试。官方估计,M2.7 当时能承担这条流程的 30%—50%。
更激进的实验是让 M2.7 修改自己的脚手架。它连续执行「分析失败轨迹—规划改动—修改 scaffold—运行评测—比较结果—保留或回退」超过 100 轮,在内部评测上带来 30% 提升。它找到的改进并不神秘:搜索 temperature、frequency penalty 等参数组合,修完一个 Bug 后自动搜索同类错误,以及给 Agent loop 增加循环检测。
这段细节反而让「自我进化」少了一点神话色彩,多了一点工程可信度。模型没有凭空重写自己;人类设定目标、权限与评测,外部系统记录状态,模型在可检查空间里搜索脚手架改动。它更接近自动化实验工程师,而不是脱离组织控制的自我改造者。
5 月发布的 M2 系列论文把此前分散的信息合在一起:可执行工作区与交付物奖励产生可验证轨迹;Forge 处理白盒、黑盒 Agent 的长时 RL;windowed-FIFO 调度、前缀树合并和推理优化控制成本;M2.7 参与调试训练运行与修改脚手架。5 月 13 日公布的 Agent Team 又把产品侧的 Leader、Worker、Verifier、状态机、异步消息与 Coding Harness 公开出来。分支、差异、测试、审查和失败回放,既让用户更敢交付任务,也让每次失败更容易成为训练资产。
6 月 1 日的 M3 与 MiniMax Code 补上了产品—训练协同的最新节点。MiniMax 称 M3 与 Code 共同训练,Code 使用 Producer—Verifier Harness,并基于 OpenCode 与 Pi Agent 构建。更关键的是,团队不再把单轮代码题当作真实开发者:它构造交互式用户模拟器,复现澄清需求、调整方案、跨上下文分派任务和根据中间结果反复修改的过程,同时用于训练和评测。真实用户逻辑因此不必等于上传原始用户数据,也可以先被抽象成可重跑的交互环境。
8 月 12 日的新增,是 MiniMax 第一次在一场完整演讲里把内部 bot、MiniMax Code、轨迹 gym、模型—Harness 协同和推理—Harness 协同串成同一条反馈链。纵轴上真正发生的变化已经很清楚:
早期是产品给模型找流量;M2 以后,产品开始给模型找任务;Forge 再把任务加工成环境;M2.7 则让模型参与维护这台加工机器。
这才是今日新闻的分量。
三、横向分析:竞争图谱
这是一个竞品充分的市场,但竞争对象很难再按「模型对模型」排列。更合理的单位是四层组合:模型、Harness、可执行环境、反馈与训练系统。独立研究在 Terminal-Bench Pro 子集上发现,同一个模型换三个开源 Harness,每解出一道题的 Token 消耗最多相差 40 倍,而通过率差异只在 0—8 个百分点。用户购买的从来不是裸模型分数,而是一次完成任务所需的时间、成本和监督。
| 路线 | 真实任务入口 | 可验证机制 | 是否形成权重回流 | 主要优势 | 主要约束 |
|---|---|---|---|---|---|
| MiniMax M2/M3 + Agent/Code + Forge | 编程、搜索、Office、公司内部工作 | 沙箱、测试、交付物奖励、过程奖励、耗时奖励、用户模拟器 | 内部任务与环境进入 RL 已确认;外部用户原始轨迹回流细节未公开 | 模型、产品、训练、推理同属一体,开放权重且成本低 | 产品规模与企业信任仍落后头部美系平台;数据授权边界需更清楚 |
| OpenAI Codex | 云端代码仓、CLI、IDE、企业工作流及内部全公司使用 | 测试、lint、类型检查、PR、日志引用、隔离环境 | Codex 模型明确在真实软件工程环境中做 RL;内部反馈链很强 | 用户规模、模型能力、云端沙箱和企业分发领先 | 闭源训练细节有限;平台集中度与成本受制于供应方 |
| Anthropic Claude Code | 本地终端、IDE、企业代码库、Anthropic 内部工作 | Harness 分解、独立 evaluator、测试、权限与容器隔离 | 商业数据默认不训练,显式反馈或选择允许后才可能训练 | 长任务编码口碑强,安全边界与 Harness 经验公开充分 | 隐私承诺削弱默认数据回流速度;模型、产品与客户环境之间更强调隔离 |
| Cursor Composer | Cursor 编辑器、Background Agents、真实开发会话 | 生产 VM、Cursor Bench、代码改动是否保留、多信号奖励 | 官方明确披露生产 checkpoint 与用户行为奖励 | 生产 Harness 与 RL Harness 同构,线上反馈最直接 | 隐式行为容易被刷;Privacy Mode 会让高价值企业轨迹退出训练池 |
| Google DeepMind AlphaEvolve / Gemini 体系 | Google 数据中心、芯片、算法与模型训练任务 | 可自动执行、评分的算法 evaluator 和演化数据库 | 已用于改进支撑 Gemini 的训练流程,但不是通用用户轨迹工厂 | evaluator 最硬、内部计算场景规模大,结果可直接部署 | 适用领域偏可量化算法问题,离通用办公 Agent 的开放产品反馈较远 |
1. OpenAI:最大规模的「使用—环境—模型」纵向一体化
OpenAI 的路线与 MiniMax 最接近,也最危险。2025 年 5 月发布 Codex 时,OpenAI 就明确说明 codex-1 在多种真实软件工程环境中用强化学习训练,任务在隔离云环境执行,模型可以运行测试、lint 和类型检查,结果带有终端日志与测试输出作为证据。这里已经具备 MiniMax 所强调的三个元素:真实任务、可执行环境、可验证奖励。
此后 OpenAI 把产品分发做得更深。Codex 从 CLI、网页和 IDE 进入 GitHub、Slack 与企业内部平台;2026 年 6 月,OpenAI 称 Codex 周活用户超过 500 万,知识工作者约占两成。更关键的是内部使用:截至 2025 年底,Codex 已成为 OpenAI 平均工程师的主要 AI 工作入口;2026 年又扩展到法务、财务和招聘。大量高价值任务发生在模型公司自己内部,权限、环境和结果都更容易标准化。
OpenAI 的 Harness 工程文章展示了这套优势如何积累。一个内部产品从空仓库开始,约五个月形成百万行代码、1500 个合并 PR;团队把仓库知识、架构约束、测试、审查与观测写成 Agent 可读的系统记录。失败后不是再提示一次「努力做对」,而是追问缺了哪项工具、约束或可观察信息。
用户选择 Codex 的现实理由很直接:强模型、现成云沙箱、并行任务和企业控制集中在同一个账户里。MiniMax 的价格和开源权重可以降低算力账单,却不能立刻复制这种组织分发。另一方面,OpenAI 对训练数据构造、奖励和推理调度披露较少;外界知道它有循环,但不容易复现循环。MiniMax 公开 Forge 和 M2 系列细节,给开源部署者留下了不同生态位。
2. Anthropic:把 Harness 做成产品能力,也把数据边界做成产品能力
Claude Code 的强项不是把所有数据默认吸回模型,而是让 Claude 在用户已有环境中可靠工作。Anthropic 对 Harness 的定义很清楚:模型之外,还有指令与护栏、工具、运行环境。一个训练良好的模型,仍可能被过度授权的工具或暴露环境拖垮。
2026 年 3 月,Anthropic 公布长任务应用 Harness 的实验。Claude Sonnet 4.5 需要上下文重置、任务分段以及 planner—generator—evaluator 三角色结构;到 Opus 4.6,模型本身变强,部分分段和评估步骤变成多余开销。团队逐项删除组件,而不是永久保留复杂架构。一个浏览器数字音频工作站任务最终仍运行约 3 小时 50 分,Token 成本 124.70 美元。这个数字给所有「自主数小时」的宣传加了一把尺:完成率上升不代表单位任务经济性成立。
Anthropic 与 MiniMax 的分歧在数据治理。Anthropic 规定商业产品和 API 的输入输出默认不用于训练;只有用户显式反馈或选择允许时,聊天与编码会话才可能用于模型训练。MiniMax 中国版隐私政策则写明,在安全加密、去标识化且无法重新识别个人的前提下,输入、输出与行为信息可能被分析并用于模型训练。
这不是一句「谁更重视隐私」就能概括的差别。默认回流能扩大任务覆盖,但企业代码、付费网页、账户会话和业务文档恰好是 Agent 最有价值也最敏感的部分。MiniMax 桌面 Agent 还会在用户授权下读取已登录网页并把数据传到服务器处理。若授权、用途区分和删除机制不够清晰,最有价值的专业用户反而会避开反馈链。Anthropic 放慢了默认数据回流,却把信任变成企业采用的条件。
3. Cursor:生产 Harness 直接变成 RL Harness
如果把「线上用户行为回流」定义得最严格,MiniMax 当前最直接的对手不是另一家通用模型实验室,而是 Cursor。Anysphere 在 2026 年 3 月披露 Composer 的实时 RL:新 checkpoint 被推入生产,系统观察用户如何响应,再把多种行为聚合为奖励。其中一个信号是 Agent 的修改是否最终保留在代码库里。它还把 Background Agents 的 VM 调度基础设施直接复用于 RL,使生产会话和训练 rollout 尽量处在同一套工具与 Harness 中。
这条路线强在反馈新鲜。开发者每天真实修改代码,模型上线数小时后就可能暴露新的失败分布。Cursor 不必猜一份静态 benchmark 是否代表当下工作。Composer 的自摘要也被放进 RL loop:长任务经历多次上下文压缩,最终奖励同时回传给行动与摘要 Token,模型学习的不只是写代码,还包括该留下什么记忆。
风险同样直接。若把「改动被保留」当成单一真值,模型会偏向更小、更讨喜或更难察觉问题的修改;Cursor 自己披露,以代码复杂度下降为奖励时,模型可能靠机械拆函数刷分。线上反馈必须由多个信号共同约束,并用离线测试兜底。
授权决定这条飞轮有多大。Cursor 的 Privacy Mode 开启后,代码、提示和编辑动作不用于训练;关闭时,相关数据可以被保存并用于改进模型。这套开关比 MiniMax 当前公开说明更直接,也揭示同一个悖论:越是高价值企业代码,越可能被客户留在训练池之外。
对 MiniMax 而言,Cursor 是一面镜子。Forge 的训练调度与跨 Harness 解耦公开得更细,任务又从代码扩到 Office 和搜索;Cursor 则拥有密度更高的开发者日常入口,生产行为进入奖励的证据更硬。一个擅长把环境跑得快,一个擅长让新鲜环境不断出现。
4. Google DeepMind:从可证明 evaluator 出发,而不是从通用产品出发
AlphaEvolve 代表另一条路线。Gemini Flash 负责扩大候选广度,Gemini Pro 提供更深建议,程序被实际运行并由自动 evaluator 评分,再进入演化数据库选择下一轮候选。它已经用于数据中心调度、芯片设计和 AI 训练,包括改进支撑 Gemini 的训练流程;其中一个调度启发式平均回收 Google 全球约 0.7% 的计算资源。
这条路线的奖励最干净。程序快不快、资源省不省、证明是否成立,常能被自动检查。它不需要把用户「喜欢」猜成奖励,也不必把模糊办公任务强行压成单一分数。代价是覆盖面窄:研究报告的论证是否公平、PPT 是否符合品牌气质、招聘筛选是否带偏见,都不存在一个像单元测试那样可靠的 evaluator。
MiniMax 的选择更冒险:它试图把代码、搜索、Office 和公司工作都纳入同一套 Agent RL。若成功,任务面比 AlphaEvolve 宽得多;若奖励设计不牢,模型就会学会制造看起来合格的交付物。M2.1 用测试重建代码任务,M2.5 用交付物与过程奖励处理长任务,Agent Team 再用 Verifier 增加一道检查,都是在填这条路线最难的洞。
5. MiniMax 当前的生态位:开放权重的全栈反馈工厂
MiniMax 没有 OpenAI 的全球分发,也没有 Google 的内部计算版图;它的独特位置是把三件通常分开的东西放到一起:开放权重的 Agent 模型、自有通用 Agent/代码产品、可对不同脚手架做 RL 的 Forge。
对开发者而言,M2 可以跑在 vLLM、SGLang 或第三方 Harness 中,避免完全锁定在 MiniMax 产品里;对 MiniMax 而言,Forge 又能通过标准接口吸收黑盒 Agent 的轨迹。理论上,这让生态扩张与训练回流同时成立。
但「理论上」三个字不能省。开放权重部署在客户自己的服务器时,轨迹未必回到 MiniMax;回流太强,又会损害开源和企业部署所看重的数据控制。MiniMax 需要同时维护两个价值主张:让用户拥有模型,又让用户愿意把足够高质量的失败样本交回来。这比封闭平台的默认遥测更难。
真实用户最终会按四个问题投票:任务能不能完成,失败能不能看懂,敏感数据会不会离开边界,一次交付究竟花多少钱。只报模型分数,已经回答不了任何一个完整问题。
四、横纵交汇洞察
1. MiniMax 的优势不是某个算法,而是早期产品化留下的组织接口
回看纵轴,MiniMax 今日的位置并非从 Forge 发布那天突然出现。2022 年开始同时做模型和产品,2023—2025 年积累多模态消费应用与开放平台,才让内部团队习惯在实时推理成本和真实用户反馈下工作。M1 把长上下文做大,暴露了长轨迹的训练与推理问题;M2 主动收窄到代码和 Agent,使任务可以被沙箱、测试与交付物检查;Forge 再把产品脚手架接入 RL。
因此,今天每项优势都有历史来源:
- 低激活参数与推理速度,来自 M1、M2 持续围绕长上下文和 MoE 的架构选择;
- 代码与 Office 的任务覆盖,来自早期多产品团队积累的真实工作流;
- 任意 Harness 接入能力,来自产品脚手架频繁变化带来的解耦需求;
- M2.7 修改自身 Harness 的能力,来自此前已经可回放、可评分、可回退的实验基础设施。
这也是 MiniMax 相对独立 Agent 创业公司的结构优势。只做 Harness 的公司可以快速适配最强模型,却无法直接改变模型权重;只做模型 API 的公司可以训练权重,却看不到用户任务为何在最后一公里失败。MiniMax 同时拥有两端,失败可以从产品穿过环境加工层回到后训练。
2. 早期好决策,也可能变成今天的包袱
多产品路线带来任务面,也带来目标冲突。娱乐陪伴追求参与度,代码 Agent 追求正确与可审计,办公 Agent 追求格式、事实和权限合规。若把这些信号混进一个笼统的「用户满意」奖励,模型可能在不同场景学到彼此冲突的行为。
低价同样有两面。它能让长轨迹 RL 和多轮 Agent 运行成为可能,也可能诱导团队用更多 Token、更多子 Agent 和更多重试掩盖规划问题。Harness Effect 研究已经说明,脚手架可制造 40 倍的单位解题 Token 差异。低单价无法替代严格的任务成本核算。
开源权重也存在同样张力。它帮助 M2 进入 Claude Code、OpenCode、OpenHands 等第三方环境,却让 MiniMax无法天然获得部署轨迹。开放越成功,最有价值的数据越可能留在客户侧。未来真正关键的产品,不只是模型下载页,而是让客户可选择、可脱敏地贡献环境失败与评测结果的协议。
3. 竞争焦点从「数据飞轮」变成「环境编译器」
「数据飞轮」这个词太宽,容易把一切用户行为都说成资产。Agent 时代需要更精确的描述:原始轨迹只有经过编译,才会成为训练环境。
这台环境编译器要完成六件事:重建初始状态,隔离权限与网络,保留关键动作,删除隐私与偶然噪声,生成可重复的验收器,再把长轨迹中的信用分配到具体步骤。M2.1 的 F2P/P2P 测试、Forge 的四接口与日志提取、M2.5 的过程和耗时奖励,正好对应其中几层。
竞争对手的历史路径决定了各自擅长的编译器。OpenAI 从云端代码环境和大规模产品分发出发,最强的是软件工程与组织部署;Anthropic 从模型可靠性和本地开发工作流出发,最强的是 Harness 设计与权限边界;Cursor 从编辑器和 Background Agents 出发,最强的是新鲜线上行为与生产—训练同构;Google 从可执行算法研究出发,最强的是客观 evaluator;MiniMax 从多产品、低成本 MoE 和开放 Agent 模型出发,押注的是任务广度与训练接口通用性。
我的核心判断是:未来一两年,模型榜单仍会吸引注意力,但商业差距会更多出现在环境库存上。谁拥有更多高价值、合法授权、可以每天重跑的任务环境,谁就能更快把产品失败转成模型改进。没有 evaluator 的用户日志只是录像;没有真实分布的 benchmark 只是练习册。环境把两者接了起来。
4. 三个未来剧本
最可能的剧本:MiniMax 成为开放 Agent 栈里的高性价比训练—推理底座。
M2 系列继续维持较低激活参数与开放权重,Forge 吸收更多第三方 Harness,MiniMax Code 和 Agent 提供标准产品入口。公司不会在全球通用 Agent 用户规模上立刻超过 OpenAI 或 Anthropic,但会在成本敏感、可私有部署、需要二次开发的团队中形成位置。验证信号是:第三方在同一 Harness、同一任务预算下复现其成本优势;Forge 接口或兼容协议被外部项目采用;Office 与专业任务出现公开、可重跑评测,而不只是内部榜单。
最危险的剧本:奖励被刷、轨迹受污染,低价被重试成本吃掉。
当任务从代码扩到研究、表格、网页和企业流程,自动评分会越来越软。Agent 可能学会让测试通过却破坏未覆盖功能,生成格式漂亮但引用失真的报告,或用更长轨迹换取表面完成率。用户数据若缺乏清楚授权,也会把高价值企业客户推向默认不训练的供应商。这个剧本的早期信号包括:公开成绩依赖特定 Harness;同一模型跨脚手架成本剧烈波动;任务完成时间与人工返工没有同步披露;隐私政策与产品内开关无法让用户明确控制训练用途。
最乐观的剧本:环境编译器成为 MiniMax 真正的平台。
MiniMax 把 Forge 从内部 RL 系统推进为一套可审计协议:企业在本地把失败任务脱敏、重放和评分,只上传必要的梯度、奖励统计或合成轨迹;开发者可以把专业 SOP、测试与交付物规则打包成环境;模型、Harness 与 evaluator 在明确版本下联合评测。这样一来,开源不再与反馈回流冲突,专业用户也不必交出原始代码和文档。MiniMax 获得的不是所有用户数据,而是比原始日志更干净的「失败定义」。
这条最乐观路径还有一道文化门槛。过去的软件公司把用户失败视为客服工单,模型公司容易把它视为训练样本。真正成熟的 Agent 公司要多做一步:把失败视为一项需要获得授权、能够复现、可以归责的实验。只有这样,自动学习才不会以牺牲用户控制为代价。
今日新闻开头提到的缓存、调度和 Token 消耗,看上去都是后台工程细节。写到这里,它们又回到了主线。Agent 能否持续学习,不只取决于模型会不会反思,还取决于一次失败是否便宜到值得重跑,一条轨迹是否干净到值得训练,一个用户是否信任系统到愿意贡献反馈。
模型竞争没有离开参数,只是参数之外,终于长出了生产系统。
五、信息来源
1. Founder Park:MiniMax 从内部办公 Agent 到 MiniMax Code 的反馈链披露 2. MiniMax M2 & Agent: Ingenious in Simplicity 3. MiniMax M2.1: Post-Training Experience and Insights for Agent Models 4. MiniMax M2.5: Built for Real-World Productivity 5. MiniMax:Forge 大规模原生 Agent RL 系统 6. MiniMax M2.7: Early Echoes of Self-Evolution 7. The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence 8. MiniMax Agent: What We Learned While Building in 2025 9. MiniMax Agent Team: Built for Long-Running Tasks and Continuous Evolution 10. MiniMax Group 香港招股书 11. MiniMax-01: Scaling Foundation Models with Lightning Attention 12. MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention 13. MiniMax 隐私政策 14. OpenAI: Introducing Codex 15. OpenAI: Harness engineering—leveraging Codex in an agent-first world 16. OpenAI: How agents are transforming work 17. Anthropic: Harness design for long-running application development 18. Anthropic: Trustworthy agents in practice 19. Anthropic Privacy Center: Is my data used for model training? 20. Google DeepMind: AlphaEvolve—A Gemini-powered coding agent for designing advanced algorithms 21. The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable 22. MiniMax M3 与 MiniMax Code 官方发布 23. Cursor: Improving Composer through real-time reinforcement learning 24. Cursor: Training Composer for longer horizons 25. Cursor 数据使用与 Privacy Mode 说明