Kimi K3 将月之暗面推进全球前沿组,竞争瓶颈转向有效成功成本
Kimi K3 将月之暗面推进全球前沿组,竞争瓶颈转向有效成功成本
2026/07/17
月之暗面于 7 月 16 日公开发布 Kimi K3。日报原始条目记录其总参数为 2.8 万亿,并计划在 7 月 27 日前发布权重;Kimi 官方材料称,K3 原生支持视觉与 100 万 token 上下文,采用 Kimi Delta Attention(KDA)、Attention Residuals(AttnRes)和每个 token 激活 896 个专家中 16 个的 Stable LatentMoE。官方把这些结构与训练配方合计约 2.5 倍的 scaling efficiency 提升相联系,但完整技术报告、消融结果和权重在发布日均未公开,因此这仍是厂商主张,而不是已独立复现的因果结论。[S1][S2]
同日,Artificial Analysis 在 Intelligence Index v4.1 中给 K3 记 57 分、列同类第 4;但其测得的生成速度为 62.0 token/s,低于同类中位数 72.2,完整指数评测产生 1.30 亿 output tokens,约为 6300 万中位数的两倍。Kimi 也承认 K3 总体仍落后 Claude Fable 5 与 GPT-5.6 Sol,并建议推理使用 64 个以上加速器组成的 supernode。[S2][S3] 因而,今天可以确认的“从 A 到 B”是:月之暗面正从在 K2 系列中分项强化长程智能体与代码效率,走向用单一多模态旗舰统一长上下文、推理和工具执行;尚不能确认的是,这种统一已经变成更低成本、更稳定的生产优势。
K2.6 到 K3 把分项强化变成统一旗舰,代际增量不再是“会用工具”
2025 年 1 月的 Kimi k1.5 论文已把强化学习上下文扩至 128K,并把较长推理轨迹与规划、反思和纠错联系起来,同时联合训练文本与视觉数据;这一节点只解释技术连续性,不作为近季度趋势证据。[S8] 真正的近期基线始于 4 月 20 日:K2.6 已是 1T 总参数、32B 激活参数、256K 上下文的原生图像/视频模型,官方案例展示了持续 12 小时、4000 多次工具调用和 14 轮迭代的长程编程。[S5][S6] 视觉、长上下文和智能体在 K3 之前已经存在,不能被表述为 K3 首次获得的能力。
6 月 12 日的 K2.7 Code 随后把矛盾从“能不能执行”推进到“能否少花推理预算完成”。官方更新称,其相对 K2.6 在 Program-Bench、MCP Mark Verified 和 SWE Marathon 分别提升 10.4%、11.4% 和 76.2%,同时把推理 token 用量降低 30%;这些是官方基准,不能外推为所有知识任务的普遍改善,却足以证明迭代目标已经转向长程成功率与过度思考控制。[S4] 到 K3,原生视觉、100 万 token、最大思考强度和更大的稀疏专家模型被放进同一基座,长程任务可以在代码、截图、知识材料与工具反馈之间维持更大状态空间。[S2]
能力栈因此从“长上下文推理—长程工具执行—代码效率分别推进”变成“多模态长任务在一个旗舰内汇合”;架构与规模也从 K2.6 的 1T、32B active、256K,变成 K3 的 2.8T、16-of-896 专家激活和 1M。按官方解释,KDA 试图降低长序列注意力负担,AttnRes 让深层网络选择性取回表示,高稀疏 MoE 则控制每个 token 的激活计算;用户侧应检验的是任务长度、模态覆盖、成功率与 token 用量,而不是总参数本身。[S2][S6] K3 同时改变了数据、训练、注意力、残差、路由、量化和代理框架,技术报告又未给出消融,因此不能把 57 分归因于某一个组件或“模型更大”。能力统一已经发生,架构对效率的独立贡献仍待复现。
K3 进入全球综合前四,但国内领先已分化为能力、成本与开放状态三种答案
K2.6 发布时,Artificial Analysis 已把它列为领先开放权重模型和当时总榜第 4,记录其 Intelligence Index 为 54;该结果与 K3 的 57 来自不同时点及可能不同版本的任务集,不能相减成“净提升 3 分”。[S6] 月之暗面从 K2.6 起已处在开放模型前沿,K3 在扩大能力覆盖后保持全球前四,而不是首次进入头部。
同口径横向比较给出了更清楚的边界。6 月 16 日,Artificial Analysis 在 v4.1 中把 GLM-5.2 记为 51 分的领先开放权重模型;它是 744B 总参数、40B 激活参数、100 万 token 的文本模型,采用 MIT 许可证,输入与输出价格分别为每百万 token 1.4 美元和 4.4 美元。[S7] K3 当前 57 分并支持图像输入,综合能力信号更强;GLM-5.2 则模型更小、按 token 价格更低且权重已经公开。与此同时,K3 发布日仍被第三方标为 proprietary,计划开放不能等同于已经形成可复现的自托管生态。[S1][S3][S7]
这组差异改变的是评估顺序,而不是自动给出唯一赢家:视觉长任务和跨模态知识工作可优先验证 K3;文本任务、现成自托管和按 token 预算敏感的团队仍可能偏向 GLM-5.2。K3 的第 4 名足以让它与 Claude、GPT 和 GLM 进入同一轮任务级测试,却不支持“全球第一”;“综合分更高”“成本更低”和“权重已开放”也不能压缩成一个榜单结论。月之暗面已从开放模型前沿挑战者推进为全球基模型前沿竞争者,但尚未越过国际最强档,也未获得所有部署约束下的国内唯一优势。
榜单优势尚未穿透吞吐、冗长度与超节点成本,生产验证成为新瓶颈
模型能力能否进入生产,取决于它如何穿过第四个位置:token、吞吐、硬件通信域和可复现性。K2.7 Code 已把推理 token 降低 30% 列为专项结果,说明冗长推理不是 K3 发布后才出现的问题;K2.6 的第三方完整评测也曾使用约 1.60 亿 reasoning tokens。[S4][S6] K3 的 1.30 亿 output tokens 虽不能与前述不同版本口径直接比较,却仍约为当前同类中位数两倍,且 62.0 token/s 低于中位数。[S3] 长思考和更广的能力覆盖可能提高成功率,也会增加等待时间、生成量和加速器通信需求,企业最终要比较的是每个成功任务的总 token、端到端时延、人工返工和硬件资源。
64 个以上加速器的 supernode 建议表明,模型级稀疏性不等于低门槛部署或更低系统总成本。[S2] 第三方第 4 只能提高 K3 进入试点清单的优先级,不能替代长程软件工程、视觉知识工作和 1M 上下文负载中的成功率、失败率、安全性与长期 SLA;权重、技术报告和消融实验则决定相关架构能否从设计意图变成可复现收益。当前没有独立客户长期数据,榜单也不证明市场份额、收入或稳定性。
三处已经发生的变化正在汇流:能力栈从分阶段强化走向单一旗舰统一,架构与规模从 256K/1T 推进到 1M/2.8T,第三方综合位置则继续停留在全球前四并在当前 v4.1 分数上高于 GLM-5.2。三处仍然滞后:Claude Fable 5 与 GPT-5.6 Sol 占据综合领先档,K3 的吞吐与输出量没有证明有效成功成本更低,权重后的独立复现、超节点系统成本和长期可靠性也仍为空白。K3 今日的发布因此确认并加速了“能力统一”判断,同时修正了“规模扩张等于生产优势”的推断:接下来一个季度,若在相同模型版本、思考预算、代理框架和硬件约束下,独立复测不能让 K3 在长上下文、智能体及视觉/知识工作中的至少三类任务稳定保持优势,或更高成功率仍无法覆盖高 token、低吞吐和硬件成本,那么“统一能力已转化为全球前沿竞争优势”这一判断就应被削弱;反之,公开消融与任务级总成本下降才会把今天的排名推进为可复现的生产结论。[S2][S3][S4][S7]
参考资料
- S1|Techmeme:Moonshot AI releases Kimi K3
- S2|Kimi Research:Kimi K3: Open Frontier Intelligence
- S3|Artificial Analysis:Kimi K3 Intelligence, Performance & Price Analysis
- S4|Kimi Code Docs:Kimi K2.7 Code June 12, 2026
- S5|Kimi Research:Kimi K2.6: Advancing Open-Source Coding
- S6|Artificial Analysis:Kimi K2.6: The new leading open weights model
- S7|Artificial Analysis:GLM-5.2 is the new leading open weights model
- S8|arXiv:Kimi k1.5: Scaling Reinforcement Learning with LLMs