🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-08-04

Qwen3.8-Max 的 16 天自主编程:模型竞赛正从“会写代码”转向“能经营执行过程”

资料提供:前沿科技研究部
正在发生的事很多,这件帮你看过了

2026-08-04

一、触发新闻与一句话定义

阿里 Qwen 团队于 2026 年 8 月 3 日发布 Qwen3.8-Max,并称该模型从空目录连续自主编程约 16 天,完成并开源自进化代码智能体框架 oh-my-cli。模型采用稀疏 MoE 与混合注意力,总参数量 2.4 万亿、单次激活约 950 亿参数,支持 100 万 Token 上下文;截至 8 月 4 日,仓库页面可见约 480 次提交,并包含持久会话、检查点恢复、预算与运行上限、证据归档、命令策略和受保护治理平面。[1][3][4]

研究对象不是又一个“更会写代码”的模型,而是把模型、Agent 框架、长期状态、执行反馈、权限控制和云端推理连成一体的跨周自主工程系统。16 天是运行时长,不等于它能稳定完成任意“人类需要 16 天”的任务;公开仓库也不等于第三方已从相同初始条件复现完整轨迹。它没有证明软件工程已经无人化,却把竞争焦点从单次生成质量推向一个更难的问题:系统经历数百次错误、重试和上下文切换后,能否仍然保存方向并恢复进度。[1][3]

二、纵向分析:从诞生到当下

1. 2023:Qwen 一开始就没有把终点设在聊天框里

2023 年 8 月 3 日开放的 Qwen-7B 已把工具调用、Agent 和代码解释器列为正式能力,随后扩充到 1.8B、14B 和 72B。开放权重还让模型进入 vLLM、llama.cpp、IDE 插件和终端框架,使协议、工具返回、上下文压缩和权限策略等系统问题更早暴露。[5]

2. 2024:从通用代码能力,走向可验证的代码专模

2024 年,Qwen2 将部分型号上下文推到 128K;Qwen2.5 的预训练规模最高达到 18 万亿 Token,Qwen2.5-Coder 又使用约 5.5 万亿 Token 的代码及对齐数据训练,覆盖 92 种编程语言与 128K 上下文。[6][7][8][9] 但 HumanEval、LiveCodeBench、Aider 等指标主要回答短程生成和修复能力,不能证明模型在数百轮后仍会遵守先前决定;长上下文也不自动等于长期项目管理。

3. 2025 上半年:MoE 解决计算账,推理模式解决动作节奏

2025 年 4 月,Qwen3-235B-A22B 总参数 2350 亿、每次激活 220 亿,Qwen3-30B-A3B 每次激活 30 亿,并把思考模式与快速响应模式纳入同一家族。稀疏激活降低数百轮工具调用的单步成本,但不能保证路径正确;长程 Agent 还必须决定何时思考、执行和检查。[10]

4. 2025 年 7 月:Qwen3-Coder 把训练场搬进可执行环境

Qwen3-Coder 480B-A35B 原生支持 256K 上下文,可借 YaRN 外推至 100 万 Token;约 7.5 万亿 Token 预训练数据中代码占 70%。决定性变化是把真实代码任务放进能运行测试、返回错误并继续修改的环境,并建设约 2 万个可并行独立环境,让模型在执行—报错—修正中学习恢复。[11]

同期开放的 Qwen Code 最初基于 Gemini CLI 改造,并针对 Qwen3-Coder 调整提示和函数调用协议,也可通过兼容层进入其他框架。竞争对象由“模型本身”扩展为“模型在什么环境里学习和工作”。[11][18][33]

5. 2025 年下半年:长上下文不再只靠标准注意力硬扛

Qwen3-Next 以 Gated DeltaNet 和标准注意力组成混合架构,约四分之三层使用线性注意力、四分之一保留标准注意力;80B-A3B 基座模型以不到 Qwen3-32B 十分之一的训练 GPU 时长取得相近或略高能力。[12] 混合注意力改善长上下文效率,但 100 万 Token 仍不等于可靠记忆:跨周项目还要决定哪些信息进入持久状态、摘要或内容哈希,并在恢复时重建现场。

6. 2026 年初:从“会调用工具”转向“会积累经验”

Qwen3-Max-Thinking 的“take-experience”机制提炼上一轮有效经验,在近似 Token 消耗下改善多项推理、代码和工具评测。[13] Qwen3-Coder-Next 只有约 30 亿激活参数,却借可验证任务、环境交互、Agent 轨迹监督和蒸馏增强工具使用与失败恢复,说明长程能力不仅来自更大模型,也来自更好的训练信号和轨迹管理。[14]

Qwen3.5 进一步把视觉、语言、代码和 Agent 能力合入原生多模态模型;397B-A17B 使用 Gated DeltaNet、稀疏 MoE 与标准注意力混合,托管版默认提供 100 万 Token 上下文和内置工具,使界面与文档反馈能反复进入执行循环。[15]

7. 2026 年春夏:从 35 小时到 16 天,阿里把模型嵌进自己的云与芯片

2026 年 4 月,Qwen3.6-35B-A3B 以 350 亿总参数、约 30 亿激活参数面向 Agent 编码和本地部署;5 月,Qwen3.7-Max 内部演示持续 35 小时并调用工具 1000 多次,为训练中未见过的真武 M890 芯片生成性能超过厂商基线的计算内核。[16][17]

同一时期,阿里把 AgentRun、AgentLoop、AgentTeams 和 TokenWorks 分别用于生命周期、跟踪评估、多 Agent 协作及推理调度,并在 WAIC 2026 将 Qwen3.8-Max Preview 接入 Token Plan、Qoder 和 QoderWork。[2][17] 模型、云、调度、终端产品和芯片场景被放进同一工程账;若每轮可靠率为 99%,连续 500 个关键步骤全部正确的理论概率仅约 0.66%,所以系统必须允许失败并恢复。

8. 2026 年 8 月:oh-my-cli 展示的不是“写了多少代码”,而是如何不失控

官方成绩中,Qwen3.8-Max 在 Terminal-Bench 2.1 得到 86.6、PaperBench 得到 93.0,但 SWE-Bench Pro 与 FrontierSWE 分别为 67.7 和 73.5,低于官方表中最强对手。[1][19][20] 这表明它在反馈明确的执行环境中很强,却未在所有复杂真实仓库任务上占优。

oh-my-cli 把安全审批、防伪预览、目录信任边界、确定性命令策略、持久 JSONL 会话、逐轮撤销与重做、预算上限、检查点、独立 worktree 和证据归档做成一等功能;Bot 可以提出治理修改,却不能自行落地受保护平面的变更。[3] 所谓“自进化”,不是赋予模型不受限的自我改写权,而是把它置于可留痕、限权和回滚的生产系统中。

9. 证据边界:一次成功轨迹,离通用能力还有三道门

第一道门是复现:目前能检查仓库、提交和治理设计,但缺少独立团队在相同模型、初始条件和预算下完整重跑 16 天;权重仍处于预计开放阶段。[1][3][4]

第二道门是归因:官方编码评测使用包括 Claude Code 在内的 Agent 外壳,oh-my-cli 又把大量可靠性放在框架层,单次演示无法拆分模型、提示、协议、压缩和恢复机制的贡献;SWE-Bench Mobile 甚至发现,同一模型更换 Agent 设计后成绩最高可相差 6 倍。[1][3][21]

第三道门是外推:METR 的“50% 任务完成时间跨度”按人类专家完成同一任务所需时间计算,不按模型在线运行时长计算;其数据对超过 16 小时的估计也提示样本不足和不稳定。[22][23] 因此,16 天是耐久性证据,不是能力时间跨度已从小时跃迁到两周的证明。

三、横向分析:竞争图谱

代码 Agent 至少应沿五个维度比较:下一步判断、状态保存、可验证反馈、权限控制和数百轮成本。

1. Anthropic:把长程能力建立在“可检查的自治”上

Anthropic 以 Claude Code 的 checkpoint、subagent、hook、后台任务和 dynamic workflows 强化可检查自治;Claude Opus 4.8 提供 100 万 Token 上下文,官方称其让有缺陷代码未经说明便通过的概率较前代下降约四倍。[24][25] 其长期 C 编译器项目由约 2000 个受管理会话组成,强调测试预言机、持久记忆和编排,而非一条连续跨周轨迹。[27]

现实数据更保守:2026 年 2 月,最长一档 Claude Code 会话的自主运行时间从不足 25 分钟增至超过 45 分钟;6 月样本中的每周平均使用 20 小时是多个交互时段之和,并非单次无人值守。[26][28]

2. OpenAI Codex:把长程工作做成多 Agent 调度和随时可插手的协作

OpenAI Codex 以本地循环、云任务、桌面多 Agent 与 worktree、移动端审批和跨设备接力扩大有效工作量,而非假设人会消失 16 天。[29][30] 2026 年 6 月披露的抽样个人用户中,80.6% 发起过至少一次估计需人类 30 分钟以上的任务,70.2% 发起过一小时以上任务,25.6% 发起过八小时以上任务;最重度 1% 用户依靠并行任务每天生成 60 小时以上 Agent 回合。[31]

Qwen 的代表形态是一条可恢复的长轨迹,Codex 的代表形态则是多个隔离 worktree 中的并行轨迹,由人统一审查和合并。Codex 强于并行调度、跨设备监督和企业控制面;Qwen 的差异在开放部署、多协议兼容以及对数据主权、网络隔离和国产算力环境的适配。[18][29][30][32]

3. Google:用开放 CLI 和搜索生态占住入口,随后转向 Antigravity

Google 以开放的 Gemini CLI、100 万 Token 上下文、文件与命令工具、MCP 扩展及搜索和开发生态占据入口;Qwen Code 从 Gemini CLI v0.8.2 分叉后转向多协议、多平台执行层。[18][33] Google 后续推动开发工具向 Antigravity 迁移,连接面更广,但会话状态、扩展兼容和产品边界仍在变化;Qwen 则明确争取不锁定模型的执行层。[34]

4. 开放模型阵营:价格和权重只是入场券,环境才是复利来源

DeepSeek、Kimi、MiniMax、GLM 等开放或开放权重模型正在降低一次生成的价格,但更难复制的是可执行强化学习环境、失败轨迹、测试设施和大规模调度。Qwen3-Coder 的约 2 万个并行环境、Qwen-AgentWorld、TokenWorks、AgentLoop 与自有芯片场景构成反馈回路:部署暴露的失败被整理成可验证任务,再回到训练与框架。[2][11][17]

5. 五个维度下,Qwen3.8-Max 到底站在哪里

连续性上,Qwen 给出醒目的厂商长跑,Anthropic 的多会话项目和 OpenAI 的多 Agent 工作量则更接近可管理的长期劳动。可验证性上,Qwen 受益于编译、测试、性能计数器和 PaperBench,但产品设计等开放目标缺少客观验证器。[1][19][27][31]

治理上,Qwen、Claude Code 和 Codex 都把审批、沙箱、checkpoint 或遥测置于核心,说明长程能力越强,越不能只靠系统提示划定安全边界。[3][24][32] 经济性上,MoE、混合注意力、缓存和自有推理栈降低单步成本,但 950 亿激活参数仍不轻量,且官方未披露 16 天项目的完整 Token、算力、失败分支和人工复核成本。[1][2]

开放性可能是 Qwen 最明显的差异:若 Qwen3.8-Max 如期开放权重,并保留公开框架和轨迹,研究者才能通过固定模型换框架、固定框架换模型等消融实验,把 16 天从故事变成可积累的工程知识。[1][3][18]

四、横纵交汇洞察

1. 16 天不是突然长出来的能力,而是三条历史路线在同一点相交

16 天能力由三条路线相交形成:2023 年以来的开放生态扩大硬件、框架和协议反馈;从 Qwen3 MoE、Qwen3-Next 混合注意力到 100 万 Token 上下文,持续压低长链路的计算约束;Qwen3-Coder 的约 2 万个并行环境则把错误变成可执行反馈。[5][10][11][12][15]

横向看,Anthropic 先做深编码判断、权限和多会话编排,OpenAI 先规模化并行 Agent、worktree 与跨端监督,Google 依靠开放 CLI 和工具生态占据入口;Qwen 的独特组合是开放权重路线、自有云栈和自我开发的公开项目。[2][24][27][29][30][33]

2. 长程 Agent 的核心变量不是记忆长度,而是“可恢复进度”

上下文窗口回答模型此刻能读多少,项目状态回答中断后哪些事实仍然有效。oh-my-cli 用代码和 Git 保存客观产物,用 JSONL 保存交互,用 checkpoint 保存恢复位置,用摘要与 scorecard 压缩进展,用元数据、摘要和内容哈希归档证据,并把不可自行修改的规则置于治理平面。[3]

Claude 的多会话 C 编译器、Codex 的 worktree 并行和 Qwen 的单项目长跑形态不同,底层却都把智能从一次对话迁移到仓库、测试、任务图和可审计事件流等持久工件。[3][27][29]

3. 时间越长,模型能力越容易被系统可靠性吞掉

若每个关键步骤有 99.5% 概率不造成需要回滚的错误,连续 500 步全部无错的概率也只有约 8%。因此长程系统必须把检测异常、限制损失、回滚、总结原因和从检查点继续视为正常路径,而不能要求模型一路完美。

Qwen 的快速版本演进也会成为维护负担:跨周任务中模型 ID、协议、提示或框架行为变化可能改变输出分布,使旧检查点失稳;长程产品需要比聊天产品更严格的版本固定、依赖锁定和重放机制。

4. 公开成功轨迹的最大价值,不是证明无人化,而是暴露可研究对象

公开轨迹至少暴露三个对象:可审查的代码、测试和依赖产物;可分析提交、回滚和修复模式的过程;可单独复用的预算、权限、恢复和治理系统。[3][4]

真正有说服力的下一步不是宣布 30 天,而是公开固定模型版本、总 Token、推理成本、人工介入次数、失败分支、回滚次数、测试通过率变化及从空目录重放的脚本。只有不同团队在不同云和 Agent 外壳上取得相近结果,领先才会从首个故事变成可复制能力。

5. 软件组织会从按人分工,转向按证据和权限分工

Agent 进入软件组织后,分工边界可能从前端、后端、测试和运维,转向谁可以写、执行、批准、验证和保管最终规则。oh-my-cli 已允许 Bot 发现问题、创建 Issue、在独立 worktree 修改并提交,却禁止其自行改变最高权限规则或强制删除未合并工作。[3]

在金融、医疗和关键基础设施中,跨周能力并不构成生产授权;可审计事件流、确定性命令策略、凭证隔离、人工审批阈值和可恢复工件,才决定 Agent 能否离开沙箱。长程能力扩大可委托范围,也扩大单次误判的累积半径。

6. 三个未来剧本

最可能的剧本是:未来 12—18 个月,跨周 Agent 成为有人值守的后台工程队,多个隔离任务负责升级、测试、迁移、文档和优化,人每天查看一到数次并处理冲突与高风险审批。可观察信号包括按周任务成功率、人工介入间隔、恢复后的重复劳动,以及 Agent 记录是否进入软件审计。

最危险的剧本是:时长成为新 benchmark,厂商用低价值循环、宽松测试或事后筛选优化“不断线”而非“做对事”。若只报告天数,不报告预算、人工介入和失败轨迹,依赖投毒、提示注入、凭证泄露与成本失控会被掩盖。

最乐观的剧本是:开放权重和完整轨迹促成任务状态、检查点、证据归档、预算与人工介入的交换标准,同一项目可在 Qwen、Claude、Codex、Gemini 和本地小模型间重放。届时竞争指标将变为:在相同预算、权限和恢复条件下,谁交付最多可验证进度。

Qwen3.8-Max 最有价值的产物,不只是又一个代码助手,而是一部分使模型能够长期工作、又不至于完全失控的外壳。模型在学习工作,系统在学习约束模型;下一轮胜负,很可能由后半句决定。

五、信息来源

1. Qwen3.8-Max 官方发布页:Qwen3.8(访问于 2026-08-04) 2. Alibaba Group:Alibaba Cloud Unveils Agent-Native Innovations at WAIC 2026(访问于 2026-08-04) 3. GitHub:qwen-code-dev-bot/oh-my-cli(访问于 2026-08-04) 4. GitHub API:oh-my-cli 仓库元数据(访问于 2026-08-04) 5. Qwen:Introducing Qwen(访问于 2026-08-04) 6. Qwen:Hello Qwen2(访问于 2026-08-04) 7. Qwen:Qwen2.5: A Party of Foundation Models(访问于 2026-08-04) 8. Qwen:Qwen2.5-Coder: Code More, Learn More(访问于 2026-08-04) 9. Qwen:Qwen2.5-Coder Series: Powerful, Diverse, Practical(访问于 2026-08-04) 10. Qwen:Qwen3: Think Deeper, Act Faster(访问于 2026-08-04) 11. Qwen:Qwen3-Coder: Agentic Coding in the World(访问于 2026-08-04) 12. Qwen:Qwen3-Next: Towards Ultimate Training & Inference Efficiency(访问于 2026-08-04) 13. Qwen:Pushing Qwen3-Max-Thinking Beyond its Limits(访问于 2026-08-04) 14. Qwen:Qwen3-Coder-Next: Pushing Small Hybrid Models on Agentic Coding(访问于 2026-08-04) 15. Qwen:Qwen3.5: Towards Native Multimodal Agents(访问于 2026-08-04) 16. Qwen:Qwen3.6-35B-A3B: Agentic Coding Power, Now Open to All(访问于 2026-08-04) 17. Alibaba Group:Alibaba Unveils New AI Chip, Flagship Model, and Rebuilt Cloud Stack for Agentic Era(访问于 2026-08-04) 18. GitHub:QwenLM/qwen-code(访问于 2026-08-04) 19. OpenAI:PaperBench(访问于 2026-08-04) 20. SWE-Bench Pro:Can AI Agents Solve Long-Horizon Software Engineering Tasks?(访问于 2026-08-04) 21. SWE-Bench Mobile:Can Large Language Model Agents Develop Industry-Level Mobile Applications?(访问于 2026-08-04) 22. METR:Task-Completion Time Horizons of Frontier AI Models(访问于 2026-08-04) 23. METR:Measuring AI Ability to Complete Long Software Tasks(访问于 2026-08-04) 24. Anthropic:Enabling Claude Code to Work More Autonomously(访问于 2026-08-04) 25. Anthropic:Introducing Claude Opus 4.8(访问于 2026-08-04) 26. Anthropic:Measuring AI Agent Autonomy in Practice(访问于 2026-08-04) 27. Anthropic:Long-running Claude for Scientific Computing(访问于 2026-08-04) 28. Anthropic:Agentic Coding and Persistent Returns to Expertise(访问于 2026-08-04) 29. OpenAI:Introducing the Codex App(访问于 2026-08-04) 30. OpenAI:Work with Codex from Anywhere(访问于 2026-08-04) 31. OpenAI:How Agents Are Transforming Work(访问于 2026-08-04) 32. OpenAI:Running Codex Safely at OpenAI(访问于 2026-08-04) 33. Google:Gemini CLI, Your Open-Source AI Agent(访问于 2026-08-04) 34. Google:Building the Agentic Future—Developer Highlights from I/O 2026(访问于 2026-08-04)

图文卡片 ⬇️ 一键下载图文卡片