Claude Mythos 实现 186 分钟自主连续任务,AI Agent 长时程能力时间轴提前半年兑现
2026/06/05
专家预测年底才到,今天就跑出来了
Anthropic 的 Claude Mythos 模型今日完成了一项业界此前预测至 2026 年底才能实现的里程碑:在持续 186 分钟(3 小时 6 分钟)的连续自主任务执行中,维持了 80% 的成功率,刷新了 AI Agent 长时程任务纪录。
186 分钟意味着 Agent 在无人工干预的情况下,连续执行复杂任务链超过 3 小时。此前,可信评测中 AI Agent 的稳定自主执行时间集中在 30 分钟以内。长时任务的核心工程挑战不是单次调用的准确率,而是上下文随时间累积错误、工具调用失败率随迭代次数上升,以及任务状态恢复机制不成熟——任何一处失败都会导致整条任务链断开。Claude Mythos 的 80% 成功率说明,上述三类工程问题在当前版本中都已有实质性改善。
AI 增长曲线在"自催化"
新智元聚合报道中的核心观察是:AI 的能力增长曲线正在呈现"自催化式坍塌"——此前在 2024 年初做出的 2026 年底预测,已经在 2026 年中提前兑现,时间轴压缩了约半年。
Claude Mythos 186 分钟是这一观察的具体证据。能力提升速度持续超出此前预测,背后是几个机制的叠加:更长的上下文窗口减少历史信息丢失,工具调用稳定性改善降低任务链断裂概率,错误恢复机制成熟让 Agent 在局部失败后能继续推进。这些工程改进的叠加推动了任务时长的非线性增长。
186 分钟打开了哪些新场景
从 30 分钟到 186 分钟,可覆盖的任务类型发生质变。
30 分钟量级能完成:单一代码文件的重构与测试、单次报告草稿生成、简单数据分析和格式化。这些任务需要人工监督"看着 Agent 跑"。
186 分钟量级理论上覆盖:跨多个模块的代码重构与端到端测试、从数据采集到完整报告的研究流程、多步骤的合规文件核验与信息比对。这些任务此前需要人工持续介入,现在进入"可以设定后离开"的阶段。
对金融科技场景而言,投研文档整理、合规审查辅助、多系统数据对比等工作流,已经从"需要紧密监督"进入"可以后台运行"。不过,能否在生产环境实际落地,还取决于企业安全治理和合规审计框架是否跟上——目前大多数合规框架仍针对 30 分钟以内的短时 Agent 任务设计。
能力在加速,但 Agent 不知道自己花了多少
同日发布的 BAGEN 研究提出了一个对应的问题:Agent 普遍存在乐观偏差,最会做任务的模型不一定最会估算成本,失败轨迹中 Agent 常常在耗尽预算时才发现任务不可行,而越弱的模型越倾向于乐观而非保守。该研究将"预算意识"定义为 AI Agent 的独立能力维度,并指出这一能力与任务执行能力的相关性弱。
这两件事放在同一天看:任务执行时长的记录被打破,而对自身资源消耗的感知仍然系统性不足。根据 BAGEN 研究的结论,解决路径是把预算作为运行时控制信号而非事后账单——即在任务执行过程中实时约束消耗,而不是事后审计。这是 Agent 框架层面的工程设计问题,与模型能力无关。