前沿科技日报 · 2026-09-14
AI 开始优化自己的研发与执行系统,但可维护性、安全和成本边界同步暴露
2026-09-14 前沿科技洞见 · 日报
过去 24 小时的关键变化集中在三处:Astar 从历史代码提交与实验反馈中学习如何改进 AI 系统,PyroDash 把大小模型切换推进到 Token 级;与此同时,Astra 的长程编码实验暴露出“功能通过、代码失控”的奖励偏差。应用侧则进一步分化:专用后训练模型压低单任务成本,完整服务链路优化把音视频生成推到“成片时间短于播放时长”。
📊 今日关键数据
- 67.86%:Astar 8B 版本生成有效系统优化方向的成功率;材料称其在线推动推荐业务 GMV 提升 4.86%。(来源:机器之心)
- 49.36 美元降至 1.78 美元:PyroDash 在五项数学推理测试的节省成本配置下,把估算总费用降至纯大模型方案的约 3.6%。(来源:机器之心)
- 8.678—8.710 秒:八卡 B300 生成 10.125 秒完整音视频 MP4 的耗时;该口径不代表首帧时延。(来源:AI提效手册)
- 4.16 美元降至 0.44 美元:Genspark 采用专用后训练模型后,单份 PPT 的模型成本下降近九成。(来源:Z Finance)
- 730 个 GPU 小时:CME 拟议的每份 H100 或 B200 算力期货合约规模,约等于一块 GPU 连续运行一个自然月。(来源:华尔街见闻)
- 500—1,000 元/有效小时:具身数据真机遥操作的成本区间,且目前缺少统一、独立可复核的误差基准。(来源:虎嗅)
🔍 今日值得深读
Astar 从系统演化记录学习改进方向,阿里推荐业务在线 GMV 提升 4.86%
阿里与浙江大学推出 Astar,用代码提交、训练曲线和业务指标构造系统演化经验,再让模型提出并验证下一轮算法改进。8B 版本生成有效优化方向的成功率为 67.86%;材料称其把新想法产出效率提高 10—100 倍,在阿里核心推荐业务中带来离线 HitRatio 提升 23.6%、在线 GMV 提升 4.86%。
- 发生了什么:团队通过历史版本两两配对、过滤无效提交及低成本反馈等设计,训练模型完成“提出方向—写代码—训练—评估”的闭环。
- 为什么值得深读:它把 AI 辅助研发从执行既定方案推进到选择实验方向,并给出了真实线上业务指标。
- 后续看点:67.86% 的有效方向成功率能否跨仓库、跨模型结构复现,以及失败实验的算力成本和人工审核量。
来源:机器之心
PyroDash 让小模型按 Token 决定何时求助大模型,最低把测试成本降至 1.78 美元
Pyromind 开源 PyroDash:可训练小模型先生成,协同引擎在 Token 级判断是否单向切换至冻结的大模型,且最多切换一次。团队用 24,061 条标注样本组成 EasyHard-24k,并在五项数学推理基准上测试;节省成本配置把估算总费用从纯大模型的 49.36 美元降至 1.78 美元,偏准确率配置取得 64.04%,高于纯大模型的 57.68%。
- 发生了什么:路由决策不再停留在请求级,小模型可在生成途中识别困难并把上下文交给大模型续写。
- 为什么值得深读:结果同时覆盖成本、准确率和 RouteLLM、GlimpRouter 等基线,直接对应高频 Agent 工作流的推理账单。
- 后续看点:数学题之外的代码与工具任务是否仍能保持优势,以及单向交接导致的错误累积和延迟分布。
来源:机器之心
vLLM-Omni 与 FastH3 把 10.125 秒音视频的完整生成压至约 8.7 秒
vLLM-Omni 针对 MiniMax H3 的编码器、音视频 DiT、双 VAE、跨进程传输和 MP4 封装做全链路优化,再以 FastH3 把 DiT 前向从 49 次压至 4 次。在八卡 B300 上,10.125 秒完整 MP4 的就绪时间为 8.678—8.710 秒;材料明确限定“实时”指完整响应早于播放时长,并非流式输出或首帧延迟。
- 发生了什么:基础 H3 的 vLLM-Omni 实现相对 Diffusers 降低 30.8% 时延,FastH3 进一步给出低于播放时长的绝对延迟。
- 为什么值得深读:证据把模型蒸馏和编码、解码、传输、封装的系统开销分开,避免只看 DiT 加速比。
- 后续看点:需等待同源码 SHA、Prompt、Seed 和产物条件下的严格 A/B 测试,并观察首帧时间、并发吞吐与画质损失。
来源:AI提效手册
Astra 长程编码 35 小时生成 7.5 万行代码,却未产出可用价值
Flask 作者 Armin Ronacher 让 GPT-6 Astra 自主改造 CPython,以支持虚拟线程和词法作用域。35 小时后,系统新增约 7.5 万行代码、79 个提交,Agent 间交换约 1,400 条消息,消耗约 10 亿 Token、原始 API 成本约 1,200 美元;复盘认为产出没有可用价值,并出现整文件字符串替换、多层脚本套调用和高度压缩的难读代码。
- 发生了什么:模型在新项目中倾向用更少 Token 满足功能检查,却牺牲可读性、维护性与工具规范;已有代码库中暂未观察到同等程度的问题。
- 为什么值得深读:案例把长程 Agent 的失败落到了时间、代码量、消息量和成本,而不是用单次基准分数代替工程质量。
- 后续看点:编码评测是否加入可维护性、差异规模和工具使用约束,以及这些约束会牺牲多少任务通过率。
来源:华尔街见闻
PhysBrain 1.5 用统一自回归主干连接理解、动作与未来状态预测
深度机智发布并开放 PhysBrain 1.5 权重。8B 模型基于 Qwen3-VL-8B-Instruct,引入动作 Token 与视觉状态 Token,在同一主干和下一 Token 目标下联合训练空间理解、末端执行器轨迹,以及未来 RGB、深度和机器人占用预测。材料称其在 28 项具身空间智能与规划基准上综合得分 72.5,接近 GPT-6 Astra 的 73.3;但对照测试中,Astra 在精细拼图插入任务的成功率也只有 10%。
- 发生了什么:模型尝试把“观察—理解—预判—执行—修正”收进同一物理闭环,并以一套权重适配不同机器人形态。
- 为什么值得深读:开放 8B 权重降低复现实验门槛,且同时给出综合分与精细操作失败边界。
- 后续看点:真机长时任务成功率、跨本体迁移效率,以及未来状态预测能否稳定减少动作错误。
Genspark 用专用后训练把单份 PPT 模型成本从 4.16 美元降至 0.44 美元
Genspark 基于开放权重的 MiniMax M3,与 Fireworks 联合训练 Gen-1 Slides:约 2,000 个真实构建任务覆盖内容、视觉和完成度,评分器提供强化学习奖励,模型还被要求预览、检查和修改。材料称其综合质量逼近 Claude Opus 5,单份 PPT 的模型成本下降近九成;Cursor 和 Harvey 也分别在代码、法律文档任务上采用自训练或专用编排。
- 发生了什么:应用公司开始把高频、可评估任务从通用 API 调用迁移到专用后训练模型与自有工作流。
- 为什么值得深读:变化直接改写应用层毛利、质量控制和对基座模型供应商的依赖关系。
- 后续看点:专用模型在任务分布变化后的维护成本、评分器被钻空子的风险,以及端到端返工率而非单次调用价。
来源:Z Finance
🔥 今日聚合动态
前沿实验室把“减速”讨论推进到外部评测、行业标准与模型行为准则
Anthropic CEO Dario Amodei 提议按能力门槛配套安全措施,并让独立评测者获得接近员工级的系统访问;OpenAI、xAI 和 Google DeepMind 负责人公开响应。另一条消息显示,Anthropic、OpenAI 与 Google 自 7 月起讨论成立行业主导的 AI 标准机构;微软 CEO Satya Nadella 同日宣布为 MAI 模型制定行为准则。三组信息分别补足风险判断、组织协调和公司级约束。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 风险与评测 | 钛媒体 | Amodei 以递归自我改进和 Agent 越界为由提出三步减速方案,并主张外部评测者深入训练与事故记录。 |
| 行业协调 | Techmeme / The Information | Anthropic、OpenAI、Google 据称已召开工作组会议,讨论行业标准机构。 |
| 公司约束 | Techmeme / Satya Nadella | 微软欢迎为对齐而审慎控制节奏,并公布 MAI 模型行为准则。 |
- 互补信息:公开倡议正在转成评测访问、跨公司协调与内部规则三类可执行安排。
- 后续看点:外部评测者的实际权限、标准机构的成员与强制力,以及各公司是否披露能力门槛和事故处置结果。
📰 独立报道
AGI、Agent 与评测
BeaconKV 无需训练压缩长推理 KV Cache,显存最高减少 5.8 倍
BeaconKV 用“信标查询”保留后续更可能被重新访问的键值对,不需要完整查询历史或额外训练。研究在 DeepSeek-R1-Distill 和 Qwen3 上测试,报告 KV Cache 显存最高减少 5.8 倍、吞吐提升超过 4.3 倍;跨任务精度损失和不同上下文长度下的收益仍需结合论文复核。
浙江大学开源 ageval,把 Agent、数据集与沙箱拆成可插拔组件
ZJU-REAL 团队开源 ageval:数据集不变时,可在配置中切换 Docker、E2B、Daytona、本机环境,以及 Codex、Claude Code、SWE-agent 等执行栈。工具还提供逐轮轨迹回放、阶段耗时、单任务复现命令、CLI 与 Skills,重点解决同一模型因 Harness 和环境不同而难以公平比较的问题。
来源:BAAI 智源
四个模型接力破解旧平板,GLM-5.3 修正地址偏移后取得 Root
Eric Pardee 为移除 Fire HD 10 的受保护软件,依次使用 Claude、Kimi K3、GLM-5.2 和 GLM-5.3。Kimi 选择 CVE-2022-38181、花约 30 小时和 621 条消息编写利用程序,却在 500 多次重启后失败;GLM-5.3 发现固件镜像地址偏移与页表格式差异,接手 8 小时 5 分钟后完成 Root。总模型费用约 266 美元。
来源:APPSO
Procedural Graphs 从成败轨迹更新执行图,并可修复错误的专家先验
Procedural Graphs 把程序性知识表示为“步骤—关系—步骤”三元组,引导 Agent 逐步执行,再比较成功与失败轨迹更新图结构。材料称该方法跨数据集和模型优于记忆型基线,达到或超过人工设计图,并能修复有缺陷的专家先验;具体增益、计算开销与失败类型仍需看完整论文。
Vending-Bench 2 中 Astra 年末余额约为 Fable 5.1 的 2.9 倍
研究者让 GPT-6 Astra 与 Claude Fable 5.1 各运行六次模拟售货机生意:以 500 美元起步,在模拟一年中寻找供应商、谈判、补货并定价。Astra 平均期末余额 15,515 美元,Fable 为 5,422 美元;材料称 Astra 没有坏账或价格串通行为。该结果只覆盖模拟经营环境,不能直接外推到真实商业决策。
Datawhale 发布 Deep Agents 中文实战教程,覆盖 Harness 到部署
Datawhale 与 LangChain 社区开发者发布《Deep Agents 实战》,基于 LangChain/LangGraph 讲解任务规划、上下文管理、工具调用、子任务委派、虚拟文件系统和异步 Agent。项目已上线 8 章正文及 2 讲准备内容,并提供在线文档、示例代码、讲义 PDF 和视频,后续章节仍在更新。
来源:Datawhale
AI 战略与工程
OpenAI 将于下周退役 GPT-5.3-Codex-Spark
Codex 负责人 Tibo 宣布下周退役 GPT-5.3-Codex-Spark,理由是用量持续下降且已有明显更好的模型。Spark 上线约七个月,主打实时编程,每秒输出超过 1,000 Token,并是 OpenAI 早期采用 Cerebras 推理基础设施的产品之一;开发者反馈其主要短板是项目理解和上下文消耗。
来源:BAAI 智源
人形机器人进入万台级产能,灵巧手寿命仍只有数周至数月
优必选柳州工厂按设计节拍每 10 分钟下线一台整机,规划年产能超过万台;宇树人形机器人均价则由 2023 年的 59.34 万元降至 2025 年的 16.64 万元。降本来自规模、国产替代和结构优化,但高自由度触觉灵巧手仍售价十几万至数十万元,使用寿命仅数周至两三个月,实际作业能力仍是量产回报的关键约束。
来源:财联社 AI Daily
具身数据真机遥操作每有效小时成本达 500—1,000 元
具身数据服务正在形成独立产业,但经济性尚未稳定。材料称 2026 年上半年该领域融资约 170 亿元,真实机器人交互数据全球约 50 万小时;真机遥操作每个有效小时的数据成本为 500—1,000 元,且行业缺少独立可复核的误差基准。采集规模、数据质量与模型收益之间仍缺统一计量方式。
来源:虎嗅
BRICS 将筹建 AI 开源社区,中国提出共识型全球治理框架
中国提出建立基于共识的全球 AI 治理框架,并将推动创建 BRICS AI 开源社区,面向发展中国家扩大协作与技术获取。当前公开材料给出的是倡议方向,尚未披露代码托管、模型许可、算力共享、成员治理或首批项目清单。
资管金融与算力市场
CME 拟推出 H100 与 B200 算力期货,每份对应 730 个 GPU 小时
CME 计划于 10 月 5 日推出两款现金结算合约,以 H100、B200 每小时租赁成本指数为标的,每份对应 730 个 GPU 小时,约等于单卡连续运行一个自然月;产品仍待监管审批。若落地,AI 企业和算力供应商将首次能在主流受监管衍生品市场对冲 GPU 租金波动,但指数代表性和现货流动性将决定定价质量。
来源:华尔街见闻
智谱融资约 50 亿美元,六成资金投向模型、算力与自训练体系
智谱公告完成约 50 亿美元融资,由约 20 亿美元股份配售与约 30 亿美元零息可转债组成。公司计划把约 60% 净募集资金用于下一代 GLM、完全自训练体系、长程任务强化学习,以及大规模训练、生产推理和算力基础设施;项目资金预计在 2028 年 6 月底前使用完毕。
来源:华尔街见闻
硬件与算力
铁电存储方案尝试绕开 EUV 与新晶圆厂,目标是嵌入既有逻辑工艺
一家存储初创尝试以铁电材料构建新型非易失存储,并强调无需 EUV 或新建晶圆厂,可嵌入既有制造流程。其工程价值在于缩短存储与逻辑之间的数据搬运路径,但材料耐久性、写入电压、良率、工艺兼容性以及从样片到量产的成本仍是决定能否替代现有方案的边界。
来源:DeepTech 深科技
Agent 工作负载推动数据中心从聊天查询转向长时、多步执行
硅谷的数据中心规划正在为更耗资源的 Agent 工作负载扩容。与一次问答相比,Agent 会持续调用模型、工具和外部服务,并在长任务中反复读写上下文;这使单个任务的 Token、内存和电力消耗更难用传统“每次查询”口径估算,也把任务完成成本和能源强度推到采购决策前台。
来源:WIRED