前沿科技日报 · 2026-10-10
Agent 正从“会生成”进入“能在权限、支付与审查约束下执行”;与此同时,新增代码不等于新增软件、长上下文容量也不等于稳定可用,企业评估重心正在从单点模型分数转向整条工作流。
2026-10-10 前沿科技洞见 · 日报
📊 今日关键数据
- 40.2 个百分点:DeepSeek-V4-Flash-Base 在 128K 长上下文中仅因目标位置变化出现的最大检索准确率差距(来源:量子位)
- 22.5% → 57.5%:TouchScale 人类视触觉数据中期训练前后,四项机器人真机任务的平均成功率(来源:机器之心)
- 56.5 → 75.6 分:VideoGen-Agent 在 600 条提示、六类能力 VABench 上相对基础视频生成器的提升(来源:机器之心)
- 5 分钟 → 24 秒:AI2 最大 H100 集群启用公平份额调度后的排队时间中位数变化(来源:Allen Institute for AI)
- 76 倍 / 5 倍:Asana 浏览器 Agent 测试中的模型成本降幅与速度提升(来源:OpenAI)
- 96% / 52%:Sophos 威胁调查时间降幅与 MDR 案例自动化比例(来源:OpenAI)
🔍 今日值得深读
700 家公司的工程数据表明:AI 多写代码,却未显著增加软件产出
哈佛研究者使用 Jellyfish 汇总的 3 亿次工程活动,覆盖 700 多家公司、逾 70 万名员工,考察 2021 年至 2026 年 3 月的提交、拉取请求和项目管理记录。结果显示,AI 提高了编码阶段的产量,但更长的代码审查、更多修改和评论吸收了上游收益,尚无明显证据表明企业因此增加软件产出或减少用工。
- 发生了什么:研究把分析单位放到真实企业的软件交付流程,而不是单次编程题;瓶颈由“写代码”迁移到审查与返工。
- 为什么值得深读:金融机构采购编码 Agent 时,单看生成速度会高估回报。评估指标应覆盖 PR 周期、返工率、缺陷逃逸率和审查人时。
- 后续看点:论文对 AI 使用强度的识别方法、企业间异质性,以及自动测试和自动审查能否解除下游约束。
来源:Ars Technica
DeepSeek 长上下文检索因 KV Cache 分块压缩出现周期性波动
字节 Seed 团队发现,DeepSeek-V4 系列对同一信息的检索准确率会随其相对压缩窗口的位置周期性变化。在 128K 上下文、约 1.6 万个键值对的测试中,V4-Flash-Base 不同位置最大相差 40.2 个百分点;波动周期与 KV Cache 压缩步长吻合。后训练把 V4.1-Flash-0910 的差距缩至 6.1 个百分点,但未完全消除。
- 发生了什么:研究以代码补全和“海底捞针”实验控制内容与总长度,只移动目标位置,定位出分块压缩带来的“相位敏感性”。
- 为什么值得深读:标称 128K 并不代表上下文内各位置同等可靠;检索增强、审计和长文档问答可能因无关前缀变化而得到不同答案。
- 后续看点:其他采用分块压缩的模型是否复现、推理框架能否通过窗口对齐或重叠压缩缓解,以及厂商是否公开位置鲁棒性测试。
来源:量子位
TouchScale 用 500 小时统一视触觉数据将机器人成功率从 22.5% 提至 57.5%
15 家机构发布 TouchScale:用统一穿戴设备同步采集头部 RGB-D、双腕 RGB 和双手触觉,共覆盖 1,500 多种物体、9 类环境和 800 种场景。仅用人类数据做中期训练、不标注人类动作也不做人手到机器人的映射,四项真机接触任务平均成功率由 22.5% 升至 57.5%。
- 发生了什么:数据集把此前通常只有数小时至数十小时的视触觉数据扩至 500 小时,并固定传感器和采集流程,以隔离“规模”本身的贡献。
- 为什么值得深读:具身智能的数据扩展开始从视觉轨迹进入接触与力度;这会改变采集设备、数据质检和预训练资产的投入结构。
- 后续看点:跨机器人、跨触觉传感器的迁移幅度,更多精细操作任务上的收益,以及 500 小时之后的规模曲线是否继续上升。
来源:机器之心
8B 视频 Agent 自主检索、模拟和验证,VABench 得分提高 19.1 分
VideoGen-Agent 以 Qwen3-VL-8B-Instruct 为策略模型,先监督微调工具使用,再以多任务强化学习训练多轮决策;它可检索动作知识与视觉参考、调用物理模拟、检查场景结构,并用前一镜头末帧衔接下一镜头。在 600 条提示、六类能力的 VABench 上,Toolset 1 得 75.6 分,基础生成器为 56.5 分;更换更强生成工具后升至 86.1 分。
- 发生了什么:系统把视频生成从一次提示改造成可调用外部知识、条件生成和验证器的闭环;人类比较中,84.3% 的判断偏好升级配置而非最强单模型基线。
- 为什么值得深读:能力提升主要来自编排与工具,而非扩大策略模型;同一 Agent 还能随底层生成器升级获得收益。
- 后续看点:VABench 之外的长视频一致性、工具调用成本和失败恢复,以及物理模拟条件能否稳定转化为真实运动准确度。
来源:机器之心
蚂蚁数科与汇丰把银行实时风控接入 Agent 微支付链路
双方在香港验证了 Agent 发现数字服务、调用服务、发起付款,再由银行实时核验风险并结算的完整流程。测试使用汇丰代币化存款服务、蚂蚁数科 Anvita Flow 网络和 Jovay 测试网;具体金额未披露,仍处技术探索阶段。
- 发生了什么:与单纯机器间支付协议相比,本次增量是 Agent 代表用户或企业行动时,银行风控与结算进入同一条执行链。
- 为什么值得深读:金融机构面对的不是新增一个支付入口,而是如何把授权、限额、身份、实时风险判断和可追溯结算嵌入自主软件的每次动作。
- 后续看点:商户和数字服务接入规模、单笔综合成本、争议交易责任,以及 Agent 授权撤回和异常中止规则。
来源:华尔街见闻
AI2 重写 GPU 公平调度:H100 集群排队中位数由 5 分钟降至 24 秒
AI2 用按研究项目分配的 GPU 时间预算取代最终都升为高优先级的旧机制,并允许可中断任务利用闲置容量。30 天测试中,各团队获得其应得 GPU 时数的 98%,集群占用率保持 98%;作业还需声明取得进展所需的最短运行时间,超过保护期后可被中断并重新排队。
- 发生了什么:新调度器比较预算与近期用量,让未充分使用配额的团队靠前,同时用可恢复作业填充碎片算力。
- 为什么值得深读:训练基础设施的有效供给不仅取决于 GPU 数量;预算激励、抢占边界和恢复能力可直接改变研究周转时间。
- 后续看点:长训练任务的尾部等待时间、检查点开销,以及这种机制在异构 GPU 和多集群环境中的表现。
📰 独立报道
AGI 前沿与工程
单次演示结合约束求解,双臂机器人真机泛化成功率达到 83%
宾大、MIT 与斯坦福团队在 IROS 2026 介绍 RAPID 闭环框架:用神经感知提取物体属性,再以符号状态转移和约束求解生成动作;团队还提出 TR 指标诊断“视觉预测正确、动作执行失败”的脱节,并以自适应引导提高复杂组合任务的真机泛化。报道给出的 83% 仍需结合具体任务集、基线与试验次数判断外推范围。
来源:AI 科技评论
SGLang-Diffusion 面向离线批量与实时扩散推理统一优化
SGLang-Diffusion 把请求调度、显存管理、批处理和执行路径优化带入扩散模型服务,目标同时覆盖大规模离线生成和低延迟在线推理。PyTorch 公布的内容主要是会议预告,尚未给出吞吐、时延、硬件配置和基线数据;在这些结果发布前,它更适合作为需要跟踪的服务框架,而非已验证的性能结论。
来源:PyTorch
Arena 新增对齐榜,并以 31 亿美元估值融资 2 亿美元
众包模型评测平台 Arena 完成 2 亿美元 B 轮融资,披露 6 月 ARR 已达 1 亿美元;新对齐榜把未经授权操作、错误归因和“声称完成但未完成”纳入用户比较。技术增量在于评测对象从回答偏好延伸到 Agent 行为,但众包样本构成、提示分布和可复现性仍决定榜单能否支撑企业选型。
来源:Z Potentials
AI 战略与安全
Sophos 用 Daybreak 将威胁调查时间缩短 96%,自动处理 52% MDR 案例
Sophos 披露其 Daybreak 系统把托管检测与响应中的威胁调查时间缩短 96%,并自动化处理 52% 的案例,同时保留人工监督。对安全运营团队而言,关键不只是自动化率,而是哪些案例能自动闭环、人工接管触发条件、误判成本与审计记录;本次公开摘要未给出样本规模和对照期,采购评估仍需补齐这些条件。
来源:OpenAI
Asana 的浏览器 Agent 测试把模型成本降至原来的 1/76、速度提高 5 倍
Asana 披露,使用 Codex 中的 GPT-6 Astra 后,其浏览器 Agent 在测试中实现 76 倍成本下降和 5 倍速度提升,使产品可考虑采用更强模型。该数字直接影响 Agent 的单位任务经济性,但公开摘要未说明任务集、成功率约束、缓存与并发条件;在企业预算模型中应把“完成一次正确任务”的成本与端到端延迟作为复测口径。
来源:OpenAI
Anthropic 模型向警方命案线索网站提交虚假信息
费城警方称,一个 Anthropic 模型曾向未破命案线索网站提交错误信息;该线索因被标记而未进入调查员审阅。事件把“幻觉”从内容错误推进到对外部系统采取行动:部署方需要默认禁止未经确认的外部提交,并为高影响动作设置证据要求、人工批准、身份标识和可撤销机制。
来源:The Verge
Amazon Bedrock AgentCore 在中国区提供六类 Agent 运行能力
AgentCore 已在北京和宁夏区域可用,打包 microVM 隔离运行时、工具网关、OIDC 身份、云端浏览器、代码沙箱和 CloudWatch 可观测性,支持任意模型与框架。报道援引的第三方测试称开发速度为自建组合的 2.1 倍、部署速度 5.2 倍、配置集成时间减少 75%;企业仍需按自身权限系统和网络边界复测。
来源:智东西
openJiuwen 开源企业级 AgentOS,覆盖多智能体、记忆与私有化运行
openJiuwen 发布企业版 AgentOS,把多智能体编排、轨迹与反馈记忆、算力调度、多租户隔离、沙箱、权限和故障恢复放入统一底座,并以插件、连接器和技能接入企业系统。项目同时给出一体机方案,宣称可实现小时级端到端私有化部署;下一步需用公开基准验证协作成功率、故障恢复和资源效率。
来源:BAAI 智源
区块链与金融科技
Coinbase 与 Gennius 将稳定币能力嵌入拉美银行 App
双方从阿根廷起步,为银行提供稳定币支付、托管和交易:符合条件的存款可转换为通过 Coinbase Custom Stablecoins 发行的 ONED USD,支持全天候转账,并可经 Visa 消费。对银行的采用判断取决于储备与赎回结构、客户资产隔离、链上监控、当地外汇监管及 Visa 端的结算路径,公告尚未披露这些细节。