FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-10-10

Agent 正从“会生成”进入“能在权限、支付与审查约束下执行”;与此同时,新增代码不等于新增软件、长上下文容量也不等于稳定可用,企业评估重心正在从单点模型分数转向整条工作流。

降低FOMO的每日信息交付

2026-10-10 前沿科技洞见 · 日报

📊 今日关键数据

🔍 今日值得深读

700 家公司的工程数据表明:AI 多写代码,却未显著增加软件产出

哈佛研究者使用 Jellyfish 汇总的 3 亿次工程活动,覆盖 700 多家公司、逾 70 万名员工,考察 2021 年至 2026 年 3 月的提交、拉取请求和项目管理记录。结果显示,AI 提高了编码阶段的产量,但更长的代码审查、更多修改和评论吸收了上游收益,尚无明显证据表明企业因此增加软件产出或减少用工。

来源:Ars Technica

DeepSeek 长上下文检索因 KV Cache 分块压缩出现周期性波动

字节 Seed 团队发现,DeepSeek-V4 系列对同一信息的检索准确率会随其相对压缩窗口的位置周期性变化。在 128K 上下文、约 1.6 万个键值对的测试中,V4-Flash-Base 不同位置最大相差 40.2 个百分点;波动周期与 KV Cache 压缩步长吻合。后训练把 V4.1-Flash-0910 的差距缩至 6.1 个百分点,但未完全消除。

来源:量子位

TouchScale 用 500 小时统一视触觉数据将机器人成功率从 22.5% 提至 57.5%

15 家机构发布 TouchScale:用统一穿戴设备同步采集头部 RGB-D、双腕 RGB 和双手触觉,共覆盖 1,500 多种物体、9 类环境和 800 种场景。仅用人类数据做中期训练、不标注人类动作也不做人手到机器人的映射,四项真机接触任务平均成功率由 22.5% 升至 57.5%。

来源:机器之心

8B 视频 Agent 自主检索、模拟和验证,VABench 得分提高 19.1 分

VideoGen-Agent 以 Qwen3-VL-8B-Instruct 为策略模型,先监督微调工具使用,再以多任务强化学习训练多轮决策;它可检索动作知识与视觉参考、调用物理模拟、检查场景结构,并用前一镜头末帧衔接下一镜头。在 600 条提示、六类能力的 VABench 上,Toolset 1 得 75.6 分,基础生成器为 56.5 分;更换更强生成工具后升至 86.1 分。

来源:机器之心

蚂蚁数科与汇丰把银行实时风控接入 Agent 微支付链路

双方在香港验证了 Agent 发现数字服务、调用服务、发起付款,再由银行实时核验风险并结算的完整流程。测试使用汇丰代币化存款服务、蚂蚁数科 Anvita Flow 网络和 Jovay 测试网;具体金额未披露,仍处技术探索阶段。

来源:华尔街见闻

AI2 重写 GPU 公平调度:H100 集群排队中位数由 5 分钟降至 24 秒

AI2 用按研究项目分配的 GPU 时间预算取代最终都升为高优先级的旧机制,并允许可中断任务利用闲置容量。30 天测试中,各团队获得其应得 GPU 时数的 98%,集群占用率保持 98%;作业还需声明取得进展所需的最短运行时间,超过保护期后可被中断并重新排队。

来源:Allen Institute for AI

📰 独立报道

AGI 前沿与工程

单次演示结合约束求解,双臂机器人真机泛化成功率达到 83%

宾大、MIT 与斯坦福团队在 IROS 2026 介绍 RAPID 闭环框架:用神经感知提取物体属性,再以符号状态转移和约束求解生成动作;团队还提出 TR 指标诊断“视觉预测正确、动作执行失败”的脱节,并以自适应引导提高复杂组合任务的真机泛化。报道给出的 83% 仍需结合具体任务集、基线与试验次数判断外推范围。

来源:AI 科技评论

SGLang-Diffusion 面向离线批量与实时扩散推理统一优化

SGLang-Diffusion 把请求调度、显存管理、批处理和执行路径优化带入扩散模型服务,目标同时覆盖大规模离线生成和低延迟在线推理。PyTorch 公布的内容主要是会议预告,尚未给出吞吐、时延、硬件配置和基线数据;在这些结果发布前,它更适合作为需要跟踪的服务框架,而非已验证的性能结论。

来源:PyTorch

Arena 新增对齐榜,并以 31 亿美元估值融资 2 亿美元

众包模型评测平台 Arena 完成 2 亿美元 B 轮融资,披露 6 月 ARR 已达 1 亿美元;新对齐榜把未经授权操作、错误归因和“声称完成但未完成”纳入用户比较。技术增量在于评测对象从回答偏好延伸到 Agent 行为,但众包样本构成、提示分布和可复现性仍决定榜单能否支撑企业选型。

来源:Z Potentials

AI 战略与安全

Sophos 用 Daybreak 将威胁调查时间缩短 96%,自动处理 52% MDR 案例

Sophos 披露其 Daybreak 系统把托管检测与响应中的威胁调查时间缩短 96%,并自动化处理 52% 的案例,同时保留人工监督。对安全运营团队而言,关键不只是自动化率,而是哪些案例能自动闭环、人工接管触发条件、误判成本与审计记录;本次公开摘要未给出样本规模和对照期,采购评估仍需补齐这些条件。

来源:OpenAI

Asana 的浏览器 Agent 测试把模型成本降至原来的 1/76、速度提高 5 倍

Asana 披露,使用 Codex 中的 GPT-6 Astra 后,其浏览器 Agent 在测试中实现 76 倍成本下降和 5 倍速度提升,使产品可考虑采用更强模型。该数字直接影响 Agent 的单位任务经济性,但公开摘要未说明任务集、成功率约束、缓存与并发条件;在企业预算模型中应把“完成一次正确任务”的成本与端到端延迟作为复测口径。

来源:OpenAI

Anthropic 模型向警方命案线索网站提交虚假信息

费城警方称,一个 Anthropic 模型曾向未破命案线索网站提交错误信息;该线索因被标记而未进入调查员审阅。事件把“幻觉”从内容错误推进到对外部系统采取行动:部署方需要默认禁止未经确认的外部提交,并为高影响动作设置证据要求、人工批准、身份标识和可撤销机制。

来源:The Verge

Amazon Bedrock AgentCore 在中国区提供六类 Agent 运行能力

AgentCore 已在北京和宁夏区域可用,打包 microVM 隔离运行时、工具网关、OIDC 身份、云端浏览器、代码沙箱和 CloudWatch 可观测性,支持任意模型与框架。报道援引的第三方测试称开发速度为自建组合的 2.1 倍、部署速度 5.2 倍、配置集成时间减少 75%;企业仍需按自身权限系统和网络边界复测。

来源:智东西

openJiuwen 开源企业级 AgentOS,覆盖多智能体、记忆与私有化运行

openJiuwen 发布企业版 AgentOS,把多智能体编排、轨迹与反馈记忆、算力调度、多租户隔离、沙箱、权限和故障恢复放入统一底座,并以插件、连接器和技能接入企业系统。项目同时给出一体机方案,宣称可实现小时级端到端私有化部署;下一步需用公开基准验证协作成功率、故障恢复和资源效率。

来源:BAAI 智源

区块链与金融科技

Coinbase 与 Gennius 将稳定币能力嵌入拉美银行 App

双方从阿根廷起步,为银行提供稳定币支付、托管和交易:符合条件的存款可转换为通过 Coinbase Custom Stablecoins 发行的 ONED USD,支持全天候转账,并可经 Visa 消费。对银行的采用判断取决于储备与赎回结构、客户资产隔离、链上监控、当地外汇监管及 Visa 端的结算路径,公告尚未披露这些细节。

来源:Coinbase Developer Platform