前沿科技日报 · 2026-09-15
AI 竞争的成本与风险正在从“模型本身”外溢到整套系统:算力集群继续扩张,训练与 Agent 框架开始被单独计价,记忆、证据核验和数据治理则成为规模化执行前必须补齐的控制层。
2026-09-15 前沿科技洞见 · 日报
📊 今日关键数据
- 10 万卡:京东云在已建成国产万卡集群后公布的下一阶段集群规划,面向训练、推理和具身智能(来源:钛媒体)
- 约 3500—29.2 万 Token:相同 API 与模型完成同组 Python 任务时,不同编码 Agent 框架的单任务消耗区间(来源:AI前线)
- 51.0% / 85.7%:仅靠提示词防护时,指令注入任务与错误前提任务的不安全动作率(来源:AI提效手册)
- 近 50 个基点/月:AI 对冲基金在 2018 年以前的平均风险调整后超额收益,2018 年后已无法与零作统计区分(来源:QuantML)
- 8 亿张:AIMe 为超过 1 亿种小分子生成的预测质谱规模(来源:BAAI 智源)
- 80%:中国电信研究院预测的 2029 年国内推理算力市场占比(来源:华尔街见闻)
🔍 今日值得深读
京东建成国产万卡集群,并规划十万卡训练与推理基础设施
京东云在 JDD 大会上披露,已与摩尔线程等合作伙伴建成国产万卡集群,下一步规划十万卡集群,目标覆盖大模型训练、推理和具身智能。同期,中国头部科技企业的资本支出继续上行:报道援引穆迪预测,相关企业 2026—2027 年资本支出合计将由 2025 年的 650 亿美元增至 1400 亿—1650 亿美元。真正需要验证的已不只是装机规模,而是集群利用率、Token 产出和业务回收周期。
- 发生了什么:京东把十万卡规划与仓储、配送、供应链和机器人场景绑定;其上半年研发投入同比增长 53.2%,并计划在未来五年采购 300 万台机器人、100 万台无人车和 10 万架无人机。
- 为什么值得深读:算力投入正从单纯购买 GPU 转向芯片、互连、电力、软件栈和具体业务负载的联合设计,国产万卡集群能否稳定训练和高效推理比峰值算力更具决策价值。
- 后续看点:十万卡集群的建设时间、国产芯片占比、训练有效算力、推理 Token 成本,以及京东物理业务场景能否形成可量化收入或效率回报。
来源:钛媒体
PyTRIO 将分布式训练封装成 API,企业保留数据与训练逻辑
情感机器推出 PyTRIO,将环境配置、分布式训练和异构集群维护封装为 Training API。用户在本地控制数据、损失函数、奖励和训练逻辑,只把需要 GPU 完成的计算发往云端,并可按 Token 或 GPU 时计费。它试图填补开放权重模型与企业自主后训练之间的工程缺口,但数据传输、调试可见性和跨芯片一致性仍需实际负载验证。
- 发生了什么:平台把训练拆成用户掌控的算法层和平台负责的计算层,并宣称已适配英伟达、昇腾等多类算力芯片。
- 为什么值得深读:推理 API 降低了调用门槛,却没有解决企业沉淀专有数据、奖励函数和模型行为的问题;训练 API 若能成立,可能把后训练从专门 Infra 团队的项目变成标准化服务。
- 后续看点:千亿参数模型的稳定扩展效率、故障恢复、数据与梯度的安全边界、计费可预测性,以及训练产物能否无锁定地迁出平台。
来源:机器之心
腾讯 T-Mem 在记忆写入时生成“未来触发线索”
腾讯团队提出 T-Mem,不再只依赖当前问题与历史记忆的向量相似度,而是在记忆写入时预测未来可能用到它的场景,并保存为可检索的 triggers。系统会对触发线索去重、合并和增量更新;论文已被 EMNLP 2026 主会议接收,代码与数据公开。方法直指长期 Agent 的一个常见盲区:措辞完全变化时,关键事实往往无法被召回。
- 发生了什么:T-Mem 用“记忆—未来场景”桥接替代单一的“查询—记忆”相似度路径,并在两个记忆基准上报告了新的最好结果。
- 为什么值得深读:企业 Agent 的长期记忆不仅要存得下,还要在任务语境变化后找得回;写入阶段预构造触发条件,为跨会话决策提供了可实现的新路径。
- 后续看点:开放代码能否复现实验结果;触发线索数量随记忆规模增长后的延迟与存储开销;错误联想、隐私信息误召回和记忆删除是否可控。
来源:机器之心
ECA 要求电脑 Agent 携带证据后才能执行动作
深圳大学与香港科技大学团队提出 Evidence-Carrying Multimodal Agents(ECA):模型提出点击、发送或上传等动作,独立验证器从 DOM、OCR、无障碍树和可信来源中提取证据,规则门控在证据满足条件后才放行。研究把幻觉从“答案是否正确”推进到“错误判断是否触发真实动作”,并把每一步授权变成可检查的证据证书。
- 发生了什么:在授权轨迹回放中,仅靠提示词防护时,指令注入任务的不安全动作率为 51.0%,错误前提任务达到 85.7%;在 200 个 AgentDojo 任务上,表现最好的多轮大模型审议仍放行约 79.3% 的不安全动作。
- 为什么值得深读:让同一个模型既做事又证明自己安全,容易把同一错误带入审核;ECA 将感知、证明和执行拆开,为高风险桌面、支付和企业工作流提供了可审计控制点。
- 后续看点:证据验证器在动态网页和跨应用任务中的覆盖率、正常任务成功率与延迟损失,以及证书规则能否扩展到付款、邮件外发等不同风险等级。
来源:AI提效手册
同一模型搭配不同编码 Agent,单任务 Token 消耗跨越数十倍
三组测试把成本差异指向 Agent 框架,而非模型价格本身。独立测试让 12 种配置经同一 API、同一模型完成 12 个 Python 任务,单个解题的 Token 从 Aider architect 模式约 3500 个到 OpenClaw 约 29.2 万个;另一组 Composio 测试覆盖 30 个企业工作流,成功任务成本从 0.028 美元到 0.195 美元。框架自带提示词、工具说明和缓存路径构成了明显“启动税”。
- 发生了什么:测试分别使用 DeepSeek V4 Flash、Nemotron 3 Ultra 等模型;Composio 的 240 次执行中有 129 次成功,程序化验证器负责评分,任务上限为 900 秒。
- 为什么值得深读:企业采购若只比较模型单价,会漏掉框架上下文、工具调用和缓存命中率带来的系统成本;框架选择同时影响成功率、延迟和预算。
- 后续看点:统一推理设置后的严格复测、长任务中的缓存命中率、失败重试成本,以及“每个成功任务成本”能否取代单 Token 价格成为采购指标。
来源:AI前线
二十年样本显示,AI 对冲基金的早期 Alpha 在 2018 年后消失
论文《The Growth and Performance of Artificial Intelligence in Asset Management》结合 2012 年以来 11 万余份 SEC 监管文件、招聘与履历数据,以及 2006—2024 年 7896 只对冲基金的历史快照,区分“算法直接参与投资决策”与后台使用 AI、投资 AI 股票或仅作风险披露。严格口径下,样本期只有 89 只纯 AI 基金;其 2018 年前月均风险调整后超额收益接近 50 个基点,之后降至统计上无法与零区分。
- 发生了什么:研究估计早期超额以每年约 6 个基点衰减;2023 年纯 AI 基金数量占比约 2.7%,截至 2024 年超过 80% 的相关资产集中于系统化多元宏观策略。
- 为什么值得深读:它使用事前披露与逐年封存快照降低幸存者偏差,并揭示技术优势会随人才、算力和方法扩散被市场定价,而不是永久转化为 Alpha。
- 后续看点:论文结论在生成式 AI 与非公开另类数据策略中是否仍成立;基金费用、交易摩擦和模型拥挤度如何影响净 Alpha;低收益相关性能否继续提供组合分散价值。
来源:QuantML
📰 独立报道
AGI、Agent 与评测
豆包手机助手发布消费者版,以 SAEP 约束跨应用操作
豆包手机助手消费者版加入实体 AI 键、锁屏实时对话、个人记忆和跨应用任务执行;记忆须经用户授权,并支持查看、修改和删除。同步发布的 SAEP 协议用于界定助手与第三方应用的操作边界。新版将首发搭载努比亚 NaviX Ultra,并向既有设备用户推送。
来源:APPSO
CAITLYN 把漏过的提示注入转化为新防御规则
CAITLYN 用双层中间件防御 Agent 从网页、文件和工具返回值中读入的恶意指令:System I 先以脚本、签名和启发式规则快速筛查,再把模糊样本交给大模型分类器;System II 将漏检攻击构造成反例,经沙箱验证和审查后写回防御技能库。在 Emerging 攻击设置中,攻击成功率下降约 40 个百分点。
来源:新智元
DynHD 从扩散模型的完整去噪轨迹识别幻觉
EMNLP 2026 论文 DynHD 不只检查扩散大语言模型的最终答案,而是把多步去噪过程作为检测信号,从 Token 和时间两个维度建模不确定性。该方法针对 D-LLM 从大量 mask 迭代生成文本的特性,尝试在错误尚未固化为最终输出前定位异常,补足自回归模型幻觉检测方法直接迁移时的结构差异。
来源:PaperWeekly
七名博士生公开 7B 模型从数据到日志的完整训练轨迹
北京中关村学院七名博士生用三个月从零训练 ZGCM-1,并开放各阶段数据与配方、权重、代码、中间检查点和训练日志。团队以 ZGent 平台组织数百个 Agent 分担研发环节,并为任务自主性建立 L1—L5 评级。其价值主要在可复现过程,而非只发布最终权重与排行榜成绩。
来源:量子位
AI 战略与工程
英伟达等企业因日志留存政策限制部分 Anthropic 模型
据报道,英伟达、Palantir 和博思艾伦汉密尔顿等企业近期限制使用 Anthropic 旗舰模型,争议集中在其 30 天滚动保留客户使用日志的政策。微软则向至少一家大型客户推介完全运行在私有服务器上的方案。企业模型采购的比较维度正从能力和价格扩展到留存周期、部署位置与审计权限。
来源:华尔街见闻
亿格云融资近亿元,继续开发 Agent 全生命周期治理平台
亿格云完成近亿元人民币 B+ 轮融资,距 B 轮四个月,资金将用于“云枢 AIDR”迭代与海外布局。该平台覆盖 Agent 的创建、发布、使用、监测和处置等环节;公司称已服务 20 余个行业、超过 1000 家企业和 500 万终端。后续检验点是治理能力能否跨模型、跨工具保持一致。
来源:Z Potentials
资管金融与区块链
Anthropic 推出金融顾问版 Claude,连接组合分析与财富管理工具
Claude for Financial Advisors 接入贝莱德、先锋集团、嘉信理财和 iCapital 等机构的研究、组合分析、风险管理及财富管理工具,用于自动化研究、客户会前准备、文档处理和组合监控。产品把通用助手推进到受监管工作流,权限隔离、引用追溯和顾问最终复核将决定其可用范围。
来源:华尔街见闻
Scalar Field 在 Solana 上提供自主策略创建、回测与部署
Scalar Field 公布面向 Solana 资产的 Agentic Trading 基础设施,允许用户创建、回测并部署覆盖代币化股票等资产的自主策略。该信息来自生态官方发布,目前尚未披露回测防过拟合、执行风控、托管权限和实盘表现;这些指标将决定它是开发工具还是可用于真实资金的交易系统。
来源:Solana
学术与具身智能
GVLA 将夹爪形态编码进 VLA,跨末端执行器成功率提高 7.62 个百分点
ECCV 2026 论文 GVLA 用软提示对夹爪形态进行结构化编码,让策略不仅学习动作数据,也显式识别“身体”差异。配套 MiGA 数据集包含 10.3 万条演示、覆盖五类主流夹爪;仿真测试中,GVLA 相对基线的成功率提高 7.62 个百分点。下一步需看真实机器人和未见夹爪上的迁移表现。
来源:甲子光年
AIMe 为超 1 亿种小分子生成 8 亿张预测质谱
康奈尔大学团队提出多智能体神经符号框架 AIMe,其 DeepMS²Reasoner 把化学规则、碎裂路径推理与神经网络学习结合,用于扩展小分子质谱参考空间。团队为超过 1 亿种小分子生成约 8 亿张预测质谱,试图缓解实验谱库覆盖已知化合物不足 1%、复杂样本中多数代谢物无法鉴定的问题。
来源:BAAI 智源
AI 按实验室约束筛选材料方案,团队报告一次实验命中
王浩哲团队发布预印本,展示 AI 结合具体实验室设备与条件筛选材料方案、再由研究人员执行验证的流程,并报告将原本可能持续数月的试错压缩到一次成功。该案例仍需更多材料体系和独立复现检验;现阶段更适合把它理解为缩小实验搜索空间,而不是无人实验室已经成熟。
来源:虎嗅
硬件与算力
Google Cloud 与 vLLM 团队合作,让 TPU 原生进入开源推理栈
Google Cloud 宣布与 vLLM 背后的 Inferact 团队合作,将开源 TPU kernels 向上游合并,并通过 TorchTPU 提供原生 PyTorch 集成。合作目标是让 TPU 成为 vLLM 开源推理的一等后端,降低现有 GPU 工作负载迁移成本;仍需等待主流模型的吞吐、延迟、兼容性和单位 Token 成本数据。
来源:Google Cloud
Cornelis 融资 2.05 亿美元,并发布 Active Compute Fabric
AI 基础设施公司 Cornelis 获得 2.05 亿美元融资,同时发布 Active Compute Fabric。该网络技术针对 GPU 因等待数据传输而空闲的问题,试图提高集群中计算与通信的重叠效率。融资本身不是核心,后续应关注真实训练与推理负载下的 GPU 利用率、扩展效率及对现有网络栈的替换成本。
来源:TechCrunch
中国电信研究院预计 2029 年推理算力占比达到 80%
中国电信研究院发布《智能体时代 AI 基础设施发展研究报告(2026)》,预计未来两到三年国内算力需求平均每年增长近 10 倍,2029 年推理算力市场占比达到 80%。报告同时预测 2026—2030 年国内 Token 年消耗量增长 350 倍;预测值仍需结合口径和实际业务调用持续校验。
来源:华尔街见闻