前沿科技日报 · 2026-07-18
月之暗面发布 2.8 万亿参数的 Kimi K3,国际人工智能伦理治理行动计划在上海发布,支付宝与阶跃把智能体服务接入手机终端
2026-07-18 前沿科技洞见 · 日报
📊 今日关键数据
- 2.8 万亿参数:Kimi K3 的总参数规模,采用 896 个专家并在每次推理激活 16 个(来源:BAAI 智源)。
- 5000 个名额:中国宣布未来五年面向发展中国家提供的 AI 专题研修培训名额(来源:金融科技研究)。
- 64 张 GPU:沐曦曦景 S600 所称可在单机柜内实现高速全互连的 GPU 数量(来源:华尔街见闻全球)。
- 27,500 颗:日本计划采购、用于本土机器人基础模型的 NVIDIA Rubin 芯片数量(来源:Techmeme)。
- 80%:商汤算电协同 Agent 在临港 AIDC 所称的单位电力成本 token 产出提升幅度(来源:智东西)。
- 200 多项:小布助手此前通过 AHA 接入支付宝阿宝的技能数量(来源:智东西)。
🔍 今日值得深读
Kimi K3 将 2.8 万亿参数模型推向开源与长程智能体场景
月之暗面发布 Kimi K3:总参数 2.8 万亿、采用 MoE 架构,每次推理激活 16 个专家,提供 100 万 token 上下文与原生多模态能力。报道显示,该模型已在 Kimi 网页、App、Kimi Work 和 API 中可用,完整权重计划于 7 月 27 日前发布。
K3 的技术重点是 Kimi Delta Attention 与 Attention Residuals。前者以混合线性注意力压缩长上下文的 KV 缓存,后者让深层网络可跨层检索表示;报道援引月之暗面的数据称,在 100 万 token 上下文下解码吞吐最高提升 6 倍。模型面向长程编程、研究和工具调用,但发布材料也提示:未保留完整思考历史或在会话中切换模型时,输出可能不稳定。
- 关键事实:2.8 万亿总参数、896 个专家、单次激活 16 个专家;完整权重计划于 7 月 27 日前发布。
- 为什么值得深读:长上下文模型的竞争正在同时比较参数规模、缓存成本与智能体在连续任务中的稳定性。
- 后续看点:完整权重发布后,社区能否复现其长程编程与 100 万 token 推理吞吐表现。
来源:BAAI 智源
国际人工智能伦理治理行动计划提出全生命周期风险分级与技术治理协作
工业和信息化部会同有关方面在上海发布《国际人工智能伦理治理行动计划》。行动计划围绕全生命周期伦理治理、风险分类分级防控、敏捷治理机制和产业链协同提出合作方向,并把可解释性、隐私保护、偏见矫正等技术研发与开源共享列为后续工作内容。
同日公布的讲话提出成立世界人工智能合作组织,并宣布未来五年面向发展中国家提供 5000 个 AI 专题研修培训名额、在多个区域建设国际 AI 应用合作中心。行动计划本身并未给出统一的强制执行细则,后续的参与机制、标准衔接和项目落地仍是关键。
- 关键事实:行动计划覆盖全生命周期治理和风险分类分级;中国宣布未来五年提供 5000 个 AI 专题研修培训名额。
- 为什么值得深读:跨境部署模型、数据和智能体服务时,伦理治理要求正与隐私、可解释性和风险响应技术一起进入合作议程。
- 后续看点:相关国际组织将发布哪些参与规则、技术标准或试点项目。
来源:中国工信新闻
NVIDIA NeMo AutoModel 接入 Diffusers,扩展到图像和视频微调
NVIDIA 宣布 NeMo AutoModel 已支持 Hugging Face Diffusers。该开源微调库此前主要覆盖 Transformer;此次加入图像和视频模型,并提供全量微调与 LoRA 的现成配方,用于减少分布式训练的工程接线工作。
这项更新把文本模型训练工作流延伸到扩散模型。对于同时维护文本、图像或视频生成能力的团队,训练配方、并行框架和实验管理能否共用,将比单一模型的性能声明更值得检验。
- 关键事实:NeMo AutoModel 新增 Diffusers 支持,并提供图像、视频模型的全量微调与 LoRA 配方。
- 为什么值得深读:多模态模型训练正从各自独立的工具链,转向共享的分布式微调基础设施。
- 后续看点:支持范围是否继续扩展至更多视频模型,以及不同硬件上的训练效率数据。
来源:Hugging Face
📰 独立报道
🤖 AGI 前沿
Sakana AI 提出在 Dale 定律约束下进行局部学习的误差信号路由方法
Sakana AI 发布的 “Diffusing Blame” 研究尝试让神经网络在每个神经元保持兴奋或抑制符号固定的约束下学习,以贴近 Dale 定律。方法不使用反向传播所需的权重转置,而是把一个全局误差信号路由给隐藏单元。
研究称,模数路由在图像分类和强化学习实验中表现最佳,并在 Ant、Humanoid、HalfCheetah 的 PPO 训练中与真实梯度保持较强一致性。论文已被 ALIFE 2026 接收。
- 关键事实:方法把每层拆为兴奋与抑制通道,并以四个非负权重矩阵维持连接符号。
- 后续看点:该局部更新规则能否在更大规模视觉或语言模型上保持与反向传播接近的效果。
来源:Sakana AI
达摩院 RynnWorld-4D 同时预测视频、深度和光流
达摩院提出 RynnWorld-4D 具身世界模型,采用 RGB-DF 表征,同时生成视频、深度和光流。报道称,模型以三分支 Transformer 对齐异质模态特征,并用多源数据构建超过 2 亿帧训练集。
- 关键事实:模型将视频、深度与光流的预测放入同一表征,并把中间层特征交给策略网络输出动作。
- 后续看点:在真实机器人任务中,三维预测相对纯视觉策略能带来多少控制成功率增量。
来源:机器之心
🏢 AI 战略与组织变革
豆包手机助手调整为通过 MCP 接入应用服务
晚点 LatePost 报道称,新一代豆包手机不再在用户授权后读取屏幕并模拟点击头部应用;应用需要自行提供 MCP 服务、开放部分数据和可操控能力后,豆包手机才能接入。报道同时称,新机备货从此前 3 万台上调至数十万台。
这一调整将手机智能体的执行方式从 GUI 自动化转向由应用提供接口。文章称,豆包手机助手已获得生成式人工智能服务备案,团队正与头部应用讨论开放可调用的服务能力。
- 关键事实:接入方式从读屏与模拟点击转向应用提供 MCP 服务;报道指备货量上调至数十万台。
- 后续看点:哪些超级应用会公布可供手机智能体调用的 MCP 服务和权限范围。
来源:晚点 LatePost
AWS 推出面向 Claude Code 与 Claude Desktop 的自托管应用网关
亚马逊云科技推出 Claude 应用网关,定位为 Claude Code 和 Claude Desktop 的自托管控制平面。该产品把企业内部使用 Claude 的接入、路由与控制放在自有环境中管理。
- 关键事实:网关面向 Claude Code 与 Claude Desktop,采用自托管控制平面定位。
- 后续看点:网关将披露哪些身份、审计、工具调用与模型路由控制能力。
来源:InfoQ 中文站
Datadog 披露以 Claude 和 Cursor 辅助生产环境迁移的经验
Datadog 的案例显示,其在迁移到新数据库时使用 Claude 和 Cursor 辅助测试驱动式重构。报道称,相关操作时间从 45 分钟降至 1 秒,成本下降 90%;同时,大模型生成的复杂查询仍需要人工优化,反复输入日志和代码上下文也会增加 token 消耗。
- 关键事实:案例称迁移操作从 45 分钟缩短到 1 秒,成本降低 90%。
- 后续看点:Datadog 是否公布迁移范围、人工审查比例和长期故障率等更多工程指标。
来源:AI提效手册
💰 金融科技前沿
支付宝与阶跃把 AHA 协作接入 STEPX Neo 手机
支付宝与阶跃宣布 AI Agent 系统级合作。现场演示中,StepFun 的 Amoo 在 STEPX Neo 上理解用户的充电和订咖啡请求,再调用支付宝“阿宝”的服务完成地址填写、商品推荐并生成待确认订单。
报道称,双方通过支付宝的 AHA(Agent Hub-Access)进行协议级协作,而非让智能体模拟点击 App;此前小布助手已通过该方案接入阿宝的 200 多项技能。
- 关键事实:AHA 用于不同智能体间的任务传递、状态回传与安全协同;小布助手此前已接入 200 多项技能。
- 后续看点:合作方将开放哪些支付、出行与本地生活服务,以及确认支付前的授权流程如何设计。
来源:智东西
Stripe 基准测试发现智能体能开发集成方案,但校验仍是短板
Stripe 发布的基准测试显示,AI 智能体能够开发集成方案,但在结果校验环节仍有不足。该结果把“能生成集成代码”与“能验证集成是否正确”区分开来。
- 关键事实:测试结论把智能体的集成开发能力与校验能力分开评估。
- 后续看点:Stripe 是否公开任务集、失败类型和可供开发者复现的评测工具。
来源:InfoQ 中文站
EBA 就 2027 年市场风险基准测试提出针对性更新
欧洲银行管理局(EBA)表示,随着 FRTB 实施临近,已就 2027 年市场风险基准测试提出针对性更新,以兼顾监管准备与实施时间安排。意见征集截止日期为 2026 年 9 月 3 日。
- 关键事实:更新面向 2027 年市场风险基准测试,公开征求意见至 9 月 3 日。
- 后续看点:最终文本会如何调整模型比较、数据提交与实施时间表。
🎓 学术前沿
南洋理工团队修正 MTS 数据选择框架的数学缺陷
南洋理工大学李搏扬团队报告称,通过扩大批次并引入四维特征,修正了 MTS 数据选择框架长期存在的数学缺陷。报道将低梯度信噪比和输入特征不足列为原方法失效的原因,并称新方法在多个数据集上平均提升超过 5%。
- 关键事实:改进包括更大批次和四维特征;报道称多个数据集平均提升超过 5%。
- 后续看点:论文代码与完整实验配置公开后,其他训练数据选择场景能否复现该增益。
来源:AI科技评论
🔧 硬件算力与智能设备
沐曦发布单机柜 64 GPU 高速互连的曦景 S600 超节点
沐曦在 WAIC 发布面向大模型训练、推理和智算中心的曦景 S600。报道称,该系统支持单机柜 64 张 GPU 高速全互连,并可扩展到万卡级集群。
- 关键事实:曦景 S600 支持单机柜 64 GPU 高速全互连和万卡级扩展。
- 后续看点:产品将公布哪些互连带宽、软件栈兼容范围与实际集群交付信息。
来源:华尔街见闻全球
日本计划采购 2.75 万颗 NVIDIA Rubin 芯片建设机器人基础模型
彭博社消息称,日本计划采购 2.75 万颗 NVIDIA 下一代 Rubin 芯片,用于建设本土机器人基础模型。该项目由 Noetra 牵头,SoftBank、Sony 和 NEC 参与。
- 关键事实:计划采购 27,500 颗 Rubin 芯片,并由 Noetra、SoftBank、Sony、NEC 参与。
- 后续看点:项目将公布的模型训练时间表、算力部署地点和机器人数据获取方案。
来源:Techmeme
商汤发布算电协同 Agent,以 TPW 衡量智算中心 token 产出
商汤大装置发布算电协同 Agent,并提出 TPW(Tokens Per Watt)作为智算中心效率指标。报道称,该系统已在临港 AIDC 落地,通过负荷、电价、储能和算力调度联动,使单位电力成本对应的 token 产出提升 80%,负荷预测准确率达到 96%。
- 关键事实:报道称单位电力成本 token 产出提升 80%,负荷预测准确率为 96%。
- 后续看点:TPW 的计算口径能否公开,以及其他类型智算中心是否能复现同等节省幅度。
来源:智东西
Zoox 因浓烟场景识别问题召回自动驾驶软件
Zoox 召回自动驾驶软件,起因是一辆 robotaxi 在浓烟环境中发生判断混乱。报道指出,美国最高汽车安全监管机构此前已警告自动驾驶车辆可能干扰急救人员。
- 关键事实:召回直接关联浓烟环境中的识别与行驶决策问题。
- 后续看点:Zoox 会披露哪些传感器融合、场景识别或应急车辆交互的修复措施。
来源:TechCrunch