前沿科技日报 · 2026-08-13
DeepSeek、MiniMax 与蚂蚁百灵把模型竞争推进到 Agent 运行与成本层;WCM、GMC 分别改写机器人价值判断和视觉 Token 压缩;香港首个持牌港元稳定币开放机构接入。
2026-08-13 前沿科技洞见 · 日报
📊 今日关键数据
- 100 万 Token:DeepSeek V4 Pro 的上下文窗口;百万输入、缓存命中和输出 Token 分别定价 3 元、0.025 元和 6 元(来源:DeepSeek API 信息)
- 98.7%:一个初始成功率 0.78% 的 VLA 模型经 WCM 引导强化学习后,在 ManiSkill 达到的成功率(来源:机器之心)
- 80.2%:GMC 在 Qwen2.5-VL-7B 上删减视觉 Token 的比例,对应保留 97.78% 平均能力(来源:量子位)
- 5.1B:Ling-3.0 Flash 每个 Token 激活的参数量;模型总参数 124B,官方材料称输出速度为 353 Token/s(来源:AIGC 开放社区)
- 6400 个场景:OmnilingualGAIA2 覆盖 10 种语言的 Agent 评测规模(来源:HuggingPapers)
- 70%:Expedia 迁移 Keras 3 后披露的排名模型推理延迟降幅,训练速度同时提高 30%(来源:François Chollet)
🔍 今日值得深读
DeepSeek V4 Pro 开放 API,兼容两套主流接口
DeepSeek V4 Pro 已进入开发者可调用阶段,支持 100 万 Token 上下文、工具调用、Responses API 和 Anthropic API。百万 Token 输入、缓存命中和输出价格分别为 3 元、0.025 元和 6 元,现有 Coding Agent 与 MCP 工具可沿用熟悉的接口接入。
- 核心变化:超长上下文、工具调用和接口兼容被放进同一服务,模型不再只交付回答能力。
- 为什么值得深读:缓存价格和迁移成本会直接影响长任务 Agent 能否持续携带代码、工具定义与历史记录。
- 后续看点:实际工作流中的工具调用稳定性、缓存命中率和长上下文成本是否符合公布配置。
WCM 让机器人 Critic 同时预测未来状态
OpenMOSS 开源世界批评家模型 WCM,把价值估计与下一时刻潜在状态预测放进同一架构,用连续观测纠正单帧 Critic 对运动、接触和滑移的误判。团队在 4 个仿真基准、149 项任务和 7 项真机任务中测试,并兼容 π₀、π₀.₅ 与 OpenVLA-OFT。
- 核心变化:Critic 不再只回归当前分数,还要学习动作之后的状态变化。
- 为什么值得深读:实验中,一个初始成功率 0.78% 的 VLA 模型经 WCM 引导训练后,在 ManiSkill 达到 98.7%,分布外平均成功率提升 72.7%。
- 后续看点:这套联合目标在更长任务、不同机器人本体和真实环境扰动下能否保持价值判断准确。
来源:机器之心
GMC 删除八成视觉 Token,仍保留 97.78% 平均能力
中科院自动化所紫东太初团队提出免训练视觉 Token 剪枝方法 GMC。它先从问题语义、视觉外观和空间位置中挑选互补证据,再把待删除 Token 的隐藏状态传输给代表 Token,避免传统 Top-K 反复保留相似区域。
- 核心变化:在 Qwen2.5-VL-7B 上,视觉 Token 从 1296 个压到 256 个时,平均能力保留 97.78%;压到 128 个时保留 99.11%。
- 为什么值得深读:方法直接减少后续注意力计算和 KV Cache,并可用于 Qwen、LLaVA 等现有模型,无需微调或外部 OCR。
- 后续看点:跨更大参数模型、视频输入和高分辨率文档时,压缩收益与细节损失如何变化。
来源:量子位
MiniMax 把 Agent 使用轨迹送回训练环节
MiniMax 披露其 Agent 从内部办公机器人演化到桌面应用 MiniMax Code 的过程:Harness 负责提示词、工具调用与错误处理,真实用户的长任务轨迹经数据工程转为可重复、可打分的训练环境,再用于下一代模型的强化学习。推理侧也与 Harness 协同优化缓存、调度和 Token 消耗。
- 核心变化:模型训练、Agent 服务、真实任务数据和下一轮训练被接到同一条反馈链上。
- 为什么值得深读:模型公司可以同时调整权重、运行框架和推理服务,产品使用数据也由反馈变成训练信号。
- 后续看点:金融、法律、医疗等专业工作流如何被转成可评分环境,以及用户数据的授权与治理边界。
来源:Founder Park
Ling-3.0 用 5.1B 激活参数运行 124B 模型
蚂蚁百灵开源 Ling-3.0 Flash 与 Tiny,并提供 FP8、FP4、INT4 等版本。Flash 总参数 124B、每次激活 5.1B,采用 KDA 与 MLA 按 5:1 交替的混合线性注意力,以及每个 Token 激活 1/64 专家的稀疏 MoE;官方材料称其输出速度为 353 Token/s。
- 核心变化:Flash 的激活规模约为上一代 Ring-2.6-1T 的 8.1%,并面向代码、搜索和工具调用任务优化。
- 为什么值得深读:模型把长上下文效率、稀疏激活和集群分层缓存放到同一部署方案中,目标是提高单位计算量的任务能力。
- 后续看点:第三方评测能否复现其任务成本、首 Token 延迟和 Agent 长任务表现。
来源:AIGC 开放社区
🔥 今日聚合动态
Grok 4.6 把增量训练集中到长任务 Agent
SpaceXAI 发布 Grok 4.6,重点覆盖长时间运行的 Agent、交互式任务和视觉工作。公司称模型在 Artificial Analysis Intelligence Index 得分 61,并通过更长的补充训练、重新生成的 SFT 轨迹,以及面向编程、网页、CAD 和内核优化的 Agent 强化学习提升能力;第三方材料同时记录了它在部分软件工程评测上仍落后于 GPT-5.6 Sol。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 发布与定价 | Techmeme | 百万输入与输出 Token 定价分别为 2 美元和 6 美元,产品重点是长任务 Agent。 |
| 训练与边界 | 模型评测整理 | 公司公布了 SFT 轨迹重建和 Agent 强化学习方向;DeepSWE 与 Terminal-Bench 仍落后于 GPT-5.6 Sol。 |
| 独立入口 | Artificial Analysis | 第三方评测页面记录 Grok 4.6 的基准表现。 |
- 互补信息:发布材料给出定位与价格,评测整理补充了训练方式、强项和未领先的任务。
- 后续看点:长时间运行任务中的自检行为能否转化为更高完成率,而不只是增加推理时长。
HKDAP 开放机构接入,零售推广最早指向 2026 年底
渣打银行(香港)、Animoca Brands 与香港电讯合资成立的 Anchorpoint Financial 启动港元稳定币 HKDAP 第一阶段推广。首批机构分销商、企业用户和专业投资者可进入 Beta 通道,并把 HKDAP 接入支付、结算与资金管理应用;产品运行在公共区块链基础设施上。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 接入范围 | 财新 | 首阶段面向机构分销商和专业投资者,零售应用目标最早为 2026 年底。 |
| 商业应用 | Reuters | 授权分销商可提供 HKDAP 与法币兑换,当前重点是支付和结算用例。 |
| 技术与模式 | South China Morning Post | HKDAP 采用公共区块链和企业—企业—消费者模式,先由合作伙伴接入商业应用。 |
- 互补信息:三份材料分别补齐了准入对象、法币兑换与结算用途,以及公共链运行方式。
- 后续看点:首批商业应用的交易规模、赎回机制和零售准入条件何时披露。
📰 独立报道
🤖 AGI 前沿
Qwen3.8-Max 开放 2.4T 参数权重
阿里发布 Qwen3.8-Max 权重,模型总参数为 2.4T、激活参数为 95B。正式材料确认权重已进入 Hugging Face,为需要私有部署和业务微调的团队提供了新的大规模开放权重选项。
Solar Pro 4 的 Agent 评测提升伴随更长延迟
Upstage 发布 Solar Pro 4。Artificial Analysis 测得其 Intelligence Index 从上代 14 升至 42,Terminal-Bench v2.1 从 12% 升至 57%,但单项平均耗时由 6.9 分钟增至 9.5 分钟;幻觉率从 88% 降至 24%,部分改善来自更频繁拒答。
Adversarial Fréchet Distance 抑制生成器“刷指标”
KlingAI Research 提出新的对抗式 Fréchet Distance 损失,用于防止生成器后训练阶段针对指标取巧。材料称该方法在 JiT 与 pMF 骨干的一步生成任务上,使 FD-r3 最多提升 41%。
CDFM 用预训练模型做零样本因果结构推断
广东工业大学、汕头大学和清华大学团队提出 CDFM,把机制推断、候选图驱动的数据重构和因果图解码连在一起。模型在 15 类合成机制上预训练,并在 Causal Chamber、Tübingen 等真实基准测试从合成机制向真实数据迁移的能力;论文同时保留了无额外约束时因果方向无法唯一确定的边界。
来源:AI 科技评论
Yuvion VL 把多模态内容安全作为专门训练目标
阿里安全 AGI 实验室发布 Yuvion VL 系列,围绕小字规避、标识变形、遮挡和生成式对抗内容构建训练数据,并以 C2FT 对比学习挖掘混淆样本。其 32B 版本在 58 个开源与内部安全评测中,平均领先同规模开源模型 9.9 分;这些结果包含团队内部业务评测,仍需结合公开基准理解。
来源:PaperWeekly
OmnilingualGAIA2 把 Agent 评测扩至 10 种语言
Meta 发布 OmnilingualGAIA2,这是 GAIA2 的多语言扩展版,包含 6400 个场景和 10 种语言。它把 Agent 的任务完成能力放到跨语言环境中测试,为只在英语任务上表现良好的系统增加了一道迁移检查。
DeepMind 推出手语转文字模型 SL2T
DeepMind 发布手语转文字模型 SL2T,并将其用于面向聋人和听障用户的新手语功能。正式材料确认了模型与产品方向,但未提供准确率、覆盖手语种类或端侧运行条件。
🏢 AI 战略与组织变革
Mistral 平台开始托管第三方开放模型
Mistral 宣布其平台将支持第三方开放模型,首个接入的是 Z.ai 的 GLM-5.2,并与自家模型运行在同一套基础设施上。企业因此可在同一运行环境中比较和部署不同开放模型,而不必把平台选择与单一模型绑定。
来源:Techmeme
Twitch 默认允许 Amazon 使用直播内容训练生成式 AI
Twitch 将平台直播内容用于 Amazon 生成式 AI 训练,并为创作者提供退出选项,但默认状态仍为允许。Twitch 产品负责人 Mike Minton 公开承认,若改为主动加入,几乎不会有人选择加入;这使训练数据授权的默认值本身成为产品治理问题。
来源:TechCrunch
美国白宫考虑把开放模型纳入发布前安全测试框架
据 WIRED 报道,美国白宫准备更新 AI 框架,开放模型可能被纳入秘密的发布前安全测试。现有框架主要覆盖前沿闭源模型;若范围扩大,开放权重发布方将面对新的测试与披露安排。
来源:WIRED
💰 资管与金融科技前沿
中信建投用三层诊断服务信用账户
中信建投证券“北极星”账户诊断把市场、账户和行为拆成三类模块,结合自研担保物分类、客户行为与量化研究模型,并引入 DeepSeek 处理前端智能服务。截至 2026 年 7 月末签约用户接近 6 万;公司跟踪数据显示,2025 年高频使用客群相较活跃两融客群,平均超额收益高 18 个百分点、最大回撤低 5 个百分点。该比较反映客群差异,不能单独证明产品造成了收益变化。
来源:当金
Polygon 进入英格兰银行数字英镑实验室
Polygon 与 NOBO、Dun & Bradstreet 入选英格兰银行 Digital Pound Lab,将以 Open Money Stack 测试数字英镑及跨境稳定币结算。正式材料只确认参与主体和测试方向,尚未披露试验规模、结算资产或时间表。
来源:Polygon
🔧 硬件算力与智能设备
Expedia 更换排名模型栈后,推理延迟下降 70%
Expedia 将住宿排名模型迁移到 Keras 3,披露训练速度提高 30%、推理延迟下降 70%。新代码使用后端无关接口,后续可在不重写底层模型与层的情况下切换 TensorFlow、PyTorch 或 JAX,以调用不同平台的优化内核。
研究人员用不到 20 条提示发现 Zoom 接管漏洞
A Security 研究人员使用公开 AI 模型,在不到 20 条提示内发现 Zoom 屏幕共享漏洞并构造可用攻击。漏洞可能在无交互、无提示的情况下影响 Windows、macOS、Linux、iOS 和 Android 设备;Zoom 已开始推送修复。
来源:Ars Technica