FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-08-13

DeepSeek、MiniMax 与蚂蚁百灵把模型竞争推进到 Agent 运行与成本层;WCM、GMC 分别改写机器人价值判断和视觉 Token 压缩;香港首个持牌港元稳定币开放机构接入。

降低FOMO的每日信息交付

2026-08-13 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

DeepSeek V4 Pro 开放 API,兼容两套主流接口

DeepSeek V4 Pro 已进入开发者可调用阶段,支持 100 万 Token 上下文、工具调用、Responses API 和 Anthropic API。百万 Token 输入、缓存命中和输出价格分别为 3 元、0.025 元和 6 元,现有 Coding Agent 与 MCP 工具可沿用熟悉的接口接入。

来源:DeepSeek API 信息

WCM 让机器人 Critic 同时预测未来状态

OpenMOSS 开源世界批评家模型 WCM,把价值估计与下一时刻潜在状态预测放进同一架构,用连续观测纠正单帧 Critic 对运动、接触和滑移的误判。团队在 4 个仿真基准、149 项任务和 7 项真机任务中测试,并兼容 π₀、π₀.₅ 与 OpenVLA-OFT。

来源:机器之心

GMC 删除八成视觉 Token,仍保留 97.78% 平均能力

中科院自动化所紫东太初团队提出免训练视觉 Token 剪枝方法 GMC。它先从问题语义、视觉外观和空间位置中挑选互补证据,再把待删除 Token 的隐藏状态传输给代表 Token,避免传统 Top-K 反复保留相似区域。

来源:量子位

MiniMax 把 Agent 使用轨迹送回训练环节

MiniMax 披露其 Agent 从内部办公机器人演化到桌面应用 MiniMax Code 的过程:Harness 负责提示词、工具调用与错误处理,真实用户的长任务轨迹经数据工程转为可重复、可打分的训练环境,再用于下一代模型的强化学习。推理侧也与 Harness 协同优化缓存、调度和 Token 消耗。

来源:Founder Park

Ling-3.0 用 5.1B 激活参数运行 124B 模型

蚂蚁百灵开源 Ling-3.0 Flash 与 Tiny,并提供 FP8、FP4、INT4 等版本。Flash 总参数 124B、每次激活 5.1B,采用 KDA 与 MLA 按 5:1 交替的混合线性注意力,以及每个 Token 激活 1/64 专家的稀疏 MoE;官方材料称其输出速度为 353 Token/s。

来源:AIGC 开放社区


🔥 今日聚合动态

Grok 4.6 把增量训练集中到长任务 Agent

SpaceXAI 发布 Grok 4.6,重点覆盖长时间运行的 Agent、交互式任务和视觉工作。公司称模型在 Artificial Analysis Intelligence Index 得分 61,并通过更长的补充训练、重新生成的 SFT 轨迹,以及面向编程、网页、CAD 和内核优化的 Agent 强化学习提升能力;第三方材料同时记录了它在部分软件工程评测上仍落后于 GPT-5.6 Sol。

视角来源核心信息
发布与定价Techmeme百万输入与输出 Token 定价分别为 2 美元和 6 美元,产品重点是长任务 Agent。
训练与边界模型评测整理公司公布了 SFT 轨迹重建和 Agent 强化学习方向;DeepSWE 与 Terminal-Bench 仍落后于 GPT-5.6 Sol。
独立入口Artificial Analysis第三方评测页面记录 Grok 4.6 的基准表现。

HKDAP 开放机构接入,零售推广最早指向 2026 年底

渣打银行(香港)、Animoca Brands 与香港电讯合资成立的 Anchorpoint Financial 启动港元稳定币 HKDAP 第一阶段推广。首批机构分销商、企业用户和专业投资者可进入 Beta 通道,并把 HKDAP 接入支付、结算与资金管理应用;产品运行在公共区块链基础设施上。

视角来源核心信息
接入范围财新首阶段面向机构分销商和专业投资者,零售应用目标最早为 2026 年底。
商业应用Reuters授权分销商可提供 HKDAP 与法币兑换,当前重点是支付和结算用例。
技术与模式South China Morning PostHKDAP 采用公共区块链和企业—企业—消费者模式,先由合作伙伴接入商业应用。

📰 独立报道

🤖 AGI 前沿

Qwen3.8-Max 开放 2.4T 参数权重

阿里发布 Qwen3.8-Max 权重,模型总参数为 2.4T、激活参数为 95B。正式材料确认权重已进入 Hugging Face,为需要私有部署和业务微调的团队提供了新的大规模开放权重选项。

来源:Hugging Face 发布信息

Solar Pro 4 的 Agent 评测提升伴随更长延迟

Upstage 发布 Solar Pro 4。Artificial Analysis 测得其 Intelligence Index 从上代 14 升至 42,Terminal-Bench v2.1 从 12% 升至 57%,但单项平均耗时由 6.9 分钟增至 9.5 分钟;幻觉率从 88% 降至 24%,部分改善来自更频繁拒答。

来源:Artificial Analysis

Adversarial Fréchet Distance 抑制生成器“刷指标”

KlingAI Research 提出新的对抗式 Fréchet Distance 损失,用于防止生成器后训练阶段针对指标取巧。材料称该方法在 JiT 与 pMF 骨干的一步生成任务上,使 FD-r3 最多提升 41%

来源:HuggingPapers

CDFM 用预训练模型做零样本因果结构推断

广东工业大学、汕头大学和清华大学团队提出 CDFM,把机制推断、候选图驱动的数据重构和因果图解码连在一起。模型在 15 类合成机制上预训练,并在 Causal Chamber、Tübingen 等真实基准测试从合成机制向真实数据迁移的能力;论文同时保留了无额外约束时因果方向无法唯一确定的边界。

来源:AI 科技评论

Yuvion VL 把多模态内容安全作为专门训练目标

阿里安全 AGI 实验室发布 Yuvion VL 系列,围绕小字规避、标识变形、遮挡和生成式对抗内容构建训练数据,并以 C2FT 对比学习挖掘混淆样本。其 32B 版本在 58 个开源与内部安全评测中,平均领先同规模开源模型 9.9 分;这些结果包含团队内部业务评测,仍需结合公开基准理解。

来源:PaperWeekly

OmnilingualGAIA2 把 Agent 评测扩至 10 种语言

Meta 发布 OmnilingualGAIA2,这是 GAIA2 的多语言扩展版,包含 6400 个场景和 10 种语言。它把 Agent 的任务完成能力放到跨语言环境中测试,为只在英语任务上表现良好的系统增加了一道迁移检查。

来源:HuggingPapers

DeepMind 推出手语转文字模型 SL2T

DeepMind 发布手语转文字模型 SL2T,并将其用于面向聋人和听障用户的新手语功能。正式材料确认了模型与产品方向,但未提供准确率、覆盖手语种类或端侧运行条件。

来源:Google DeepMind

🏢 AI 战略与组织变革

Mistral 平台开始托管第三方开放模型

Mistral 宣布其平台将支持第三方开放模型,首个接入的是 Z.ai 的 GLM-5.2,并与自家模型运行在同一套基础设施上。企业因此可在同一运行环境中比较和部署不同开放模型,而不必把平台选择与单一模型绑定。

来源:Techmeme

Twitch 默认允许 Amazon 使用直播内容训练生成式 AI

Twitch 将平台直播内容用于 Amazon 生成式 AI 训练,并为创作者提供退出选项,但默认状态仍为允许。Twitch 产品负责人 Mike Minton 公开承认,若改为主动加入,几乎不会有人选择加入;这使训练数据授权的默认值本身成为产品治理问题。

来源:TechCrunch

美国白宫考虑把开放模型纳入发布前安全测试框架

据 WIRED 报道,美国白宫准备更新 AI 框架,开放模型可能被纳入秘密的发布前安全测试。现有框架主要覆盖前沿闭源模型;若范围扩大,开放权重发布方将面对新的测试与披露安排。

来源:WIRED

💰 资管与金融科技前沿

中信建投用三层诊断服务信用账户

中信建投证券“北极星”账户诊断把市场、账户和行为拆成三类模块,结合自研担保物分类、客户行为与量化研究模型,并引入 DeepSeek 处理前端智能服务。截至 2026 年 7 月末签约用户接近 6 万;公司跟踪数据显示,2025 年高频使用客群相较活跃两融客群,平均超额收益高 18 个百分点、最大回撤低 5 个百分点。该比较反映客群差异,不能单独证明产品造成了收益变化。

来源:当金

Polygon 进入英格兰银行数字英镑实验室

Polygon 与 NOBO、Dun & Bradstreet 入选英格兰银行 Digital Pound Lab,将以 Open Money Stack 测试数字英镑及跨境稳定币结算。正式材料只确认参与主体和测试方向,尚未披露试验规模、结算资产或时间表。

来源:Polygon

🔧 硬件算力与智能设备

Expedia 更换排名模型栈后,推理延迟下降 70%

Expedia 将住宿排名模型迁移到 Keras 3,披露训练速度提高 30%、推理延迟下降 70%。新代码使用后端无关接口,后续可在不重写底层模型与层的情况下切换 TensorFlow、PyTorch 或 JAX,以调用不同平台的优化内核。

来源:François Chollet

研究人员用不到 20 条提示发现 Zoom 接管漏洞

A Security 研究人员使用公开 AI 模型,在不到 20 条提示内发现 Zoom 屏幕共享漏洞并构造可用攻击。漏洞可能在无交互、无提示的情况下影响 Windows、macOS、Linux、iOS 和 Android 设备;Zoom 已开始推送修复。

来源:Ars Technica