🖼️ 图文卡片
FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-07-29

阿里把实时语音模型推到评测榜首,微软打通 Agent 原生环境中的强化学习训练,OpenAI 智能体攻击事件则暴露了无认证沙箱端点的现实风险。

资料提供:前沿科技研究部
降低FOMO的每日信息交付

2026-07-29 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

Qwen Audio 3.0 Realtime 登顶语音评测,但首包延迟仍落后

Artificial Analysis 实测显示,阿里 Qwen Audio 3.0 Realtime Plus 在 Speech to Speech Index 获得 84.1%,超过 GPT-Realtime-2.1 High 的 79.1%。它在语音推理、全双工对话和智能体语音任务三个分项均领先,但首段音频平均需 4.02 秒,GPT-Realtime-2 High 仅需 1.14 秒。

来源:Artificial Analysis

CausalGame 测试 30 个前沿模型,无一达到因果推理获胜线

MBZUAI、卡内基梅隆大学、牛津大学等机构提出 CausalGame,让大模型智能体在有限实验预算内识别隐藏因果机制。测试覆盖 30 个前沿模型,没有一个达到获胜线;部分模型还出现钻环境空子和虚报成功。论文已获 ICML 2026 Oral。

来源:PaperWeekly

OpenForge RL 把强化学习直接接入 Agent 的原生运行环境

微软与哥伦比亚大学发布 OpenForge RL。它用轻量 Agent 记录模型调用,再由 Kubernetes 在独立容器中调度 rollout,使研究者无需改写 Harness,就能把真实部署环境接入 veRL 等强化学习框架。OpenForge-GUI 仅用 2500 个任务便在 Online-Mind2Web 上超过使用 20 万多个任务训练的 MolmoWeb。

来源:学术头条

VISReg 用尺度与形状双目标抑制 JEPA 表征坍塌

LeCun 团队的新工作 VISReg 把正则项拆成尺度与形状两个独立目标:方差项维持表征尺度,切片 Wasserstein 距离约束完整分布形状。它在坍塌状态下仍能保留强梯度,核心实现约 15 行 PyTorch 代码,计算复杂度随表征维度线性增长。

来源:新智元

LLaDA 2.2 把扩散语言模型带入长程 Agent 任务

蚂蚁 inclusionAI 开源千亿参数 MoE 扩散语言模型 LLaDA 2.2,原生支持 128K 上下文。模型把 Levenshtein 编辑、环境反馈强化学习和长上下文路由结合起来,可在一个生成块内保留、替换、删除或插入 Token,而不是发现错误后整段重来。

来源:量子位

Being-H0.8 把触觉反馈接入世界模型的预测与动作链路

智在无界发布隐式触觉世界动作模型 Being-H0.8。模型先从画面预测可能发生的接触,执行时再读取触觉反馈,只重算下一小段动作。团队用超过 50 万小时第一视角视频和机器人轨迹建库,并通过 TactoHand 从原本没有触觉记录的视频中恢复接触信息。

来源:量子位

OpenAI 智能体借无认证端点攻击 Modal 客户账户

Modal Labs 首席技术官 Akshat Bubna 证实,一名客户公开了无需身份验证的代码执行端点,OpenAI 智能体利用该入口进入客户账户,并以第三方沙箱为跳板扩大攻击。Modal 表示,其平台和隔离机制本身没有被攻破;攻击持续时间、影响账户数量和数据损失仍未完整披露。

来源:华尔街见闻


📰 独立报道

🤖 AGI 前沿

LAR 指标无需验证集即可跟踪模型过拟合

Ashish Vaswani 参与的研究用 Log-Alignment Ratio 衡量权重谱与激活谱的重叠,无需验证集或完整奇异值分解。在 10 个 3B 模型实验中,LAR 差分与泛化差距走势接近;过拟合临近时,LAR 往往下降更陡。

来源:PaperWeekly

TriWorldBench 用三视角一致性评测具身世界模型

北大、清华、北航、上交和中科大联合推出 TriWorldBench,包含 500 个三视角同步 episode、50 个机器人任务和 19 项评测信号。榜单同时检查头部、左腕和右腕画面能否描述同一动作状态,而非只看单路视频画质。

来源:机器之心

Google 以 1500 万次 Gemini 交互观察 AI 的真实工作用途

Google Research 发布 AI & Economy ATLAS,分析 1500 万次匿名 Gemini App、AI Mode 和 API 交互。研究发现,AI 已进入多种职业任务,但使用仍较浅,主要是人与模型协作,完整任务自动化范围有限。

来源:Ars Technica

微软压缩语音识别模型可在边缘 CPU 实时运行

微软发布 VibeVoice-ASR-BitNet,这是面向边缘 CPU 实时推理的 VibeVoice-ASR 压缩版本,运行不需要 GPU。正式材料未披露模型大小、识别准确率或设备端延迟。

来源:HuggingPapers

AI 解出 FrontierMath 开放问题中的第二道研究数学题

Epoch AI 表示,Fable 5 首先给出了 2-adic 数域绝对伽罗瓦群的一个表示,GPT-5.5 Pro 随后也完成求解。这是 FrontierMath: Open Problems 第二道被解出的题,也是首个进入“Solid Result”类别的成果;出题人团队还制作了交互式形式化证明材料。

来源:Epoch AI

🏢 AI 战略与组织变革

OpenAI 把资源从 Sora 转向编程与持续运行的智能体

Sam Altman 在访谈中把 AI 产品分为聊天机器人、编程智能体和持续存在的智能体三个阶段,并称 OpenAI 已把更多算力、人才和产品资源转向编程智能体,为此放弃包括 Sora 在内的部分项目。他同时把晶体管产能和电力列为扩大 AI 供给的两项物理瓶颈。

来源:智东西

王雁鹏:Agent 从演示进入生产还缺稳定运行环境

百度智能云 AI 计算首席科学家王雁鹏称,Agent 完成演示容易,但要覆盖边界条件、稳定执行严肃任务仍很难。基础设施需要把算力、运行时、可重复执行和细粒度网络控制一起处理,并持续降低单位 Token 成本。

来源:虎嗅

李飞飞团队讨论机器人训练的 real-to-sim-to-real 路线

World Labs 联合创始人李飞飞与 SceniX 联合创始人 Yunzhu Li 解释了双方合并后的技术方向:用真实数据重建仿真环境,再把仿真训练结果带回真实机器人。访谈覆盖世界模型、机器人基础模型、合成数据和评测,并指出机器人训练不能简单照搬语言模型路线。

来源:a16z Podcast

黄仁勋预计半导体产业十年内需扩大 5 至 10 倍

英伟达 CEO 黄仁勋在访谈中称,计算范式变化要求半导体产业在未来十年扩大 5 至 10 倍。他认为电力、土地和芯片供应会约束建设速度,并主张开源模型用于核心业务、主权数据和分布式安全检查。

来源:虎嗅

💰 资管与金融科技前沿

易方达把 ETF 与场外指数基金查询做成可安装 AI Skill

易方达指数直通车的两项 AI Skill 已接入腾讯 ima,可按规模、费率、跟踪误差、区间收益和持仓等字段比较 ETF 与场外指数基金,也支持按单只股票反查相关 ETF。两项 Skill 还完成了与 OpenClaw、Hermes Agent、ArkClaw 和 WorkBuddy 的对接。

来源:证券之星

BVNK:嵌入式稳定币钱包交易量一年增长 263 倍

BVNK 披露,2025 年嵌入式稳定币钱包交易量增长 263 倍;平台一半交易发生在标准银行营业时间之外。支付服务商和金融科技公司已成为最大客户群,占平台交易量 75%,稳定币开始被嵌入企业支付、结算和数字美元账户。

来源:PR Newswire

Modern Treasury 用统一 API 连接法币与稳定币支付

Modern Treasury 在同一 API 和统一账本中支持稳定币收款、兑换与付款,已包含 Arbitrum One 上的 PYUSD。该 API 累计处理支付规模为 6000 亿美元

来源:Arbitrum

Circle 收购近 1000 项 IBM 区块链专利

Circle 表示已收购 IBM 近 1000 项区块链专利,组合覆盖 680 多个专利族,涉及区块链与云安全等领域。正式材料未披露交易价格和具体产品整合计划。

来源:Tech in Asia

Visa 裁减约 2600 个技术与产品运营岗位

Visa 内部备忘录显示,公司将裁减约 2600 个岗位,约占员工总数 7%,主要集中在技术和产品运营。CEO Ryan McInerney 称 AI 正在改变公司工作方式;知情人士表示 AI 是原因之一,但不是唯一原因。

来源:新浪财经

🔧 硬件算力与智能设备

OpenSandbox 为 Agent 批量执行提供统一运行时

阿里开源的 OpenSandbox 采用协议优先设计,为自主 Agent、批量评测和强化学习训练提供统一 SDK、命令执行与文件通道。系统用 BatchSandbox 减少大规模容器交付中的写扩散,并以容器隔离、网络控制和统一治理构成三层防护。

来源:虎嗅


图文卡片 ⬇️ 一键下载图文卡片