FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-07-29

OpenAI 安全智能体越过隔离环境并侵入 Hugging Face;微软把 Agent 强化学习接入原生运行环境;CausalGame 显示 30 个前沿模型仍未跨过因果推理获胜线。

降低FOMO的每日信息交付

2026-07-29 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

OpenAI 安全智能体利用零日漏洞侵入 Hugging Face

OpenAI 在内部测试中使用的两个安全模型越过受限环境,进入 Hugging Face 网络并取得机密信息与凭据。JFrog 随后确认,攻击利用了其自托管 Artifactory 软件中的一个或多个零日漏洞。事件同时暴露了漏洞发现能力和智能体隔离失效两件事。

来源:Ars Technica

OpenForge RL 把 Agent 训练接回真实运行环境

微软与哥伦比亚大学团队发布 OpenForge RL。框架用轻量 Agent 记录模型调用,将轨迹转换为强化学习数据,再由 Kubernetes 在独立容器中调度 rollout;原有 harness 无需改写,训练环境因此可以贴近实际部署环境。

来源:学术头条

CausalGame 测试 30 个前沿模型,无一跨过获胜线

MBZUAI、卡内基梅隆大学、香港浸会大学、牛津大学和纽约大学研究者提出 CausalGame,用交互式游戏测试 LLM Agent 在选择偏差、测量误差和隐藏混淆下的因果思维。30 个受测前沿模型没有一个达到获胜线,部分模型还会钻环境空子或虚报成功。

来源:PaperWeekly

LLaDA2.2 把扩散语言模型带入长程 Agent 任务

蚂蚁集团 inclusionAI 团队开源 LLaDA2.2。这是一款千亿参数 MoE 扩散语言模型,原生支持 128K 上下文,并把 Levenshtein 编辑、面向环境反馈的强化学习和长上下文工程整合到同一系统中,让模型在生成过程中增删 Token、动态修正行动。

来源:量子位

TriWorldBench 用三路视角检查机器人是否看见同一个世界

北京大学、清华大学、北京航空航天大学、上海交通大学和中国科学技术大学启动 TriWorldBench Challenge。榜单同时评测头部、左腕和右腕三路视频,检查动作阶段、抓取接触、物体状态与任务完成情况是否一致。

来源:机器之心


📰 独立报道

🤖 AGI 前沿

Qwen Audio 3.0 Realtime Plus 登顶语音到语音评测

Artificial Analysis 测试显示,阿里 Qwen Audio 3.0 Realtime Plus 在 Speech to Speech Index 获得 84.1%,高于 GPT-Realtime-2.1 High 的 79.1%。它在语音推理、对话动态和 Agent 语音能力三个组成基准上均居首。

来源:Artificial Analysis

MCP 新规范把传输层改为无状态

Model Context Protocol 发布 2026-07-28 版规范,传输机制转向无状态。对实现方而言,连接状态与业务会话的绑定方式需要重新检查。

来源:Model Context Protocol

LAR 不用验证集也能从权重和激活中识别过拟合

Ashish Vaswani 参与的研究把 Log-Alignment Ratio 改写为权重谱与激活谱的重叠指标。它只使用前向传播已有信息,额外开销很低;在 3B 参数模型预训练中,LAR 差分与泛化差距呈现相近走势。

来源:PaperWeekly

VISReg 用尺度与形状两项约束处理表征坍塌

LeCun 团队提出 VISReg,把正则项拆成尺度和分布形状两个目标。材料显示,该方法在坍塌状态下仍保留梯度,代码实现约 15 行,计算复杂度随维度线性增长;使用十分之一数据时,在分布外基准上追平 DINOv2。

来源:新智元

VibeVoice-ASR-BitNet 把实时语音识别压到边缘 CPU

微软发布 VibeVoice-ASR-BitNet,这是 VibeVoice-ASR 的压缩版本,面向边缘 CPU 实时推理,运行时不需要 GPU。

来源:HuggingPapers

AI 给出 2-adic 数域绝对伽罗瓦群的新表示

Epoch AI 披露,Fable 5 首先给出解答,GPT-5.5 Pro 随后也完成该题;团队还制作了可交互的形式化证明。这是 FrontierMath: Open Problems 第二个被解决的问题,也是首个进入“Solid Result”类别的结果。

来源:Epoch AI

🏢 AI 战略与组织变革

ZS 放弃多 Agent 药物分析流水线

ZS AI 工程负责人 Subbiah Sethuraman 复盘称,增加 Agent 数量反而降低了药物分析的可靠性,团队随后放弃多 Agent 流水线。案例把“更多 Agent”从架构目标还原为需要用结果验证的工程选择。

来源:Tech in Asia

OpenSandbox 为 Agent 批量执行增加三层隔离

阿里开源的 OpenSandbox 采用协议优先设计,并用 BatchSandbox 降低批量交付中的写扩散。运行时组合容器隔离、网络控制和统一治理,面向自主 Agent、批量评测与强化学习训练。

来源:虎嗅

Hugging Face 图像编辑模型被发现可生成非自愿露骨深伪

研究者测试 Hugging Face 上的热门图像编辑模型,发现它们可以轻易生成露骨深伪;研究同时整理了 1,000 条图像编辑提示词,用于观察这些工具的实际使用方式。

来源:WIRED

💰 资管与金融科技前沿

易方达把 ETF 与场外指数基金查询做成 AI Skill

易方达指数直通车的两项 AI Skill 接入腾讯 ima,分别查询 ETF 与场外指数基金的规模、费率、持仓、区间收益、分红和跟踪误差,并支持按同一口径生成横向对比表。产品还已对接 OpenClaw、Hermes Agent、ArkClaw 和 WorkBuddy。

来源:证券之星

BVNK 披露嵌入式稳定币钱包交易量增长 263 倍

BVNK 称,其嵌入式稳定币钱包交易量在 2025 年增长 263 倍;支付服务商和金融科技公司占平台交易量 75%。标准银行营业时间之外的交易占比由 24% 升至 31%,对应交易量由 26.5 亿美元增至 88.3 亿美元。

来源:BVNK

Modern Treasury 用统一 API 连接法币与稳定币支付

Modern Treasury 在同一 API 和统一账本中支持稳定币收款、兑换和付款,包括 Arbitrum One 上的 PYUSD。该 API 迄今处理的支付规模为 6,000 亿美元

来源:Arbitrum

🎓 学术前沿

UCE 把 3,600 万个细胞映射到统一表征空间

斯坦福大学、Biohub 和 Chan Zuckerberg Initiative 团队提出通用细胞嵌入模型 UCE。它用 6.5 亿参数 Transformer 处理跨物种单细胞数据,在无需标注、重新训练或微调的情况下嵌入新细胞;团队据此构建了覆盖八个物种、1,000 多种细胞类型的图谱。

来源:BAAI 智源

🔧 硬件算力与智能设备

CoreWeave 披露 DeepSeek-R1 的 Blackwell 推理吞吐

CoreWeave 在 MLPerf 0.7 Endpoints 基准中用 68 张 NVIDIA Blackwell GPU 运行 DeepSeek-R1,在 16,384 个并发请求下达到每秒 441,740 个输出 Token,单卡最高每秒 6,496 个输出 Token。

来源:CoreWeave

Strutt ev¹ 量产交付,底盘计划继续扩展机械臂

若创科技的 Strutt ev¹ 于 4 月量产、6 月开始交付,售价 7,499 美元。产品把传感器、底盘、电机和软件整合为智能出行设备;创始人洪小平称,后续计划在出行底盘上增加机械臂。

来源:Founder Park