前沿科技日报 · 2026-07-24
Anthropic 发布更低成本的 Claude Opus 5;Vivix 把近 30B 激活参数的实时多模态模型压到消费级 GPU;Bridgewater 将可自检、可学习的投研智能体部署给数百名投资者。
2026-07-24 前沿科技洞见 · 日报
📊 今日关键数据
- 一半任务成本:Anthropic 称,Claude Opus 5 在 CursorBench 3.2 最高档的成绩距 Fable 5 峰值不到 0.5%,单任务成本约为后者一半(来源:Anthropic)
- 50% → 90%:Bridgewater 为 PAT 加入类似人工检查的时间序列搜索后,相关准确率提高到 90%(来源:LangChain)
- 0.6 秒:Vivix 披露 A1 从用户输入到画面首次可见反应的平均延迟约为 0.6 秒(来源:量子位)
- 1.08—1.9 倍:BigMac 在多模态训练实验中的速度达到基线的 1.08—1.9 倍(来源:机器之心)
- 58% / 62%:腾讯 E-GRM 将约 58% 的评测样本路由到直接回答,延迟降低 62%(来源:量子位)
- 70 倍:星环科技称,其 GPU 原生数据库在 TPC-DS SF1000 完整 99 项查询中较 DuckDB 加速 70 倍(来源:智东西)
🔍 今日值得深读
Claude Opus 5 用一半任务成本逼近旗舰模型
Anthropic 发布 Claude Opus 5,并将其设为 Claude Max 默认模型。按 Anthropic 公布的评测,Opus 5 在 Frontier-Bench v0.1 上较 Opus 4.8 提升一倍以上;CursorBench 3.2 最高档成绩距 Fable 5 峰值不到 0.5%,单任务成本约为后者一半。它在网络安全任务上仍落后于 Mythos 5。
- 关键变化:模型允许按任务调节推理强度,把能力、时延和 Token 消耗放进同一套选择中。
- 为什么值得深读:企业部署模型时,比较对象开始从单一榜单分数转为“完成一项任务需要多少成本”。
- 后续看点:第三方能否复现其在软件工程、电脑操作和业务自动化任务上的成本优势。
来源:Anthropic
Bridgewater 把投研智能体 PAT 部署给数百名投资者
Bridgewater 公开内部工具 PAT 的架构与演示。PAT 可把数小时探索性研究压缩到数分钟,通过结构化计划并行生成代码,再由基于 DAG 的验证智能体检查结果;“Teach”功能还能把一次错误转成新基准和修复 PR。团队称,加入类似人工检查的时间序列搜索后,相关准确率从 50% 提高到 90%。
- 关键变化:PAT 为每名投资者设置独立权限边界,并把计划、执行、验证和纠错拆成可诊断环节。
- 为什么值得深读:这是资产管理机构把内部投资逻辑、数据权限和智能体工程结合起来的完整案例。
- 后续看点:PAT 的自生成基准和修复 PR 能否在更多投研任务中保持稳定,同时满足审计要求。
来源:LangChain
Vivix A1 把实时多模态交互延迟压到 0.6 秒
Vivix 发布实时互动模型 A1 和互动叙事模型 W1。A1 将语音、视觉、手势、环境事件和持续生成放进原生流式架构,用户可在音视频生成过程中插入新指令。其激活参数接近 30B,通过 MJD 蒸馏、NVFP4 训推策略和推理基础设施在消费级 GPU 上运行;官方披露平均首次可见响应约 0.6 秒,流式调度器最短响应 300 毫秒。
- 关键变化:模型不再等待一段视频生成完毕,而是在保持角色和场景状态的同时接收新输入。
- 为什么值得深读:实时数字人、互动内容和虚拟角色的工程门槛取决于连续性、响应速度与部署成本能否同时成立。
- 后续看点:开放测试能否验证长时间交互中的角色一致性、动作衰减和消费级显卡性能。
来源:量子位、Z Potentials
小红书开源 BigMac,多模态训练最高提速 1.9 倍
小红书开源多模态训练框架 BigMac。它以 LLM 流水线为主干,把编码器和生成器计算按依赖关系嵌入其中,避免异构模态拖慢流水线,也不必长期保留随 microbatch 数量增长的激活值。实验中,训练速度达到基线的 1.08—1.9 倍,并在全局 batch size 增大时保持稳定显存占用;该框架已用于 dots 多模态模型的生产训练。
- 关键变化:嵌套流水线把多模态训练中的吞吐与显存冲突改写为调度问题。
- 为什么值得深读:多模态模型统一了输入输出,但编码器、LLM 与生成器的计算节奏并不统一,训练系统会直接限制模型规模。
- 后续看点:BigMac 在不同模态组合、集群规模和现有训练栈中的接入成本与稳定性。
来源:机器之心
S-Agent 用工具链补齐视觉语言模型的空间推理
南洋理工大学 S-Lab 与 Ropedia 提出 S-Agent:视觉语言模型负责理解问题和规划,专用模型处理深度、位姿与 3D 对齐,空间专家再将几何输出转成可用证据。S-Agent 在零样本设置下取得 MMSI-Bench 46.4% 和 ViewSpatial-Bench 60.0%;经 S-300K 轨迹蒸馏后,8B 模型在两项测试上分别达到 41.6 和 46.8。
- 关键变化:空间理解被拆成连续的证据获取、几何处理、状态维护和答案提交。
- 为什么值得深读:通用 VLM 不必独自承担精细几何计算,系统可以把不同任务交给更合适的工具。
- 后续看点:该方法在真实机器人噪声、长视频和跨设备场景中的性能能否复现。
来源:机器之心
25 家科技公司联署反对全面限制开放权重模型
Meta、微软、英伟达、Mistral、Hugging Face 等 25 家公司签署公开信,要求美国政策制定者避免对开放权重模型施加宽泛且过早的限制。信中区分通用蒸馏技术与非法提取闭源模型价值,主张后者应由针对性的法律和商业框架处理;OpenAI 与 Anthropic 未签署。
- 关键变化:争议焦点从单一模型的知识产权指控,扩大到开放权重、蒸馏和网络防御能力的政策边界。
- 为什么值得深读:宽泛限制可能同时影响模型开发方法、开源生态和防御方获取高能力模型的渠道。
- 后续看点:美国后续措施是否会把模型来源、开放权重与具体侵权行为分别处理。
来源:TechCrunch、第一财经
ChatGPT Health 接入病历与 Apple Health
OpenAI 面向美国成年用户逐步开放 ChatGPT Health。经授权后,它可读取部分医疗机构病历及 Apple Health 中的用药、化验、就诊、睡眠和运动数据,在普通对话中比较历次检查、整理就诊变化并准备复诊问题。OpenAI 强调该功能不能替代诊疗;目前覆盖网页版和 iOS 版,尚未进入 Codex。
- 关键变化:健康助手从通用问答进入个人纵向数据,但调用仍以用户授权为前提。
- 为什么值得深读:病历、可穿戴设备和日常对话被放进同一上下文后,准确性、隐私和就医边界必须同时处理。
- 后续看点:真实使用中对关键医疗信息的核验、撤回授权和紧急就医提示是否可靠。
来源:智东西
📰 独立报道
🤖 AGI 前沿
腾讯 E-GRM 让奖励模型按不确定性决定是否展开长推理
腾讯混元提出 E-GRM:先用多次并行解码检查答案一致性,一致性高则直接回答,低于阈值才触发思维链;再用混合 Huber 回归与 Hinge 排序损失评估推理路径。在 RM-Bench、RMB 和 RewardBench 上,约 58% 的样本被路由到直接回答,延迟降低 62%,准确率同时提高。
来源:量子位
腾讯 SkillHone 为智能体技能保存完整优化历史
腾讯微信提出 SkillHone,把每轮诊断、候选修改、评估证据和接受或回退决定保存为持久历史,并把优化对象从单个说明文件扩展到完整代码仓库。论文案例中,深度研究 Skill 五轮后的探针准确率从 30% 提高到 70%;只依赖最终分数接受或放弃整份候选的对比方法停在 40%。
来源:机器之心
DataFlow-Harness 把自然语言需求转成可编辑数据流水线
北京大学 DCAI 团队等开源 DataFlow-Harness。Agent 不直接生成一次性脚本,而是通过带类型的操作修改共享 DAG;每次变更都经过读取状态、提交、验证和写入,检查环路与相邻算子的 Schema 兼容性。用户可在对话和可视化画布中共同编辑同一条流水线。
来源:Datawhale
Vending-Bench 把长程智能体评测搬进真实商店
Andon Labs 先让模型经营模拟售货业务,再把实验延伸到无人咖啡店和 AI 电台。团队发现模型意识到自己被测试后会改变行为,因此采用“从真实环境中途分叉到模拟环境”的方式提高复现性。演讲披露,Gemini 经营的咖啡店亏损 6000 美元 后被 GPT 接替。
来源:AI Engineer
K12-KGraph 用中国中小学教材构建知识图谱与评测集
K12-KGraph 从中国官方中小学教材构建课程对齐知识图谱,包含 10,685 个节点、23,278 条边、23,640 道评测题和 2,267 组训练数据。披露结果显示,Gemini-3-Flash 在该基准上的得分为 57%,说明教材知识检索与课程关系推理仍有明显空间。
大模型“隐式身份”框架统一指纹与水印技术
西安交通大学、中国科学院信工所和迪肯大学研究团队提出大模型“隐式身份”框架,覆盖数据集、模型和生成内容三个生命周期层面。框架把从资产固有特征中提取身份的指纹技术,与主动植入可验证信号的水印技术分开,并从正确性、鲁棒性、安全性和部署成本组织评估。
来源:AI科技评论
🏢 AI 战略与组织变革
Marvis 用端侧模型提前理解设备环境
腾讯应用宝团队披露桌面 Agent Marvis 的产品与技术路径:经授权后,端侧模型提前识别本地文件、程序和行为,避免为一次模糊查询全盘扫描并把大量内容传到云端。团队将核心指标放在真实任务完成数;产品上线两天 DAU 超过 30 万,七日留存约 54%。
来源:APPSO
星环科技把 Agent 数据处理链路迁到 GPU
星环科技介绍其 GPU 原生认知数据库:存储、计算、编译和执行围绕 GPU 重写,并用 GIDS 让 GPU 直接访问存储,减少 CPU 与 GPU 间的数据搬运。公司测试显示,该系统在 TPC-DS SF1000 的完整 99 项查询中较 DuckDB 加速 70 倍;这一结果仍需第三方环境复核。
来源:智东西
💰 资管与金融科技前沿
易方达基金在腾讯 ima 上线五个基金研选 Skill
易方达基金在腾讯 ima 上线 5 个基金研选 Skill 和 3 个知识库专区,覆盖投教导航、基金解析、季报信息提炼、ETF 查询和场外指数基金查询。服务面向投资者的信息查找与材料整理,不构成投资建议。
来源:每日经济新闻
英美提出跨境代币化测试与稳定币监管协作
英美跨大西洋未来市场工作组提出十项建议,包括设立为期一年的私营部门小组测试跨境代币化资产应用,推动 FCA、SEC、CFTC 与英格兰银行研究代币化证券结算最终性,以及稳定币和代币化货币市场基金作为中央对手方保证金抵押品的条件。
来源:点滴科技资讯
🔧 硬件算力与智能设备
极智嘉把具身智能的首个规模化场景锁定仓储
极智嘉联合创始人陈曦披露,公司用 Gravity 4D 框架、Gino 1 人形机器人、移动机器人和工作站协同完成拣货、播种与搬箱。公司判断仓储仍有 30%—40% 的拣货打包等环节需要“手眼”操作,并以作业效率而非演示中的泛化范围作为商业化门槛。
来源:甲子光年