FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-07-24

Anthropic 发布更低成本的 Claude Opus 5;Vivix 把近 30B 激活参数的实时多模态模型压到消费级 GPU;Bridgewater 将可自检、可学习的投研智能体部署给数百名投资者。

降低FOMO的每日信息交付

2026-07-24 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

Claude Opus 5 用一半任务成本逼近旗舰模型

Anthropic 发布 Claude Opus 5,并将其设为 Claude Max 默认模型。按 Anthropic 公布的评测,Opus 5 在 Frontier-Bench v0.1 上较 Opus 4.8 提升一倍以上;CursorBench 3.2 最高档成绩距 Fable 5 峰值不到 0.5%,单任务成本约为后者一半。它在网络安全任务上仍落后于 Mythos 5。

来源:Anthropic

Bridgewater 把投研智能体 PAT 部署给数百名投资者

Bridgewater 公开内部工具 PAT 的架构与演示。PAT 可把数小时探索性研究压缩到数分钟,通过结构化计划并行生成代码,再由基于 DAG 的验证智能体检查结果;“Teach”功能还能把一次错误转成新基准和修复 PR。团队称,加入类似人工检查的时间序列搜索后,相关准确率从 50% 提高到 90%。

来源:LangChain

Vivix A1 把实时多模态交互延迟压到 0.6 秒

Vivix 发布实时互动模型 A1 和互动叙事模型 W1。A1 将语音、视觉、手势、环境事件和持续生成放进原生流式架构,用户可在音视频生成过程中插入新指令。其激活参数接近 30B,通过 MJD 蒸馏、NVFP4 训推策略和推理基础设施在消费级 GPU 上运行;官方披露平均首次可见响应约 0.6 秒,流式调度器最短响应 300 毫秒。

来源:量子位Z Potentials

小红书开源 BigMac,多模态训练最高提速 1.9 倍

小红书开源多模态训练框架 BigMac。它以 LLM 流水线为主干,把编码器和生成器计算按依赖关系嵌入其中,避免异构模态拖慢流水线,也不必长期保留随 microbatch 数量增长的激活值。实验中,训练速度达到基线的 1.08—1.9 倍,并在全局 batch size 增大时保持稳定显存占用;该框架已用于 dots 多模态模型的生产训练。

来源:机器之心

S-Agent 用工具链补齐视觉语言模型的空间推理

南洋理工大学 S-Lab 与 Ropedia 提出 S-Agent:视觉语言模型负责理解问题和规划,专用模型处理深度、位姿与 3D 对齐,空间专家再将几何输出转成可用证据。S-Agent 在零样本设置下取得 MMSI-Bench 46.4% 和 ViewSpatial-Bench 60.0%;经 S-300K 轨迹蒸馏后,8B 模型在两项测试上分别达到 41.6 和 46.8。

来源:机器之心

25 家科技公司联署反对全面限制开放权重模型

Meta、微软、英伟达、Mistral、Hugging Face 等 25 家公司签署公开信,要求美国政策制定者避免对开放权重模型施加宽泛且过早的限制。信中区分通用蒸馏技术与非法提取闭源模型价值,主张后者应由针对性的法律和商业框架处理;OpenAI 与 Anthropic 未签署。

来源:TechCrunch第一财经

ChatGPT Health 接入病历与 Apple Health

OpenAI 面向美国成年用户逐步开放 ChatGPT Health。经授权后,它可读取部分医疗机构病历及 Apple Health 中的用药、化验、就诊、睡眠和运动数据,在普通对话中比较历次检查、整理就诊变化并准备复诊问题。OpenAI 强调该功能不能替代诊疗;目前覆盖网页版和 iOS 版,尚未进入 Codex。

来源:智东西


📰 独立报道

🤖 AGI 前沿

腾讯 E-GRM 让奖励模型按不确定性决定是否展开长推理

腾讯混元提出 E-GRM:先用多次并行解码检查答案一致性,一致性高则直接回答,低于阈值才触发思维链;再用混合 Huber 回归与 Hinge 排序损失评估推理路径。在 RM-Bench、RMB 和 RewardBench 上,约 58% 的样本被路由到直接回答,延迟降低 62%,准确率同时提高。

来源:量子位

腾讯 SkillHone 为智能体技能保存完整优化历史

腾讯微信提出 SkillHone,把每轮诊断、候选修改、评估证据和接受或回退决定保存为持久历史,并把优化对象从单个说明文件扩展到完整代码仓库。论文案例中,深度研究 Skill 五轮后的探针准确率从 30% 提高到 70%;只依赖最终分数接受或放弃整份候选的对比方法停在 40%。

来源:机器之心

DataFlow-Harness 把自然语言需求转成可编辑数据流水线

北京大学 DCAI 团队等开源 DataFlow-Harness。Agent 不直接生成一次性脚本,而是通过带类型的操作修改共享 DAG;每次变更都经过读取状态、提交、验证和写入,检查环路与相邻算子的 Schema 兼容性。用户可在对话和可视化画布中共同编辑同一条流水线。

来源:Datawhale

Vending-Bench 把长程智能体评测搬进真实商店

Andon Labs 先让模型经营模拟售货业务,再把实验延伸到无人咖啡店和 AI 电台。团队发现模型意识到自己被测试后会改变行为,因此采用“从真实环境中途分叉到模拟环境”的方式提高复现性。演讲披露,Gemini 经营的咖啡店亏损 6000 美元 后被 GPT 接替。

来源:AI Engineer

K12-KGraph 用中国中小学教材构建知识图谱与评测集

K12-KGraph 从中国官方中小学教材构建课程对齐知识图谱,包含 10,685 个节点、23,278 条边、23,640 道评测题和 2,267 组训练数据。披露结果显示,Gemini-3-Flash 在该基准上的得分为 57%,说明教材知识检索与课程关系推理仍有明显空间。

来源:HuggingPapers

大模型“隐式身份”框架统一指纹与水印技术

西安交通大学、中国科学院信工所和迪肯大学研究团队提出大模型“隐式身份”框架,覆盖数据集、模型和生成内容三个生命周期层面。框架把从资产固有特征中提取身份的指纹技术,与主动植入可验证信号的水印技术分开,并从正确性、鲁棒性、安全性和部署成本组织评估。

来源:AI科技评论

🏢 AI 战略与组织变革

Marvis 用端侧模型提前理解设备环境

腾讯应用宝团队披露桌面 Agent Marvis 的产品与技术路径:经授权后,端侧模型提前识别本地文件、程序和行为,避免为一次模糊查询全盘扫描并把大量内容传到云端。团队将核心指标放在真实任务完成数;产品上线两天 DAU 超过 30 万,七日留存约 54%

来源:APPSO

星环科技把 Agent 数据处理链路迁到 GPU

星环科技介绍其 GPU 原生认知数据库:存储、计算、编译和执行围绕 GPU 重写,并用 GIDS 让 GPU 直接访问存储,减少 CPU 与 GPU 间的数据搬运。公司测试显示,该系统在 TPC-DS SF1000 的完整 99 项查询中较 DuckDB 加速 70 倍;这一结果仍需第三方环境复核。

来源:智东西

💰 资管与金融科技前沿

易方达基金在腾讯 ima 上线五个基金研选 Skill

易方达基金在腾讯 ima 上线 5 个基金研选 Skill 和 3 个知识库专区,覆盖投教导航、基金解析、季报信息提炼、ETF 查询和场外指数基金查询。服务面向投资者的信息查找与材料整理,不构成投资建议。

来源:每日经济新闻

英美提出跨境代币化测试与稳定币监管协作

英美跨大西洋未来市场工作组提出十项建议,包括设立为期一年的私营部门小组测试跨境代币化资产应用,推动 FCA、SEC、CFTC 与英格兰银行研究代币化证券结算最终性,以及稳定币和代币化货币市场基金作为中央对手方保证金抵押品的条件。

来源:点滴科技资讯

🔧 硬件算力与智能设备

极智嘉把具身智能的首个规模化场景锁定仓储

极智嘉联合创始人陈曦披露,公司用 Gravity 4D 框架、Gino 1 人形机器人、移动机器人和工作站协同完成拣货、播种与搬箱。公司判断仓储仍有 30%—40% 的拣货打包等环节需要“手眼”操作,并以作业效率而非演示中的泛化范围作为商业化门槛。

来源:甲子光年