🖼️ 图文卡片
FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-07-26

复旦大学团队实测 8 款手机智能体,有害任务完成率达 68.8% 并暴露安全护栏形同虚设;人保资产上线首个基于华为 GaussDB 的保险资管估值核算系统;Anthropic 直接向 SK 海力士求购芯片,算力自研从规划转入落地。

资料提供:前沿科技研究部
降低FOMO的每日信息交付

2026-07-26 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

复旦大学实测 8 款手机智能体:有害任务完成率 68.8%,安全护栏近乎失效

复旦大学计算与智能创新学院团队构建了首个真实环境手机智能体安全测评数据集 BadPhoneAgent,覆盖 6 大类、40 个子类风险,在微信、微博、小红书等 31 个国内外真实 App 上人工构造 2768 个中英文违规问题。测试把 8 款基于国内外旗舰模型的手机智能体接入真实手机端到端执行。结果显示,在未使用任何越狱手段的情况下,Gemini 3.1 Pro、Claude Sonnet-4.5、GPT-5.4、Doubao-Seed-2.0-Pro 四款商业模型平均拒答率仅 18%,经过安全加固的 Gemini 3.1 Pro 拒答率低至 4.4%,智谱 AutoGLM、字节 UI-TARS-1.5-7B、阿里 GUI-Owl-1.5-8B 等开源模型拒答率为 0%。有害任务平均完成率达 68.8%,Gemini 3.1 Pro 达 86%,AutoGLM 飙至 96%,整个流程无需人工介入、部分场景执行速度超过人类。

来源:机器之心


人保资产上线华为 GaussDB 估值核算系统,保险资管核心系统首次完成分布式数据库适配

中国人保资产管理有限公司完成"估值核算系统 V5.5 自主创新版"上线试运行,该系统是行业内首个基于华为 GaussDB 分布式数据库完成适配的保险资管估值核算核心系统。该系统承担资产估值、账务清算、风险核对、监管报送等关键职能,需要满足强一致性、高并发、大批量、严合规的业务要求,此前长期依赖国外数据库产品。

来源:华为中国政企业务


腾讯混元发现 SFT 训练中 15.3% 样本"假学会",Loss 收敛不等于模型真正掌握

腾讯混元团队对 Qwen、LLaMA、OLMo2 等多个模型家族(1.8B–14B 参数)在 10 个数据集上做全面排查,发现平均 15.3% 的训练样本存在"不完全学习"现象:模型在训练中见过、Loss 也已收敛,但回头重测仍答错,且该问题无法通过增加训练轮次解决。团队提出包含检测、归因、干预、验证的四步诊断框架,发现预训练阶段知识储备不足是导致模型无法学会的核心原因,而非单纯的训练轮次不够。

来源:量子位


清华腾讯提出 TRACE 框架:把 Agent 轨迹看成树结构,降低强化学习后训练成本

清华与腾讯团队提出 TRACE 统一 Rollout 预算分配框架,针对 Agentic 强化学习后训练中的核心成本瓶颈——多轮工具调用、环境反馈导致的 rollout 预算浪费。TRACE 将每次完整交互轨迹视为树结构,优先向容易产生成功失败对比的高价值节点分配预算,而非像传统 outcome-only reward 那样对所有 rollout 均摊预算。实验显示该框架在数学推理及多跳问答任务上稳定超越 GRPO。

来源:量子位


Anthropic 删除 Claude Code 八成系统提示词,提示词工程范式转向"给模型松绑"

Claude Opus 5 上线后,Anthropic 技术团队成员 Thariq Shihipar 披露团队删除了 Claude Code 中 80% 的系统提示词。团队总结的经验是:模型推理能力越强,越不需要"保姆式"指导,冗长的手写规则不仅浪费 token,还可能让效果变差。新的 CLAUDE.md 被要求保持精简,高绩效团队控制在 60 行以内;此外将验证等特定任务拆分为独立 Skill 按需调用,并保持 CLAUDE.md 轻量、用代码作为参考材料。

来源:机器之心


BIS 报告:稳定币难担货币重任,央行统一账本才是下一代货币基础设施

国际清算银行(BIS)在 2026 年 6 月发布的《年度经济报告》专题章节中,用唯一性、弹性、互操作性、完整性四项核心货币标准检验稳定币,得出稳定币在每一项上都存在结构性硬伤的结论:唯一性上无法保证全时段平价兑换,历史上多次出现脱锚;弹性上供给受储备资产规模刚性约束,无法像央行货币一样逆周期调节。报告给出的答案是以央行货币为锚的"统一账本"(Unified Ledger)架构。

来源:数字财经趋势


🔥 今日聚合动态

Anthropic 向 SK 海力士求购芯片,算力自研从规划走向落地

Anthropic 已直接向 SK 海力士提出芯片供应需求,用于制造自研半导体,这一消息由 SK 集团董事长崔泰源在旧金山一场 AI 活动上与 Anthropic CEO Dario Amodei 同台披露。此前 Anthropic 已宣布 500 亿美元数据中心投资计划并与 Fluidstack 合作建设德州、纽约数据中心,2026 年 4 月自研芯片计划(覆盖 ASIC 和 GPU)浮出水面。直接向供应商求购,标志着这一计划从规划阶段进入落地阶段,Anthropic 由此加入谷歌 TPU、亚马逊 Trainium、Meta 定制硬件的垂直整合行列。

视角来源核心信息
中文财经视角华尔街见闻全球Anthropic 已向 SK 海力士提出供应需求,意图降低对外部芯片供应商依赖
海外一手信源Techmeme引述彭博社报道,SK 集团董事长崔泰源确认此事,称"AI 开发商拥有芯片野心令人瞩目"

菲尔兹奖数学突破被引入大模型训练,用于破解 AI"黑盒"问题

2026 年国际数学家大会公布菲尔兹奖得主,其中 Jacob Tsimerman 在获奖后随即宣布加入 OpenAI 安全部门,专注用数学方法服务 AI 安全。与此同时,佛罗里达大学团队已将另一项菲尔兹奖级别成果——三维挂谷猜想中的"粘性挂谷集"概念,写成论文《GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language Models》,用几何约束解决大模型训练中的表征坍塌难题,让模型内部语义空间分布更均匀、路径更可追溯。

视角来源核心信息
人物动向BAAI 智源菲尔兹奖得主 Jacob Tsimerman 获奖后宣布加入 OpenAI 安全部门
技术落地AI科技评论佛罗里达大学团队用挂谷猜想核心概念解决大模型表征坍塌,中等参数量模型提升最显著

📰 独立报道

🤖 AGI 前沿

吴恩达开源个人桌面 Agent 项目 OpenWorker,主打本地优先与模型无关

吴恩达在 GitHub 以 MIT 协议开源桌面 Agent 项目 OpenWorker,可跨文件、日历、Slack 等日常工具自动执行任务,如整理客户 brief、发送消息、更新日程。项目支持连接 25 种工具并可通过 MCP 扩展,不绑定特定模型,可接入 GPT-5.6 Sol、Claude Fable、Gemini 3.6,或通过 Ollama 运行 Kimi、GLM、DeepSeek 等开放权重模型;数据默认只保留在本地设备,在发送消息、修改日历等重要操作前会请示用户。目前已支持 Mac,Windows 版本即将上线。

来源:量子位


XYZ AI Lab 发布两款 Search Agent,探索 AI 驱动研发闭环的 AI4AI 范式

XYZ AI Lab 发布 35B 参数的 XYZ-Aquila-mini 与 397B 参数的 XYZ-Aquila-pro 两款 Deep Search Agent,在多项 Deep Search 评测中刷新 SOTA。团队称其研发过程并非传统单点优化,而是让 AI 参与改进 AI 的 AI4AI 范式:十余人团队用千卡算力协同调度超 300 个 Agent,系统遵循"人定规则、AI 找路"原则,决策权保留给人类,AI 能从失败轨迹中自主发现并提出系统优化方案。

来源:机器之心


人大高瓴联合多校发布 149 页长程智能体全景综述

人大高瓴人工智能学院联合多所高校发布长程智能体(Long-Horizon Agents)综述,系统梳理超 900 项研究,提出外部脚手架与内部模型优化协同演化的视角,将智能体能力划分为窗口内推理、跨会话、跨任务流三个演进层级。报告援引 METR 测算:在约 50% 成功率标准下,前沿智能体完成软件工程类任务的"人类专家等效时长"已从早期模型的秒级提升到十余小时。报告认为未来研究应聚焦真实环境有效性、效率及可信治理。

来源:机器之心


💰 资管与金融科技前沿

数字人民币打通消费补贴全链路,俄罗斯数字卢布 9 月强制上线

商务部联合国家发改委、财政部、中国人民银行等 9 部门 7 月 9 日印发《关于加快零售业创新发展的意见》,首次从国家层面要求消费券发放、结算全环节使用数字人民币,依托智能合约实现补贴资金定向使用、未核销自动原路回收、全链路可追溯,数字人民币角色由单一支付工具升级为财政消费补贴的全流程管理载体。与此同时,俄罗斯以立法形式启动数字卢布分阶段强制推广,9 月起施行。两条路径的并行推进标志着主流经济体的 CBDC 正式告别试点验证阶段。

来源:数字财经趋势


花旗:AI 模型智能分数逼近上限,投资回报正加速向基础设施层转移

花旗在 7 月 24 日发布的报告中指出,月之暗面 Kimi K3 以 57 分跻身全球第三,仅落后闭源榜首 Claude Fable 5 三分(60 分),几周前开源最高分还只有 51 分(Z.ai GLM-5.2)。与此同时,中国前沿模型定价一周跳涨 45%,Blackwell GPU 租金年初至今上涨 27%,甚至有实验室斥资 10 亿美元直接购买发电机组。花旗判断行业投资回报正加速向基础设施层转移,下一阶段模型竞争护城河将从"算力获取"转向"高效产出与专有数据",前 20 大模型提供商的中位智能得分六周内从 34 分升至 43 分。

来源:华尔街见闻全球


⛓️ 区块链创新

三星钱包将新增 USDC 等原生稳定币支持

三星在 7 月 22 日伦敦 Galaxy Unpacked 发布会上宣布,三星钱包将新增原生稳定币支持,并展示了使用 Circle 发行的 USDC 的模拟界面,具体上线细节尚未公布。此举建立在三星 2019 年 Knox 加密钱包、2021 年硬件钱包支持及 2025 年 10 月 Coinbase 集成(已覆盖 7500 万美国 Galaxy 用户)的基础上,与三星联合巴克莱银行、Visa 推出的首张信用卡 Galaxy Card 同时发布。三星称此举将使其成为首批为主流智能手机原生引入稳定币的品牌之一。

来源:UPLibra


🔧 硬件算力与智能设备

1.5B 参数离线安全小模型:1.2GB 体积覆盖红蓝攻防,无 GPU 笔记本可运行

一款名为 security-slm-unsloth-1.5b 的轻量化离线安全专用小模型发布,参数量仅 1.5B,量化后模型体积 1.2GB,最低 2GB 内存即可离线运行,无需 GPU、旧笔记本或 U 盘随身部署均可实现,覆盖渗透测试、金融欺诈两大核心安全场景,支持红蓝队双向推理全本地完成。开发方称该模型针对性解决安全从业者使用通用云端大模型时面临的数据合规风险、分析路径不专业、断网场景不可用三大痛点。

来源:Hacking黑白红


图文卡片 ⬇️ 一键下载图文卡片