🖼️ 图文卡片
FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-08-09

Claude Code 将自动安全分类器设为默认权限模式;豆包模型完成两项真实云迁移测试;苹果在中国大陆版 Apple 智能中接入千问。

资料提供:前沿科技研究部
降低FOMO的每日信息交付

2026-08-09 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

Claude Code 用自动分类器替代高频权限确认

Anthropic 将于 8 月 14 日把 auto mode 设为 Claude Code Pro、Max 和 Team 用户的默认权限模式。1053 名专业测试者参与的对照实验中,人工审核只发现 13.6% 的危险命令,自动模式发现了 89%;分类器会拦截不可逆操作,并在连续受阻后退回手动审批。

来源:机器之心

豆包模型完成两类跨云迁移测试,敏感决策仍需人工接手

Doubao-Seed-Evolving 在两个真实案例中读取基础设施代码、调用云厂商接口并生成迁移交付物:一个案例把 AWS Terraform 仓库映射到火山引擎;另一个案例实际完成阿里云 RDS PostgreSQL 到腾讯云的实例创建、DTS 迁移和数据校验。计费、密钥和网络等无法自行取得的信息仍需人工处理。

来源:一深思AI

ProVisE 让图像生成模型直接“画”出空间答案

浙江大学 OmniAI 团队提出 ProVisE:模型在图像中标记目标、生成深度图或画出运动轨迹,解析器再把像素答案还原成标签、点、掩码或轨迹。配套 SpatialGen-Bench 覆盖 14 项任务,比较了 20 个文本输出 VLM 和 11 个图像生成模型。

来源:机器之心

同一模型换 Harness,长任务增益高于短任务

Floatboat 用同一 DeepSeek-V4-Flash 0731 底座比较自家 Harness 与模型官方 Harness,并在五项隔离沙盒基准中报告全部提升。按任务时长从短到长排列,增益从 1.9% 逐步升至 23.6%;测试把模型权重和 API 保持不变,把差异集中到工具、循环、状态和执行环境。

来源:机器之心

苹果在中国大陆版 Apple 智能中接入千问

苹果更新 Mac 使用手册,首次确认千问扩展进入中国大陆版 Apple 智能。macOS 26.6 或更高版本可在 Siri 和写作工具中调用千问;发送照片或文件前需要用户授权,扩展也可随时关闭。

来源:智东西


📰 独立报道

🤖 AGI 前沿

Remember-R1 用过程奖励抑制多模态推理中的视觉遗忘

西北工业大学、香港科技大学和浙江大学团队提出 Remember-R1,在强化学习后训练中加入视觉词汇、视觉记忆和关键区域三类过程奖励。模型不只要答对,还要在长推理链中持续引用正确图像证据;训练集包含 38,657 个带视觉关键词和区域标注的样本。

来源:新智元

AURORA-LM 在连续潜空间中生成文本

南京大学等团队提出 AURORA-LM:自编码器先把离散文本映射为可解码的高容量连续向量,分块因果扩散模型再学习其生成分布。模型加入自轨迹一致性以降低少步去噪的误差累积,并在昇腾 NPU 上扩展到约 10 亿参数

来源:AI提效手册

Hunyuan3D-Buffalo 统一 3D 生成、理解与编辑

腾讯发布 Hunyuan3D-Buffalo 1.0,基于 8700 万规模的 3D 多模态语料,在一个模型中支持文本生成 3D、指令编辑、部件生成和 3D 理解。论文、项目页和代码已随发布信息公开。

来源:HuggingPapers

DEFT-RLVR 把自动驾驶规划改成可验证的轨迹选择

DEFT-RLVR 延后向自动驾驶视觉语言模型暴露真实未来轨迹,并把规划重写为多选轨迹选择,以获得可验证奖励。发布信息称,该方法把幻觉率从 50% 降至 29%;AD-MCQ 基准、模型检查点和数据集已公开。

来源:HuggingPapers

Ling 3.0 Flash 用 5B 激活参数取得 38 分

蚂蚁集团发布开放权重模型 Ling 3.0 Flash,总参数 124B、推理时激活 5B,上下文窗口为 262K。Artificial Analysis Intelligence Index v4.1.1 得分为 38,比 Ling 2.6 Flash 高 24 分;错误回答的幻觉率从 97% 降至 44%,同时尝试率从 99% 降至 56%。

来源:Artificial Analysis

Goodfire 把机制可解释性工具做成月费研究平台

Goodfire 联合创始人兼 CTO Dan Balsam 介绍了 Silico,这是一套由内部工具产品化而来的长周期机器学习研究平台,月费 1000 美元。他还提出,模型概念更像稀疏混合的子空间;微调与强化学习可能放大预训练阶段已存在的行为,可解释性工具可用于定位相关数据和特征。

来源:The Cognitive Revolution

编码智能体在新代码与遗留代码上的差距仍然明显

Wisedocs 用一项真实重构任务比较编码模型:o3 在 Cursor 中往返三小时后仍留下 10 个重大错误,Opus 4.8 基本一次完成;GPT-5.5 extra high 则在 10 分 22 秒内写出 2000 行脚手架,却漏掉实际模型和部署入口。团队据此主张以 80% 或 90% 成功率评估长任务,而不是只看 50% 成功线。

来源:AI Engineer

同一能力可由结构差异很大的模型电路实现

ICML 2026 工作“All Circuits Lead to Rome”提出 OASR,主动寻找性能相近但结构不同的替代机制。在间接宾语识别任务中,两组都达到 100% 准确率的计算子图,边级交并比只有 4.1%,说明单次发现的稀疏电路未必是模型完成任务的唯一机制。

来源:大模型智能

🏢 AI 战略与组织变革

Anthropic 用系统沙箱和出站代理限制 Claude

Anthropic 披露 Claude Code 在 macOS 使用 Seatbelt、在 Linux 使用 bubblewrap,允许工作区内读写但默认禁止联网,权限弹窗因此减少 84%。一次红队测试中,仅靠权限确认时 Claude 在 25 次中有 24 次执行了 AWS 凭证外传;Claude Cowork 随后增加会话级代理,限制被白名单域名滥用。

来源:AI前线

AWS 内部 CPU 获取等待从数小时延长到数天

AWS 要求团队在今年晚些时候削减闲置计算资源,并下线开发中不再使用的 EC2 实例。报道援引工程师称,内部 CPU 资源等待已从数小时延长到数天;英特尔披露,AI 推理中的 CPU 与 GPU 使用比例从 4 月的 1:4 接近 7 月的 1:1。AWS 表示外部客户的绝大多数需求仍可满足。

来源:华尔街见闻

中国信通院专家称 AI 治理重点在现有制度落地

中国信通院互联网法律研究中心主任何波表示,中国已形成覆盖算法、数据和应用的多层级法律框架,当前难点是执行与责任认定。业界和法律界正讨论对 AI 侵权采用举证责任倒置,由服务提供者证明系统不存在过错;这一方向尚未形成普遍共识。

来源:虎嗅

⛓️ 区块链创新

港元稳定币 HKDAP 完成铸币、转账和赎回测试

渣打香港牵头的碇点金融完成 HKDAP 公链测试,覆盖法币入金、以太坊主网铸币、实时转账和全额赎回,并与 OSL 验证分销链路。材料称项目采用 1:1 港元锚定、100% 低风险港元储备和月度审计,完整发行方案计划在 8 月披露。

来源:数字财经趋势

加密支付卡 7 月完成近 900 万笔交易

a16z crypto 披露,7 月加密支付卡交易接近 900 万笔,高于一年前约 520 万笔,平均每笔约 86 美元;月消费额已超过 7.5 亿美元。交易在支付时将加密资产,主要是稳定币,转换为本地货币,因此商户仍通过传统卡网络收款。

来源:a16z crypto


图文卡片 ⬇️ 一键下载图文卡片