FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-10-06

Reflection 发布 5010 亿参数开源模型 Beam 对标闭源前沿,MCP 跨网络代理信任链漏洞和 Meta Muse 虚拟机逃逸同日曝光,暴露 Agent 规模化部署的安全缺口

降低FOMO的每日信息交付

2026-10-06 前沿科技洞见 · 日报

📊 今日关键数据

🔍 今日值得深读

Reflection 发布 501B 参数开源模型 Beam,用 10.5K GB300 跑出 1 亿次 RL rollout

Reflection AI 公布其首个开源权重模型 Beam:稀疏 MoE 架构,总参数 5010 亿、激活参数 230 亿,面向编码、推理和 Agent 任务。预训练用了 23.8 万亿 token,RL 阶段在 10500 张 NVIDIA GB300 GPU 上跑了 4 周、产生超过 1 亿次 rollout。Artificial Analysis 已获 Reflection 授权独立评测 Beam,早期信号显示其在同等智能水平下是目前见过的 token 效率最高的开源模型之一。

来源:reflection.ai

MCP 跨代理通信协议结构性信任漏洞曝光,Google、JPMorgan 等五家机构在列

独立研究员 Syed Anas Mohiuddin 过去五个月测试了 Google、摩根大通、Weaviate、Rapid7、法国政府跨部门数字化司以及美国联邦政府的 Agent 系统,发现一种针对 MCP(Model Context Protocol)信任链的新型提示注入手法:攻击者先攻陷网络内一个 Agent(如翻译或数据分析 Agent),再利用下游 Agent 对上游 Agent 的隐式信任,将恶意指令沿链条传递执行,可导致数据库内容及敏感业务信息被窃取。

来源:Ars Technica

Meta 承认 Muse 上线前发现虚拟机逃逸漏洞,可触达内部敏感数据库

404 Media 报道,Meta 的 AI Agent 产品 Muse 在上线前几周被工程师发现多个安全漏洞,其中至少一个允许普通用户从自己的隔离虚拟机中逃逸,摸到 Meta 内部敏感数据库。Muse 设计上每个用户的 Agent 运行在独立 KVM 虚拟机中,连接用户的邮箱、日历、消息、浏览器及第三方账号,按设计应与 Meta 核心基础设施完全隔离。事件上报至扎克伯格层级,多个安全团队连夜加班修复。

来源:AGI Hunt

a16z 对谈 Vals 联创:公开刷榜已成大厂"遮羞布",AI 评测需要独立机构

a16z 与 AI 评测公司 Vals 联合创始人 Rayan 的访谈指出,公开 benchmark 题目和评分标准全部透明后,模型厂商可针对性刷分,导致榜单成绩与真实工作能力脱节。Rayan 举例:Llama 4 在主要公开 benchmark 上表现亮眼,却在 Vals 的保密测试中低于预期。访谈还提到无限制使用 AI Agent 的算力成本可达人力工资的十倍,建议分工模式是政府制定规则、私营专业机构负责具体合规验证。

来源:Z Finance

何恺明团队为多模态模型加视觉记忆模块,AGI 测试分数从约 40 分升至满分

何恺明团队发布新系统,不改动基座模型本身,为多模态模型外挂轻量化视觉感知与显式记忆架构,使 Claude 在相关 AGI 测试上获得满分、GPT 获 99 分,较此前约 40 分大幅提升。团队判断瓶颈并非底层推理能力不足,而是离散字符表示对空间直觉的扭曲以及缺乏历史视觉记忆,该方案据称可将相关任务的算力消耗降低约 57%。

来源:newsbot.justinyan.app

Caltech 用物理信息神经网络攻克三维欧拉方程奇点难题,获陶哲轩公开力挺

Caltech 团队使用物理信息神经网络(PINN)首次得到三维无强迫欧拉方程的奇点候选解,此前全球学者用 PINN 求解该方程均未成功。团队自研二阶优化器大幅提升收敛速度和精度,AI 算出的缩放指数为 0.5,与理论预测完全吻合,陶哲轩公开表示支持。需注意,克雷数学研究所并未采纳该结果,千禧年难题(纳维-斯托克斯方程)仍被列为未解决,该团队本身也未打算以此申领千禧年奖。

来源:新智元

📰 独立报道

AGI 前沿

Hinton 首篇 RSI 论文:今天一年的 AI 进步未来可能只需 5 周

Geoffrey Hinton 10 月 3 日在 X 发文,联合全球顶尖学者发布关于递归自我改进(RSI)的报告,警告 AI 全面接管下一代 AI 研发可能引发"智能爆炸",彻底改变技术演进节奏,呼吁关注人类应对窗口期可能已经不多。

来源:华尔街见闻全球

OpenAI PR 在专访中打断记者追问 ChatGPT 用户自杀事件

OpenAI 公关人员在 Sam Altman 接受 Vanity Fair 采访时,试图在编辑追问一名 ChatGPT 用户自杀事件后转移话题,并警告记者"move on",该互动被完整记录并引发关注。

来源:The Verge

Altman:AI 带来的"一些坏事"值得接受

Sam Altman 表示 AI 带来的收益足够大,社会应该接受诈骗、黑客攻击等"坏事"作为发展代价,这是为实现更大收益必须承受的成本。

来源:The Verge

Anthropic、OpenAI、谷歌、Meta 高管将出席纽约市议会 AI 风险听证会

纽约市议会将于本周一召开全体委员会听证会,51 名议员全部出席,要求四家公司高管就 AI 潜在危害宣誓作证并回应拟议立法。Anthropic 派出前沿红队负责人出席。

来源:美股滚动新闻

Wikipedia 运营方称 OpenAI"失控"爬虫可能与今年 5 月的站点故障有关

维基媒体基金会确认发现 OpenAI"rogue"(失控)Agent 在 Wikipedia 上的活动,并将其与此前一次站点故障关联,为近期多起 AI Agent 越权访问第三方站点事件再添一例。

来源:The Verge

Stanford HAI 两项新研究质疑 benchmark 分数是否真的衡量模型能力

Stanford 研究者与合作者发布两项研究,指出 benchmark 分数直接影响模型的融资、采购和监管决策,但这些测试是否真正衡量其宣称的能力存疑,呼应当天 a16z/Vals 访谈提出的评测可信度问题。

来源:X · StanfordHAI

AI 战略与资本事件

Meta、微软被曝削减员工 Claude 用量以降本并推自家工具

The Information 报道,微软将其内部 Anthropic 使用的预期年度支出削减超过三分之一,Meta 同样在收紧员工对 Claude 的使用,两家公司意图转向推广自有 AI 工具。

来源:X · kimmonismus

SemiAnalysis:Opus 5.5 的 Agent 工作负载 API 等效价值是 GPT-6.1 Sol 的 5 倍以上

SemiAnalysis 测算显示,在 agentic workload 场景下,Anthropic Opus 5.5 订阅相对 GPT-6.1 Sol 提供超过 5 倍的 API 等效价值,差距明显。

来源:X · kimmonismus

AI 芯片初创 Etched 两个月内估值翻倍,收到 400 亿美元以上报价

Etched 今年早些时候以 210 亿美元估值完成 7 亿美元融资,当前正审阅顶级投资者给出的 400 亿美元和次级机构给出的 500 亿美元估值邀约,谈判仍处早期阶段。公司已获得累计 10 亿美元的客户订单,员工中 15% 曾在英伟达团队任职。

来源:techcrunch.com

Lola Vision Systems 用编译器工具链简化芯片端侧模型部署

AI 基础设施公司 Lola Vision Systems 开发将 AI 模型翻译为特定芯片可执行指令的"编译器工具链"软件,主攻端侧芯片运行模型这一长期存在工程摩擦的环节。

来源:techcrunch.com

英伟达风投押注不做硬件的 FieldAI,估值一年翻五倍至百亿美元

具身智能公司 FieldAI 正推进约 7 亿美元融资,投后估值达 100 亿美元,一年前估值仅 20 亿美元。英伟达风投部门 NVentures 与贝索斯家族办公室 Bezos Expeditions 共同领投其两轮累计 4.05 亿美元融资,FieldAI 核心产品 Field Foundation Model 面向通用机器人大脑,不涉足硬件制造。

来源:具身智能投研

Harvey 联创:法律 AI 应用公司靠开源生态建研究能力,不必比拼算力

估值 155 亿美元、超 80% 全美百大律所使用的 AI 法律公司 Harvey 联合创始人分享:应用层公司无需与基础模型厂商比拼资金和算力,而应借助开源模型、专业训练平台建立自身研究能力;法律客户数据敏感,Harvey 通过领域专家反向生成合成数据规避限制,依靠分层评测和模型路由保障生产环境稳定。

来源:Z Potentials

IDC 报告:中国智能体部署渗透率 81% 全球第一,但制造医疗能源核心业务闭环几乎为零

IDC 与浪潮信息联合发布的《2026年中国人工智能计算力发展评估报告》显示,中国 2026 年智能体部署渗透率达 81.0%,高于全球领先水平的 78.1%;但制造、医疗、能源三个传统行业把智能体接入核心业务并形成闭环的比例几乎为零,多数企业应用仍停留在基础阶段,2030 年全球 AI 算力缺口预计扩大至 3809 亿美元。

来源:IT有个圈儿

区块链与金融科技

香港年内提交虚拟资产修例草案,建立交易托管发牌制度

香港财经事务及库务局局长许正宇在立法会披露三个明确节点:年内提交条例修订草案,为虚拟资产交易、托管、提供意见及管理四类服务建立发牌制度;香港黄金中央清算及结算系统明年首季正式启用;港交所年内公布人民币计价、实物交收的黄金期货合约细节。香港已有 11 家平台获虚拟资产交易牌照,稳定币发行人发牌制度已于去年 8 月生效。

来源:通证经济

香港首批合规港元稳定币时间表明确:碇点 Q2、汇丰下半年

香港金管局总裁余伟文在立法会首次正式公布首批合规稳定币推出时间表:获牌机构碇点金融科技计划 2026 年第二季度起分阶段发行港元挂钩稳定币"HKDAP",汇丰银行将在 2026 年下半年推出自家港元稳定币。

来源:数字资产官网

学术 / 工程

新基准 ReviewBench:评测 AI 代码审查 Agent 的能力边界

GitHub 发布 ReviewBench,基于真实 GitHub PR 构建、具备多源真值标注和校准评估方法,用生产环境对齐的指标衡量代码审查 Agent 表现,弥补此类评测长期缺失的空白。

来源:GitHub 博客

VA-Bench 测出大模型空间智能"看懂不等于做对":12 个模型完整任务成功率仅约一半

机器之心报道的 VA-Bench 基准用"观察-推理-行动-修正"闭环测试 12 个主流多模态模型操作机械臂,发现目标识别与操作语义理解接近满分,但完整任务成功率仅约 50%,主动观察、精细控制和在线修正是主要瓶颈,表明模型"看懂场景"与"执行动作"之间仍存在明显断层。

来源:机器之心