前沿科技日报 · 2026-08-15
智谱 GLM-5.3 在基座不变的情况下靠后训练把编程和网络安全能力同时拉到开源第一梯队;谷歌 DeepMind 重组传闻与 Anthropic 风险报告同日发酵,两家公司都在被动交代内部模型和团队的真实状况;金融机构侧,邮储银行公开了自建的科技数智化中台,代币化股票市场规模两周内从 19 亿美元涨到 25 亿美元。
2026-08-15 前沿科技洞见 · 日报
📊 今日关键数据
- 743B 参数:智谱 GLM-5.3 基座模型参数量,与上代 GLM-5.2 完全相同,能力提升全部来自后训练规模化(来源:学术头条-公众号)
- 2436 个漏洞、约 3000 万元经济价值:GLM-5.3 网络安全能力累计发现的漏洞数量及对应经济价值估算(来源:学术头条-公众号)
- 388 个 PR,180 个已合并:Boris Cherny 让 Claude 接管 App 日常维护几周内产出并被合并的代码量(来源:新智元-公众号)
- 超三分之一:谷歌 DeepMind 传闻中可能面临的裁员比例,同时暂停冲击旗舰模型转向高性价比 Flash 系列(来源:APPSO-公众号)
- 4.65 倍:PhyAI 统一推理运行时相比官方实现在单请求测试中的最高加速倍数(来源:AI提效手册)
- 25 亿美元:截至 8 月 12 日代币化股票市场总规模,一周前统计口径还是 19 亿美元(来源:Lingowhale 专题)
- 26%–34%:谷歌研究中 GPT-5 和 Gemini 3 已存入参数、但直接提问答不出来的事实比例(来源:新智元-公众号)
🔍 今日值得深读
GLM-5.3:不换基座,靠后训练把编程和网络安全同时做到开源第一
智谱发布 GLM-5.3,与上一代 GLM-5.2 相比基座模型完全没变,只是把后训练规模做得更大:更多长程任务环境、更丰富的任务类型、更长的训练时间。结果是编程能力在内部主观评测中比 GLM-5.2 提升 50%,在 Terminal Bench 3.0、Agents' Last Exam(CLI)等公开基准上拿到开源模型第一;网络安全方向新增的攻防能力累计发现 2436 个各类漏洞,对应经济价值约 3000 万元。模型两周后开放权重,同步上线配套工具,并搭建了分层风险审查系统来限制滥用。
- 为什么值得深读:这证明后训练规模化本身已经能带来接近换代的能力跃升,不一定需要重新训练更大的基座,这会改变开源模型迭代的成本结构。
- 后续看点:两周后正式开放的权重能否复现官方给出的 Terminal Bench 3.0 分数,以及分层风险审查系统能否在真实滥用场景中拦住已发现的高危漏洞利用路径。
来源:学术头条-公众号
Claude 接管一款 App 的日常维护:388 个 PR,180 个已合并
Anthropic 产品负责人 Boris Cherny 让 Claude 接管自家 App 的日常维护,覆盖 iOS、Android、桌面端、Web、CLI 和 Agent SDK 六类环境,每条线由独立的 Routine 每天跑一遍崩溃巡检、死代码清理等十一项基础维护工作。几周下来 Claude 生成了 388 个 PR,其中 180 个已被合并,工程师的工作变成了确认签字,而不是自己写代码。同一批数据也显示,AI 高采用度团队里开发者人均 bug 数上涨了 54%,代码审查正在变成新的效率瓶颈。
- 为什么值得深读:这是一次把 Agent 自动化维护放进真实生产系统的实测,暴露出瓶颈已经从"AI 能不能写代码"转移到"人能不能审得过来"。
- 后续看点:Anthropic 是否会把 PR 验收条件标准化后开放给更多团队复用,以及人均 bug 数上涨的趋势是否会随审查流程调整而回落。
来源:新智元-公众号
OpenAI 未发布模型 Astra 攻克 10 道数学难题,被指未署名引用前人成果
OpenAI 本月初宣布其下一代模型 Astra 在内部测试中解决了 10 项数学界长期悬而未决的问题,且总 token 成本仅约 2000 美元。这份近 250 页的论文公布后,多位数学家联合指出,其中球体堆积和非 sofic 群等核心论证直接沿用了前人未被署名引用的学术成果,机器生成的 Lean 形式化代码虽然能通过验证,却缺乏解释性洞见。8 月 6 日《科学美国人》报道了这一学术不端争议,OpenAI 已连夜修改论文。
- 为什么值得深读:这暴露了当前"AI 解决数学难题"类宣传和学术规范之间的真实落差——形式化验证能证明结果正确,但不能替代对前人贡献的署名和核实。
- 后续看点:修改后的论文是否补齐了被指遗漏的引用,以及 OpenAI 之后发布同类研究成果时是否会引入独立同行评审环节。
来源:新智元-公众号
PhyAI:具身智能第一个端边云统一推理运行时
北京邮电大学联合北大、清华、明体科技等机构开源 PhyAI,这是面向 Physical AI 的统一推理运行时,把模型语义放进 Model Adapter,把调度、缓存、算子、图执行和并行计算统一交给运行时处理,同一套代码可以跑在端侧实时控制、边缘服务器和云端强化学习 rollout 四类部署场景,不用再为每种场景各写一套代码。团队还提出 Control-Time Roofline 模型来衡量机器人控制的性能瓶颈。相比官方实现,单请求测试中推理速度最高提升 4.65 倍,云端强化学习的 rollout 时间也因此减少 9.7%。
- 为什么值得深读:具身智能模型部署长期卡在"不同场景各写一套代码"的工程重复劳动上,这是第一次把四类部署路径统一到同一套运行时里。
- 后续看点:PhyAI 开源后能否被机器人厂商在真实产线上复现 4.65 倍的加速效果,尤其是在多卡通信压力更大的工厂级部署场景。
来源:AI提效手册
拆权重不训练替身:至知研究院提出大模型可解释性新路线
要理解一个训练好的大模型内部在做什么,传统机制可解释性方法(比如 Transcoder、稀疏特征模块)通常要先训练一套新的稀疏表示去近似原模型的计算,这本身就是一笔不小的数据和训练成本,而且替代模块万一没能充分复现原模块,后续分析可能同时在解释模型行为和替换误差。至知研究院等团队提出的方法绕开了这一步:直接把预训练权重分解成共享中间维度的稀疏矩阵来抽取任务回路,数据成本不到传统方法的 1%,还支持不需要校准文本的零数据版本,可用于对模型做定向编辑。
- 为什么值得深读:机制可解释性研究长期被"用一个黑箱解释另一个黑箱"的成本问题拖累,这次是直接从权重下手绕开了训练替身这一步。
- 后续看点:这套稀疏权重分解方法能否在更大规模模型和更多任务类型上稳定复现"同等性能、更少活跃连接"的结果。
来源:量子位-公众号
谷歌研究:GPT-5、Gemini 3 记住了事实,却经常"想不起来"
谷歌一项研究测试了 GPT-5 和 Gemini 3,发现两个模型都把 95%–98% 的测试事实存进了参数里,但直接提问时有 26%–34% 的事实答不出来,开启思维链多想一会儿后,仍有 11%–12% 想不起来——这和人类"话到嘴边就是想不起来"的舌尖现象(tip-of-the-tongue)很像。研究团队做了 450 万次测试,发现冷门知识和反向提问是模型卡壳的主要场景,单纯扩大参数规模只能增加存入量,不能改善提取能力,而思维链推理能通过计算缓冲和扩散激活机制帮助检索。
- 为什么值得深读:这说明大模型的"知道"和"说得出"是两种不同的能力,参数堆得越大不代表检索能力同步提升,这对怎么评估和改进模型的知识利用效率提出了新问题。
- 后续看点:思维链推理带来的检索改善是否只对冷门知识有效,以及是否有比"多想一会儿"成本更低的检索增强方案。
来源:新智元-公众号
🔥 今日聚合动态
谷歌 DeepMind 重组:裁员传闻、旗舰模型策略与官方回应打架
8 月 5 日 Alphabet 宣布重组 DeepMind、哈萨比斯卸任 CEO 转任董事长之后,围绕"谷歌是否放弃前沿模型研发"出现了两种明显不同的说法:多家信源称团队可能裁员超三分之一且暂停冲击旗舰模型,而虎嗅的报道引用内部信息反驳称谷歌其实在推双轨制,Gemini 4 训练已经启动。三条信源合在一起能看出这次调整的真实轮廓,而不是单一传闻。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 裁员与转向 | 量子位-公众号 | 谷歌把 DeepMind 非技术团队并入总部,联合创始人布林重新主导资源分配,新版 Gemini 因算力受限推迟发布,Gemini 3.5 Pro 发布计划已取消 |
| 裁员比例与人才流失 | APPSO-公众号 | DeepMind 或裁员超三分之一,不再研发旗舰模型,资源向高性价比的 Flash 模型倾斜;杰夫·迪恩等高管离职创业带走部分员工 |
| 官方回应与双轨制 | 虎嗅-前沿科技-网站 | 反驳"谷歌放弃前沿 AI"的说法,称公司实际推行商业化模型与旗舰模型并行的双轨制,Gemini 4 训练已启动,为公司最雄心勃勃的预训练项目 |
- 互补信息:裁员规模和"是否放弃旗舰模型"两个关键事实存在直接分歧,虎嗅的回应报道给出了 Gemini 4 已启动训练这一具体反证,三条信源合起来才能看出这次调整更接近资源再分配,而不是单纯收缩。
- 后续看点:Gemini 4 的训练进度和发布时间点,以及裁员比例最终会否被谷歌官方证实或证伪。
Anthropic 8 月风险报告:内部模型 Model 2 首度曝光
Anthropic 发布第二份《风险报告》,186 页,覆盖到 2026 年 7 月 15 日为止的全部风险评估。报告首次承认公司内部运行着一个能力超过 Claude Mythos 5、但没有对外发布计划的模型,代号 Model 2。多条信源在具体数字上互相补充,拼出这份报告的完整信息量。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| Model 2 的能力细节 | AI提效手册 | Model 2 在 CoBench 上得分 62.8%,高于 Mythos 5;内部使用量与 Mythos 5 相近;报告披露五起典型研发安全流程失灵事故 |
| 报告的组织与风险等级调整 | Lingowhale 专题 | 报告基于 RSP v3.4 发布,每 3 到 6 个月更新一次;覆盖 Claude Opus 5 等三款未公开发布的前沿内部模型;将前沿内部模型的灾难性错位风险等级上调至"低" |
| 生产代码渗透率 | 新智元-公众号 | Model 2 的 AECI 得分 162.79,略高于 Mythos 5;Claude 已写入 Anthropic 绝大多数生产代码;高风险误对齐等级从"极低"上调至"低" |
- 互补信息:三条信源分别给出了 Model 2 在不同评测体系(CoBench、AECI)下的具体分数、报告依据的 RSP 版本号,以及"绝大多数生产代码由 Claude 写入"这一此前未披露的细节,合起来能看清 Anthropic 这次披露的完整分量。
- 后续看点:Model 2 是否会在后续版本的风险报告更新周期(3 到 6 个月)内正式对外发布,以及五起研发安全流程失灵事故的具体整改措施。
代币化股票市场两周内从 19 亿冲到 25 亿美元
两条报道相隔仅几天,给出了代币化股票市场规模的两个连续快照,能看出这条赛道扩张的速度和格局变化。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 市场规模与玩家路径 | 吴说Real-公众号 | 代币化股票市场规模增至 19 亿美元;SEC 将代币化证券分为发行人主导等四类结构;Securitize 直接代币化并保留股东权利,Ondo 与 xStocks 通过债务证券提供合成敞口 |
| 交易所反超发行方 | Lingowhale 专题 | 截至 8 月 12 日市场规模约 25 亿美元,Ondo 以 8.66 亿美元、34.6% 市占率排第一;币安 bStocks 上线仅两月,凭 6.14 亿美元、24.53% 市占率反超先入局的 xStocks 升至第二 |
- 互补信息:两篇报道相隔约一周,规模从 19 亿涨到 25 亿美元,且交易所自建品牌(币安 bStocks)反超独立发行方的具体名次变化在后一篇里被记录了下来。
- 后续看点:币安 bStocks 能否守住第二名的位置,以及监管是否会放开注册股份直接上链这一可能重塑格局的关键动作。
📰 独立报道
🤖 AGI 前沿
港中文开源 Libra:重构 Agentic RL 资源管理,吞吐最高提升 300%
港中文与港恒生大学团队发布论文 Libra,指出传统强化学习后训练系统设计长期假设"rollout 慢,所以要尽可能加速 rollout",但这个假设对 Agent 场景不够用——Agent 在生成过程中会调用工具,系统资源需求模式随之改变。Libra 重新设计了资源管理方式,实测吞吐最高提升 300%,RL 训练整体提速 2.5 倍,论文和代码均已开源。
来源:PaperWeekly
小红书开源 dots3-note:与 IMO 满分模型同系列,聚焦长程无标准答案任务
小红书 dots 实验室开源 dots3-note preview,与上月刚拿下国际奥数竞赛官方认证满分(42 分)的自研模型 dots-note-3.0 同系列。新模型支持 512K 超长上下文,采用 TEMPO 算法与自评机制提升长程任务的规划与纠错能力,实测能玩转卡牌游戏并独立编写近两千行代码完成空间应用开发。团队同步开源了两套真实生活场景基准评测,暴露出现有 Agent 在维持长程能力上的短板。
来源:机器之心
中国 TTS 团队 Luna-TTS 登顶全球盲听榜单,超越谷歌等海外模型
上海交大背景的初创团队宇生月伴推出 Luna-TTS,在 Hugging Face TTS Arena V2 真人盲听榜单登顶总榜第一,与 ElevenLabs、Cartesia、Hume 等主流语音模型同场竞技;在 Artificial Analysis 全球 TTS 权威榜单上以 1220 Elo 位列全球第三。技术路线采用掩码扩散架构替代传统自回归生成,支持多语言百万小时级语音预训练。团队近期完成近亿元融资,目标押注 Voice Agent 赛道。
清华、腾讯发布 LPO:补齐 DeepSeek-R1 式推理模型的多样性短板
DeepSeek-R1 之后,基于可验证奖励的强化学习(RLVR)成为推理模型后训练的主流路线,但传统 GRPO 类方法只隐式调整概率分布,容易把模型训练到只认一种解法。清华与腾讯提出的 LPO 方法通过显式控制候选回答的概率分布,在保留正确率的同时保留多种有效解法,在多项推理任务的 Pass@k 测试中全胜,训练时梯度范数更低、波动更小。
来源:AI科技评论-公众号
AI 修 Bug 成 Linux 内核开发新常态,Linus:这是正常现象
Linux 7.2-rc7 候选版本发布前夕出现了异常庞大的补丁量,Linus Torvalds 解释这主要是因为 AI 工具介入了内核审核,Sashiko 等机器人持续挖出高危漏洞,包括硬件监控子系统中的竞态条件和越界访问漏洞,其中部分漏洞已潜伏 8 年之久。Linus 将此称为开发新常态。尽管补丁激增,Linux 7.2 正式版预计仍将于下周如期发布。
来源:多来源综合
国内首个 Agent 记忆榜单 AML 出炉,MemoraX 拿下工业榜冠军
近三十家国内外高校机构联合发起 Agent Memory Leaderboard(AML)首期榜单,8 月 12 日正式公布。工业榜中 MemoraX 以 58.0 分登顶,在文本类记忆的 7 个能力维度全部排名第一;开源方法榜由 InvMem 以 45.1 分夺冠,网易和腾讯系统在特定场景也有亮眼表现。榜单通过隔离接口和统一评分对记忆系统本身做独立评估,而不是把长上下文窗口和真正的长期记忆混为一谈。
来源:多来源综合
Rust 给 AI 编程立新规:能帮你看,不能替你写,用多了还会"熔断"
InfoQ 报道 Rust 生态正在探索限制 AI 生成代码权限的机制:AI 工具可以协助代码审查和静态检查,但不能直接替代人写核心逻辑;当 AI 生成代码的比例或修改频率超过阈值,相关流程会触发"熔断"机制强制人工介入。
来源:InfoQ 中文站
Zig 创始人批评 Bun 的 Claude 生成 Rust 重构版:没人把关的烂代码
Zig 语言创始人公开批评 JavaScript 运行时 Bun 用 Claude 生成的 Rust 重构版本,认为这份代码缺乏人工把关、质量堪忧。这一评论引发开发者社区围绕"AI 生成代码谁来负最终责任"的讨论。
来源:InfoQ 中文站
🏢 AI 战略与组织变革
AI 智能体开始参与软件交付,IBM 与 Red Hat 给出可验证方案
随着 AI 智能体越来越多地直接参与代码交付,谁来证明智能体没有"动手脚"成为新问题。IBM 与 Red Hat 联合提出一套面向 Agent 交付流程的验证方案,通过标准化的可追溯记录和审计接口,让智能体的每一步操作都能被回溯和核查,而不是依赖事后信任。
来源:InfoQ 中文站
⛓️ 区块链创新
SEC 代币化"创新豁免"计划进一步推迟
据加密记者 Eleanor Terrett 消息,美国 SEC 的代币化"创新豁免"计划进一步推迟,相关细节短期内不会公布。原因之一是 Clarity Act 第 10505 条有关代币化的内容仍在利益相关方之间协调,SEC 若此时推进豁免措施可能影响该条款的妥协进程。该豁免方案原本可能允许上市公司反对第三方将其股票代币化,SEC 仍计划稍后举行公开会议讨论涉及加密资产融资交易的新规则。
来源:吴说Real-公众号
美国 OCC 有条件批准特朗普家族 World Liberty Financial 银行牌照申请
路透社报道,美国国家银行监管机构 OCC 有条件批准了与特朗普家族相关的 World Liberty Financial 提交的银行牌照申请,这将允许该公司直接发行其 USD1 稳定币,而不再需要通过第三方银行合作伙伴。
来源:Techmeme
Solana 即将迎来 Alpenglow 升级,交易终结时间从 12.8 秒压缩到 150 毫秒
Solana 即将上线 Alpenglow 升级,目标是把交易终结(finality)时间从目前约 12.8 秒大幅压缩到约 150 毫秒,接近传统金融清算系统的响应速度。
来源:U.Today
💰 资管与金融科技前沿
邮储银行建成科技数智化中台,用统一数据和流程打通十五大能力中心
中国邮政储蓄银行金融科技部总经理汪航撰文介绍,邮储银行为解决科技工作中管理工具分散、数据质量低、知识割裂、协同效能不足等痛点,创新打造了 AI 驱动的科技数智化中台,建成十五大能力中心,打通科技管理链、研发链、运维链,实现"制度规范系统→系统生成数据→数据优化制度"的三维闭环治理框架。中台依托"邮智"大模型平台,建设了七大类场景应用智能体。
来源:金融电子化
🎓 学术前沿
(本日相关学术突破已并入"今日值得深读"的 PhyAI、大模型可解释性、GPT/Gemini 舌尖现象三条,此处不重复列出。)
🔧 硬件算力与智能设备
章鱼动力发布仿生灵巧手 OctoH-Hand,集成超 1900 个触觉单元
章鱼动力推出全栈自研的 OctoH-Hand 绳驱仿生灵巧手,通过数采孪生方案让数据采集手套与灵巧手的构型直接匹配,消除了传统数据重定向环节的误差损耗。灵巧手集成超过 1900 个触觉传感单元,全周期定位精度不超过 0.1 毫米,搭配高密度触觉感知与全闭环力控,目标是实现精细柔顺的物理操作。
来源:多来源综合
具身智能仿真评测平台 RoboColiseum 发布,真机对齐度近 90%
针对具身智能领域"评测标尺缺位"的行业痛点,常态化具身智能仿真评测平台 RoboColiseum 于 8 月 14 日发布。平台仿真表现与真机对齐度接近 90%,提供四维评测体系和主流基线,半小时内即可出结果,并将任务拆解为子步骤以追溯模型失败原因。平台面向全球高校、科研机构和模型企业开放,目前已有 40 多个团队同场参与评测。
来源:机器之心-公众号