前沿科技日报 · 2026-08-25
开源模型在 Vercel AI Gateway 的 Token 调用份额首次反超闭源至 62%;英伟达 Groq 3 LPX 全面投产,Vera Rubin 在智能体工作负载下每兆瓦吞吐最高达 GB300 的 30 倍;小米发布玄戒 O3/O100/D100 三颗自研芯片。
2026-08-25 前沿科技洞见 · 日报
📊 今日关键数据
- 62%:Vercel AI Gateway 上开源模型 Token 调用份额,8 月 22 日首次反超闭源模型(来源:AI前线)
- 30 倍 / 35 倍:英伟达称 Vera Rubin NVL72 在 SemiAnalysis AgentX 工作负载下每兆瓦吞吐最高为 GB300 NVL72 的 30 倍,每 token 成本最高降低 35 倍(来源:华尔街见闻)
- 522 万:小米玄戒 O3 安兔兔跑分,为安卓阵营首个突破 500 万的 SoC(来源:极客公园)
- 39% vs 21%:JetBrains 调查中 Claude Code 与 GitHub Copilot 的工作使用率(来源:CSDN)
- 26.72%:华泰 AI 行业轮动模型今年以来超额收益(来源:华泰证券金融工程)
🔍 今日值得深读
开源模型 Token 份额首次反超闭源,英伟达再押开源
Vercel AI Gateway 数据显示,过去 60 天开放权重模型的 Token 调用份额从 28% 升至 62%,8 月 22 日首次超过闭源模型;DeepSeek 单独拿下 22.6%。同一时期 OpenAI、Anthropic 密集推新并降价,绝对调用量仍在增长,但 Token 增量更多流向开源。英伟达同步以 60 亿美元技术授权、10 亿美元股权投资收编 Poolside 约 100 名工程师进入 Nemotron 团队。
- 为什么值得深读:开源模型第一次在真实生产流量中成为主流,英伟达扶持低价开源供给,意在把利润重新沉淀回 GPU 与 CUDA 底座。
- 后续看点:Poolside 团队并入 Nemotron 后能否在一年内推出超万亿参数的前沿开源模型;DeepSeek 的 22.6% 份额能否维持。
来源:AI前线
英伟达 Groq 3 LPX 全面投产,Vera Rubin 重算智能体效率
英伟达宣布 Groq 3 LPX 全面投产,作为 Vera Rubin 平台的专用 Token 生成加速器。在 Artificial Analysis 测试中,Gemma 4 31B 在 100,000 token 上下文下达到每秒 3,400 个输出 token;在 SemiAnalysis AgentX 工作负载下,Vera Rubin NVL72 每兆瓦吞吐最高为 GB300 NVL72 的 30 倍,每 token 成本最高降低 35 倍。Nebius 将成为首个部署该芯片的 AI 云。
- 为什么值得深读:智能体任务要循环读取、调用工具并累积数十万 token 上下文,英伟达开始用每兆瓦有效工作量和 token 成本衡量推理,而不再只看延迟或峰值算力。
- 后续看点:Groq 3 LPX 在 Nebius Token Factory 上线后的实际价格与适配模型范围;Vera Rubin 量产后第三方复测。
来源:华尔街见闻
墨奇 MORPHI KINO 完成 15 分钟长程家务
墨奇 MORPHI KINO 机器人在世界机器人大会首次演示 15 分钟连续完成收拾客厅、检查冰箱、取出和放入烘干机衣物、启动机器并叠衣等约七八十个动作,全程无人接管。其 MoRA 具身模型把决策能力直接装进端侧 System 1,而不是云端下指令。公司成立 8 个月,团队 150 多人,计划明年交付千台机器人。
- 为什么值得深读:具身智能的考题正从几十秒抓取 demo 转向“长程任务能否从头干到尾”,墨奇用轮式、夹爪、数据质量优先和 Agentic-Native 端侧路线,与主流方案反向选择。
- 后续看点:明年千台交付是否兑现;MoRA 在更多非结构化家庭任务中的成功率。
来源:极客公园
字节整合 TRAE、扣子进豆包,将推统一办公品牌“豆包工作”
《智能涌现》称字节跳动完成办公 AI 产品团队整合,TRAE、扣子整体并入豆包体系,TRAE Work 与扣子进入豆包工作场景;TRAE IDE 及 CLI 保留为豆包品牌下的编程产品线。调整后团队向豆包产品负责人赵祺汇报,豆包最快本周推出独立办公品牌“豆包工作”,并与飞书继续整合。最近一周豆包已密集上线远程控制电脑、Windows 虚拟桌面、云电脑、侧边工作台等功能。
- 为什么值得深读:字节把分散的 AI 编程、智能体和办公能力收拢到豆包一个主干,工作场景 Agent 与飞书深度绑定,办公 AI 从单点工具转向统一入口。
- 后续看点:“豆包工作”发布后 TRAE、扣子老用户是否顺畅迁移;其与飞书的整合边界和权限模型。
来源:智能涌现
小米发布玄戒 O3/O100/D100 三颗自研芯片
小米发布三颗自研芯片:旗舰 SoC 玄戒 O3 安兔兔 522 万分,采用十核全大核架构并首发支持 LPDDR6;端侧 AI 加速芯片玄戒 O100 用 6nm 晶圆级堆叠做到 1.22TB/s 带宽;智驾芯片玄戒 D100 为国内首款 3nm 智驾芯片,支持 200B 以上参数模型。O3 与 O100 双芯原型机配合 MiMo 模型本地推理最高 330 token/s。O100 与 D100 明年商用。
- 为什么值得深读:小米从单颗 SoC 扩展到“人车家”算力底座,O100 用封装和架构突破端侧内存墙,D100 进入智驾芯片,说明 3nm 制程约束下仍有架构创新空间。
- 后续看点:O3 在小米 18 Fold 上的第三方复测;O100 的良率、成本和商用机型。
来源:极客公园
广东 Token 贷落地,Token 消耗成为银行授信参考
广东省首个词元经济专项金融产品“Token 贷”在广州海珠区落地,中国银行、中信银行、广州银行等机构相继跟进。银行将 Token 消耗量作为 AI 企业授信参考之一,但并非唯一指标;专家认为 Token 类似工业用电量,反映经营活跃度,不能直接等同于偿债能力。
- 为什么值得深读:轻资产 AI 企业缺少传统抵押物,Token 消耗为银行提供高频经营数据,但从 Token 消耗到收入、再到偿债能力,存在商业化效率和现金流质量两个转化断层。
- 后续看点:银行是否公布 Token 贷实际授信规模、风险权重和坏账数据;是否出台统一的数据口径与监管细则。
来源:财联社AI daily
Pi 核心贡献者谈 Token 黑箱:买到的模型可能不是你以为的那款
Pi 核心贡献者 Armin Ronacher 等人在播客中称,第三方 Token 市场在模型版本、量化程度、缓存计费和数据处理上都不透明,低价订阅掩盖真实 token 成本。他们还指出 OpenAI 多 Agent 提示词加密、缓存机制不透明,正在强化基础设施层锁定。
- 为什么值得深读:Token 是生成式 AI 的生产资料,但市场不透明让企业无法核对“买到的是哪个模型、多少量化、如何计费”,问责链条缺失。
- 后续看点:是否出现第三方评测或监管要求,强制披露模型版本、量化程度和缓存计费规则。
来源:虎嗅
🔥 今日聚合动态
OpenRouter 模型路由平台:Stripe 收购与 Agent 支付基础设施
Stripe 宣布收购 AI 模型路由平台 OpenRouter,交易规模约 75 亿至 80 亿美元。两个来源分别提供平台运营数据和支付逻辑:一方聚焦 OpenRouter 的模型供给、调用量与 Stripe 的 AI 采购入口,另一方认为 Agent 跨平台高频小额交易会让稳定币成为结算刚需。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 平台运营数据 | 多来源综合 | OpenRouter 连接 500 多个模型,企业月均调用量从年初 2 亿次增至 8.7 亿次;其 GMV 从 2025 年初每月 1200 万美元增至 2026 年 7 月 9500 万美元。 |
| Agent 支付逻辑 | 全球风口 | Agent 需要按次购买几美分的 API、MCP 服务和内容,传统账户、信用卡和预充值结算成本过高,稳定币更适配小额高频自动结算。 |
- 互补信息:前者补充 OpenRouter 的供给规模与 Stripe 支付整合事实;后者补充 A2A 协议已有 150 多家机构支持,以及 AWS Bedrock AgentCore Payments 在收购前一天上线。
- 后续看点:交易完成后 OpenRouter 是否纳入 Stripe 计费、税务与成本优化体系;Agent 间稳定币结算是否在 OpenRouter 实际落地。
📰 独立报道
🤖 AGI 前沿
JetBrains 调查:Claude Code 使用率 39%,反超 GitHub Copilot
JetBrains Research 2026 开发者生态调查覆盖超 1.5 万名专业开发者。Claude Code 工作使用率从 1 月 18% 升至 39%,GitHub Copilot 从 31% 降至 21%;90% 开发者每周至少使用一次 AI 编程 Agent,68% 每天使用。
来源:CSDN
Meta 开源 Muse Glimmer:30B 参数本地智能体模型
Meta 以 Apache 2.0 发布 300 亿参数 Muse Glimmer,面向消费级 GPU 本地运行,支持视觉、工具调用和长程规划。4-bit 动态量化后显存约 17–20GB,DFlash 推测解码在 M4/M5 Max 和 RTX 5090 等硬件上最高提升 3.1 倍生成吞吐。
来源:AI前线
ParaTempo:按时序置信度修剪并行推理分支
ParaTempo 是免训练并行推理框架,依据时序置信度对推理分支剪枝、终止和分叉,延迟最高降 32%,token 用量降 30%,同时保持准确率。
微软发布 ThinkingBox-Bench:507 个有状态业务任务评测工具型 Agent
微软在 Hugging Face 发布可执行基准 ThinkingBox-Bench,以 507 个有状态业务任务评测工具调用 Agent,覆盖零售、旅行、保险等场景。
GraphWorkflow 多 Agent 调度最高提速 62.5%
Swarms 团队发布 GraphWorkflow,把预定义多 Agent 任务图编译后重复执行,在 10、50、200 节点静态图上对比 LangGraph 1.0.4 最高提速 62.5%。作者指出真实瓶颈已从模型能力转向组织层调度。
来源:虎嗅
声网:企业级 Agent 的关键不是自治,而是可控的结果生意
声网 AI 产品线负责人姚光华在 AI 产品大会分享,企业级对话 Agent 要从“像人”转向“解决业务结果”,用托付梯度、结果付费、架构围栏和语音交互规则建立评测、回归与责任机制。
来源:人人都是产品经理
AI 攻击已全自动,防御端仍在等人工审核
由 Hugging Face 遭 AI 自主攻击事件切入,文章认为 AI 攻击已形成全自动闭环,防御端却未完成全自动化升级;攻防能力同源,AI 原生公司可能更快补上自动化防御。
来源:多来源综合
扣子桌面端六项核心功能实测全部首轮通过
光子星球对扣子桌面端本地文件处理、命令执行、项目续做、云盘、深度截图、手机遥控六项功能实测,全部首轮通过;未授权目录访问请求被成功拦截。编程任务分配 2 核 4G 沙箱并支持实时预览。
来源:光子星球
🏢 AI 战略与组织变革
兰德:中美 AI 企业差异在物理世界
兰德公司基于 1181 家中美 AI 开发企业数据,认为两国 Transformer 主导和基础模型企业占比接近;美国 61% 企业提供纯软件,中国为 26%,更多进入机器人、自动驾驶、制造、交通和能源。
来源:虎嗅
DeepSeek、智谱与 Kimi 的前沿生存竞争
国内三家模型原生公司进入前沿竞争后,面临参数 3 万亿级、算力 GW 级与收入不足的约束;三者 AI 业务 ARR 合计或略高于 20 亿美元,明显低于 OpenAI 与 Anthropic 合计超 1000 亿美元。
来源:虎嗅
RunningHub 成为多款 SOTA 模型首发平台
RunningHub 拿到 WAN 3.0、MiniMax H3 等模型首发,并即将上线 Seedance 2.5 1080P;平台积累 1.3 万+节点、10 万+模型、8 万+工作流,依托 Haima Cloud 实现前沿模型快速适配,并推出 Vibex 支持创作者工作流变现。
来源:智能涌现
诺基亚启动杭州研发中心关停
诺基亚官宣关停杭州研发中心,预计裁员 1600 人。大中华区营收从 2018 年 22 亿欧元降至 2025 年 9.13 亿欧元,5G 份额低于 3%,全球业务重心转向北美。
来源:虎嗅
💰 资管与金融科技前沿
华泰金工 AI 行业轮动模型今年以来超额收益 26.72%
华泰证券 AI 行业轮动模型以全频段量价融合因子对 32 个一级行业周频打分,每周等权配置 5 个行业;截至 8 月 21 日,该模型今年以来超额收益 26.72%,未来一周配置非银行金融、银行、食品、钢铁、消费者服务。
来源:华泰证券金融工程
🎓 学术前沿
MedGuard:把医学事实核查嵌入诊疗流程
蚂蚁 AI 安全实验室与厦门大学提出 MedGuard,把诊疗对话拆成可独立验证的原子医学声明,在 7B 参数规模下于 MedGuardEval 上 F1 较基线平均提升 22.1%;126 名持证临床医生七维评分均超 4.0。
来源:机器之心
UniGOOD:首次统一图分布外泛化与检测
南开大学、北航与中信银行提出 UniGOOD,首次将图分布外泛化和检测纳入统一优化体系,通过不变子图分布生成器、跨不变子图谱对比学习等模块,在协变量与语义偏移并存时同时提升泛化与检测。
来源:PaperWeekly
苏剑林解构 Scaling Law:优化、架构、数据三重分解
苏剑林从优化、架构、数据三个维度拆解 Scaling Law,把总损失差距分解为数据误差、优化误差和架构误差之和,并推导学习率、批大小与训练步数的幂律关系。
来源:PaperWeekly
🔧 硬件算力与智能设备
IBM 开发 IBM Z/LinuxONE 双架构处理器
IBM 在 Hot Chips 公布为 IBM Z 和 LinuxONE 开发双架构处理器,可原生执行 z/OS 工作负载和 Arm 应用,被称为数十年主机架构最重要变化之一。
来源:Techmeme
AI 散热进入液冷与余热回收阶段
顶配 AI 机柜功率约 120 千瓦,传统风冷不再适配;冷板式液冷成为当前高密度 AI 机柜主流方案,浸没式可支持兆瓦级整机柜散热,多地利用自然冷源并回收余热。
来源:虎嗅
Artificial Analysis 推出手机端小模型智能与推理评测
Artificial Analysis 与 Liquid AI 合作,在 iPhone 17 Pro 和 Galaxy S26 Ultra 上评测 4-bit 及以下精度小模型的智能与推理性能,覆盖端到端生成时间、输出速度、峰值内存等指标。