前沿科技日报 · 2026-07-22
WAIC 2026收官,AI基础设施的比拼从模型参数转向Token成本——英伟达三个月内把GB200跑DeepSeek的推理能效提到4倍,清程极智把同类推理成本压低75%,阿里平头哥把服务过400多家客户的AI软件栈开源出去对标CUDA
2026-07-22 前沿科技洞见 · 日报
📊 今日关键数据
- 4倍:英伟达GB200 NVL72运行DeepSeek R1 0528模型时,三个月内每兆瓦算力吞吐量(TPS/MW)的提升幅度(来源:华尔街见闻全球)
- 56万片:阿里平头哥真武AI芯片截至今年4月的累计出货量,服务20多个行业400多家客户(来源:BAAI 智源)
- 75%:清程极智"Token前店后厂"架构使跑DeepSeek推理成本下降的比例(来源:BAAI 智源)
- 140万亿:截至2026年3月中国日均Token调用量,较2024年年初增长超1000倍(来源:钛媒体)
- 2.42万亿:商汤大装置WAIC披露的日均Token服务量,预计2026年底达日均10万亿(来源:智东西)
- 42.47%:智谱在Kimi K3发布后两个交易日内的累计市值跌幅(来源:钛媒体)
🔍 今日值得深读
英伟达三个月内把GB200跑DeepSeek的推理能效提升4倍
英伟达披露,通过38项软件栈优化,GB200 NVL72运行DeepSeek R1 0528模型(1K输入/1K输出配置)时的每兆瓦算力吞吐量(TPS/MW)在三个月内提升了4倍。这些优化经过超25万次模拟配置筛选、累计140万GPU小时验证,其中九成以上可跨模型复用,意味着现有数据中心客户不换硬件也能拿到这部分收益。同期,GB300在256卡规模下预训练DeepSeek-V3 671B达到每GPU 1648 TFLOPs,较GB200提升约3倍,其中在PyTorch原生训练栈TorchTitan上的提升幅度达到6倍。这组数字说明,英伟达在Rubin平台铺开之前,正靠软件层持续挖掘Blackwell的剩余算力,而不是单纯等待下一代芯片。
- 关键事实:GB200 NVL72运行DeepSeek R1时的TPS/MW三个月内提升4倍;GB300预训练DeepSeek-V3 671B的吞吐量六个月内从1088提升到1648 TFLOPs/GPU。
- 为什么值得深读:算力竞争正在从"谁的芯片更强"转向"谁能把现有硬件的能效榨得更干净",这直接决定超大规模云厂商的推理成本曲线。
- 后续看点:Rubin平台规模化部署后,这套软件优化方法能否复制到新一代芯片,效率提升是否会同步收窄。
来源:华尔街见闻全球
阿里平头哥开源AI软件栈T-Head SAIL,对标英伟达CUDA
阿里平头哥在WAIC 2026现场宣布开源自研AI软件栈T-Head SAIL,覆盖从OS层、SDK层到接口层的完整链路,源码、驱动、工具链和文档一次性公开。这套软件栈是真武系列AI芯片的底层支撑,此前已在阿里云及行业客户的生产环境中跑过双11级流量高峰的考验:截至今年4月,真武AI芯片累计出货56万片,服务20多个行业400多家客户。平头哥的逻辑很直接——芯片好用与否,很大程度取决于软件栈是否透明、是否好调试;过去芯片厂商交付的多是编译好的黑盒工具链,出问题只能提工单等厂商响应,一个模型迁移项目常常要花数周甚至一两个月。开源SAIL相当于主动拆掉这道门槛。
- 关键事实:T-Head SAIL开源覆盖OS层到接口层全链路;真武AI芯片累计出货56万片,服务超400家客户。
- 为什么值得深读:国产AI芯片长期被卡在"硬件能造、软件生态跟不上"的环节,SAIL开源是少数几个正面对标CUDA生态壁垒的尝试。
- 后续看点:全球开发者社区下载使用后,SAIL在非阿里云环境下的适配效果和实际性能表现如何。
来源:BAAI 智源
清程极智发布Token「前店后厂」架构,跑DeepSeek推理成本降75%
清程极智在WAIC上发布"Token前店后厂"三层一体化架构,试图解决Agent规模化落地时暴露的三个痛点:API接口响应时间波动大、国产GPU买了却因为开源推理引擎原生适配英伟达生态而用不顺、企业多Agent部署后账单说不清是谁在花钱。其核心是清华大学计算机系高性能研究所团队自研的赤兔推理引擎,没有魔改国外开源引擎,而是从零重写以适配国产算力。清程极智介绍,这套架构能把跑DeepSeek一类模型的推理成本压低75%,同时为多智能体场景提供Token计量、成本分配和负荷隔离能力。
- 关键事实:清程极智自研赤兔推理引擎,未基于vLLM等国外开源引擎二次改造;跑DeepSeek推理成本降低75%。
- 为什么值得深读:国产算力"买得起、用不顺"是当前Agent规模化落地的一个具体工程瓶颈,这套架构提供了一条不依赖英伟达生态适配的技术路线。
- 后续看点:赤兔推理引擎在更多国产芯片型号上的兼容性和实际吞吐表现能否经受住第三方复现。
来源:BAAI 智源
WAIC观察:模型退居幕后,Agent走向台前,智谱两日市值跌42%
今年WAIC呈现出明显变化:DeepSeek、智谱缺席展台,Kimi虽发布K3但展位低调,MiniMax和阶跃星辰的展示重点也从模型转向智能体和终端;阿里、腾讯、百度等大厂则集中把拳头产品对准办公场景(千问办公、WorkBuddy、百度搭子)。与此同时,市场对模型领先优势的信心正变得脆弱:7月16日晚Kimi K3发布(2.8万亿MoE总参数、约320亿激活参数,编程和长上下文指标部分超过GLM-5.2)后,智谱市值在两个交易日内累计下跌42.47%,从7月17日收盘1107港元跌至7月20日收盘890.5港元,报收4146亿港元。文章同时指出,限售股解禁、此前配股价被击穿等因素叠加放大了这轮调整。
- 关键事实:智谱两个交易日市值累计跌42.47%;Kimi K3为2.8万亿参数MoE模型,约320亿参数被激活。
- 为什么值得深读:当模型能力差距缩小到"你追我赶",资本市场对单一模型领先优势的定价窗口正在变短,这也解释了大厂为何集体把展示重心转向能落地的Agent产品。
- 后续看点:智谱GLM下一次迭代能否在编程和Agent能力上重新拉开差距,K3的开源生态扩散速度是否会持续压缩闭源溢价。
来源:钛媒体
联影集团发布"元医院"战略,医疗AI从模型竞争转向体系重构
WAIC 2026期间,联影集团正式发布"元医院战略",联影集团董事长薛敏在专访中介绍,这不是建一座虚拟医院,也不是把多个AI产品打包,而是希望借助AI打通院内院外、线上线下的边界,把医疗服务从疾病治疗延伸到全生命周期健康管理。薛敏表示,联影的底气来自集团在自研芯片、全栈智能化诊疗装备、可穿戴设备、多模态医疗大模型和统一数据平台上的长期布局,这些资源支撑联影与全球一万六千多家医院合作伙伴共建能力。他还提出,硬件装备层的磁共振、CT等设备将从被动响应工具进化为能自主感知、决策和反馈的具身智能诊疗机器人,在医生监督下自主规划扫描及手术方案。
- 关键事实:联影集团与全球超1.6万家医院建立合作;"元医院战略"覆盖自研芯片、诊疗装备、可穿戴设备、多模态医疗大模型和统一数据平台五个层面。
- 为什么值得深读:医疗AI能否真正改变行业,关键在于能否从单点工具走向系统性的诊疗流程重构,联影的表态提供了一个具体的产业级样本。
- 后续看点:具身智能诊疗机器人(磁共振、CT自主规划扫描方案)何时进入临床试用,以及监管对"AI自主规划手术方案"的审批边界如何划定。
来源:智东西
商汤大装置WAIC放榜:日均Token破2.42万亿,全年预增25倍
商汤大装置在WAIC"算创·无限"论坛上公布最新数据:日均Token服务量已达2.42万亿,预计到2026年底攀升至日均10万亿,全年增长25倍。论坛上,商汤大装置与国信数算签署全国一体化算力网试验场合作,与晶科科技、宁德时代浦泉资本等能源企业启动"算电协同"合作,并联合香港科技园等平台发起"AI科创加速计划"。中国工程院院士郑纬民在演讲中指出,驱动智能体的Token消耗可达传统对话应用的百倍至千倍级,且"Token与Token并不等值",单纯堆算力基建不等于高效的Token供给。
- 关键事实:商汤大装置日均Token服务量2.42万亿,预计2026年底达日均10万亿;郑纬民指出单智能体Token消耗可达传统对话应用的百倍至千倍。
- 为什么值得深读:Token消耗量的量级差异,正在把"算力基建规模"和"高效Token供给"区分成两个不同的能力维度,后者才是Agentic时代的真实瓶颈。
- 后续看点:商汤与国信数算的算力网试验场合作能否在年内落地实际调度案例,日均10万亿Token的目标能否如期兑现。
来源:智东西
📰 独立报道
🤖 AGI 前沿
三大运营商WAIC集体讲"Token故事",日均调用量破140万亿
中国移动、中国电信、中国联通在WAIC期间不约而同讲起"Token经营"。截至今年3月,我国日均Token调用量达140万亿,较2024年年初增长超1000倍。三家侧重不同:中国电信提出"Token经营的本质是提供人工智能服务",推出星辰TokenHub平台,让企业开一个账户、接一套API就能跨模型调用AI能力,并在宁夏启动预估规模164.51亿元的"Token工厂"采购项目;中国移动发布统一工业互联网品牌"移动天工",把工业AI模型、行业智能体和数据工具封装为按Token计费的标准化服务;中国联通走"Agent+Token+AI云"全栈路线,自研四维一体Uni-Infer推理框架降低推理成本。
- 关键事实:中国日均Token调用量140万亿,较2024年初增长超1000倍;中国电信"Token工厂"采购项目预估规模164.51亿元。
- 后续看点:三大运营商的Token定价体系是否会趋同,星辰TokenHub一类的跨模型调用平台能否吸引到电信体系外的开发者。
来源:钛媒体
京东启动首个RoboBase项目,为机器人商业化囤订单和数据
京东在广州黄埔启动全球首个RoboBase项目,规划投资约10亿元,建筑面积19万平方米,预计2028年底建成、2030年全面达产,届时园区年产值约17.5亿元。京东同期在WAIC展示具身智能数据计划:发动最多60万人参与数据采集,两年内积累1000万小时人类真实场景视频和100万小时机器人本体数据,并建设具身智能数据交易平台。此前,京东物流已宣布未来五年计划采购300万台机器人、100万台无人车和10万架无人机;2025年5月至8月,京东连续投资智元机器人、帕西尼、千寻智能等六家具身智能公司。
- 关键事实:RoboBase项目投资约10亿元,2030年全面达产后年产值约17.5亿元;京东具身智能数据计划两年内目标积累1000万小时人类场景视频。
- 后续看点:首批开放的EgoLive数据集(论文口径1680小时、65866个任务片段)能否支撑起外部机器人公司训练模型的实际需求。
来源:钛媒体
OpenAI官方提示词指南:精简Prompt能降本超三成
OpenAI针对GPT-5.6发布官方提示词指南,核心建议是精简冗余指令、划分三档行为边界来平衡模型自主权,并用明确的验证与验收标准替代模糊命令。指南指出,精简后的Prompt在评测分数提升的同时,能把Token成本降低超过三成。
- 关键事实:按OpenAI官方指南精简Prompt,评测分数提升且Token成本降幅超30%。
- 后续看点:这套精简策略是否会被其他模型厂商采纳为官方推荐做法,企业级Prompt工程团队的现有实践需要调整多少。
来源:小林coding-公众号
腾讯研究院:Agent落地卡在成本与审核瓶颈
腾讯研究院分析指出,Agent在实际应用中正遭遇成本与审核瓶颈,行业核心问题已从"能不能做"转向"如何构建高效人机协同并降低运行成本"。文章提出三个判断:通用智能体正在接入底层系统、试图取代浏览器成为新入口;多智能体与自进化技术正被用于工作流自动化;智能体的普及正在收缩初级岗位的需求。
- 关键事实:腾讯研究院将Agent落地的核心矛盾归结为成本控制与内容审核两个具体瓶颈,而非模型能力本身。
- 后续看点:企业级Agent的审核机制是否会形成行业标准,成本瓶颈缓解后智能体渗透率能否明显提速。
来源:腾讯研究院-公众号
Synthesia推出AI Roleplay Sessions,把企业培训从视频搬到实时对练
Synthesia发布AI Roleplay Sessions,一款交互式企业培训平台,员工可以和AI数字人练习工作场景对话,系统会给出反馈、打分和分析数据,帮助企业衡量培训效果。这标志着Synthesia的产品重心从此前的AI视频生成,扩展到实时互动培训场景。
- 关键事实:AI Roleplay Sessions提供实时对练、反馈打分和培训效果分析三项核心功能。
- 后续看点:企业客户在实际部署后,AI打分结果与真实培训效果之间的相关性能否得到验证。
来源:TechCrunch
OpenAI将Codex并入ChatGPT桌面端,拆分Work与Codex两种模式
OpenAI已将Codex正式并入ChatGPT桌面端,客户端新增Work与Codex两种切换模式。Work模式面向所有知识工作者:给定一个目标后,系统自行拆解任务、跨工具读取邮件、日历、Google Drive、Slack、GitHub等授权数据,持续执行数十分钟到数小时,直接交付可编辑的文档、表格、幻灯片或托管好的交互式网站。Codex模式专为程序员设计,能加载完整代码仓库、理解项目结构和依赖关系、自主写代码并跑测试生成diff,区别于GitHub Copilot式的逐行补全。
- 关键事实:Work模式可持续自主执行数十分钟至数小时的多步任务,交付成品级文档;Codex模式可加载完整代码仓库并自动生成diff。
- 后续看点:Work模式处理长流程任务时的出错率和人工介入频率,在真实企业工作流中的验证结果还未披露。
来源:人人都是产品经理
用MCP连Linear加一份Rules文件,让AI自动流转40个任务节点
一位开发者在"Vibe Coding AI编程实战"系列中记录了用MCP(Model Context Protocol)连接项目管理工具Linear的实践:Trae从v1.3.0起支持MCP,配置Linear官方MCP连接器后可调用42个工具,包括创建任务、更新状态、关联代码仓库等。作者把一份拆成40个阶段的Plan文档,通过自然语言指令批量同步为Linear上的40个Todo任务,再叠加一份Markdown格式的Rules文件,让AI在完成每个阶段后自动把任务状态从Todo流转到In Progress再到Done,无需人工逐条标记。
- 关键事实:Linear官方MCP连接器提供42个可调用工具;40个项目阶段通过自然语言指令一次性同步为Linear任务,无需手动逐条创建。
- 后续看点:这套MCP+Rules的任务流转方式在多人协作、任务频繁变更的场景下能否保持状态一致性。
来源:人人都是产品经理
🏢 AI 战略与组织变革
腾讯、阿里同期整合旗下办公Agent产品线
腾讯和阿里近期先后传出整合办公智能体产品的消息:腾讯将QClaw业务并入WorkBuddy部门集中管理,阿里将QoderWork等产品整合推出"千问办公"。文章指出,办公Agent的竞争正从单点能力比拼转向工作流与生态打通,企业更看重的是Agent能否稳定接管原有工作流程,而不是某项单点功能是否领先。
- 关键事实:腾讯QClaw并入WorkBuddy部门;阿里将QoderWork等产品整合为"千问办公"。
- 后续看点:整合后的办公Agent产品线在实际企业客户续约率上能否体现出优势,还是仅仅是组织架构调整。
来源:全球风口-公众号
腾讯设计Agent Miora全量上线,脱胎于WorkBuddy团队
腾讯设计Agent平台Miora结束邀请码测试,正式全量开放,产品由WorkBuddy团队打造,界面布局与WorkBuddy高度一致。Miora覆盖品牌设计、影视创意、电商广告、互动游戏、网页应用五个场景模式,每个模式下配有对应的快捷模板(本质是预置Skill)。用户可在Agent底模(Standard/Pro/Max三档,对应不同推理深度和成本)与多模态生成模型(图片、视频、UI、3D等,涵盖NanoBanana、GPT-image、Seedance等主流选项)之间自由切换。
- 关键事实:Miora提供三档Agent推理深度(Standard/Pro/Max)与多类型多模态生成模型的自由组合,覆盖五个设计场景。
- 后续看点:Miora的定价和调用成本是否公开,能否在腾讯内部之外的独立设计团队中形成付费转化。
来源:人人都是产品经理
美图CFO:靠自研模型和本地化产品矩阵守住AI应用护城河
美图CFO颜劲良在英文科技商业播客AI Proem中介绍,美图目前产品分为生活场景(美图秀秀、美颜相机、Wink、Picchi)和生产力场景(美图设计室、开拍、Vmake、RoboNeo)两类,服务对象定位为"prosumer"(有设计需求但没受过专业训练的人群)。截至今年5月,开拍月活跃创作者约300万,累计产出内容超4亿条;Vmake今年一季度ARR约400万美元。颜劲良表示,美图每个新产品都脱胎于老产品观察到的用户行为(如美图设计室脱胎于美图秀秀的海报设计功能),而不是从零规划产品地图,这降低了验证成本。
- 关键事实:美图开拍月活跃创作者约300万,累计内容产出超4亿条;Vmake一季度ARR约400万美元。
- 后续看点:美图是否会把生活场景和生产力场景的产品线整合为统一Agent入口,颜劲良在播客中对此未给出明确时间表。
来源:人人都是产品经理
🔧 硬件算力与智能设备
燧原科技WAIC展出高性能超节点,联合中兴打造零线缆组网方案
燧原科技在WAIC期间展出基于自研加速模组的高性能超节点系列,包括与中兴通讯联合打造的正交架构方案"云燧ESL64-O"(零线缆、高密集成,满足信创要求)、成熟Cable-tray方案"云燧ESL64-C"(支持万卡级以上集群组网),以及基于NPO技术的光互连原型系统,用于突破传统铜互连的距离限制,支持512卡以上超节点部署。燧原成立8年来已迭代四代架构、推出5款云端AI芯片。
- 关键事实:"云燧ESL64-O"超节点采用全国产芯片和网卡方案;NPO光互连原型支持512卡以上超节点弹性扩展。
- 后续看点:这套光互连原型系统何时从展示方案进入规模化商用部署,实际组网成本和良率数据尚未披露。
来源:智东西
智能眼镜市场:Meta无显示品类份额84%,中国厂商押注带显示AR
Counterpoint Research数据显示,2026年第一季度Meta在全球无显示智能眼镜市场份额接近84%,EssilorLuxottica披露其AI眼镜2025财年销量超700万副。但在带显示AR眼镜市场,Rokid、雷鸟、VITURE和XREAL等中国厂商仍占据重要位置;SAG统计的2025年全球AI智能眼镜市场前五名中,除Meta外的四席分别是Rokid、华为、小米和雷鸟创新。文章指出,Meta的优势集中在拍摄、音频和AI助手为核心的无显示产品及以美国为核心的海外市场,其带显示产品尚未在中国大陆发售,且在亚洲用户的脸型适配测试中得分较低。
- 关键事实:Meta无显示智能眼镜全球份额约84%;EssilorLuxottica AI眼镜2025财年销量超700万副。
- 后续看点:中国厂商能否在带显示AR这一Meta尚未建立优势的细分市场,抢在行业"iPhone时刻"到来前建立起产业链壁垒。
来源:钛媒体
DRAM、NAND现货价格暴涨十倍,云厂商今年设备投资将达7550亿美元
文章指出,生成式AI的推理运算量比传统搜索高出1万至100万倍,驱动超大规模云服务商加码投资,四大云服务商2026年设备投资额预计达7550亿美元,AI数据中心对存储资源的消耗推动DRAM与NAND现货价格暴涨十倍。文章分析认为,存储市场的增长周期历史上从未超过5年,且物理供给瓶颈与硅周期规律会限制此轮增长的持续时间,预计2027年出现转折。
- 关键事实:AI推理运算量比传统搜索高1万至100万倍;DRAM与NAND现货价格暴涨十倍,四大云厂商2026年设备投资预计7550亿美元。
- 后续看点:存储产能扩产周期通常需要12-18个月,2027年价格转折的判断是否会因产能释放节奏而提前或推迟。
来源:虎嗅-前沿科技-网站
🎓 学术前沿
ICML2026最佳论文提名:岭回归中首个可证明的Grokking理论
普渡大学徐铭悦的研究获ICML 2026最佳论文荣誉提名。针对带权重衰减的过参数化线性回归模型,该研究首次建立了完整可证明的Grokking理论——即模型过拟合训练数据很久之后才突然出现泛化能力的现象。研究证明训练过程依次经历三个阶段:早期过拟合、过拟合后较差泛化性能持续一段时间、最终泛化误差变小;并首次用训练超参数给出这段"Grokking time"延迟的严格定量界。研究进一步通过实验表明,调节超参数可以增强、削弱甚至消除Grokking现象,且该定量界能定性刻画非线性神经网络中的类似行为。
- 关键事实:研究首次证明过拟合—延迟—泛化的三阶段演化,并给出"Grokking time"的严格定量界;论文获ICML 2026最佳论文荣誉提名。
- 后续看点:该理论框架能否扩展到非线性、大规模神经网络场景下的严格证明,而不只是实验层面的定性验证。
来源:BAAI 智源