FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-07-22

WAIC 2026收官,AI基础设施的比拼从模型参数转向Token成本——英伟达三个月内把GB200跑DeepSeek的推理能效提到4倍,清程极智把同类推理成本压低75%,阿里平头哥把服务过400多家客户的AI软件栈开源出去对标CUDA

降低FOMO的每日信息交付

2026-07-22 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

英伟达三个月内把GB200跑DeepSeek的推理能效提升4倍

英伟达披露,通过38项软件栈优化,GB200 NVL72运行DeepSeek R1 0528模型(1K输入/1K输出配置)时的每兆瓦算力吞吐量(TPS/MW)在三个月内提升了4倍。这些优化经过超25万次模拟配置筛选、累计140万GPU小时验证,其中九成以上可跨模型复用,意味着现有数据中心客户不换硬件也能拿到这部分收益。同期,GB300在256卡规模下预训练DeepSeek-V3 671B达到每GPU 1648 TFLOPs,较GB200提升约3倍,其中在PyTorch原生训练栈TorchTitan上的提升幅度达到6倍。这组数字说明,英伟达在Rubin平台铺开之前,正靠软件层持续挖掘Blackwell的剩余算力,而不是单纯等待下一代芯片。

来源:华尔街见闻全球

阿里平头哥开源AI软件栈T-Head SAIL,对标英伟达CUDA

阿里平头哥在WAIC 2026现场宣布开源自研AI软件栈T-Head SAIL,覆盖从OS层、SDK层到接口层的完整链路,源码、驱动、工具链和文档一次性公开。这套软件栈是真武系列AI芯片的底层支撑,此前已在阿里云及行业客户的生产环境中跑过双11级流量高峰的考验:截至今年4月,真武AI芯片累计出货56万片,服务20多个行业400多家客户。平头哥的逻辑很直接——芯片好用与否,很大程度取决于软件栈是否透明、是否好调试;过去芯片厂商交付的多是编译好的黑盒工具链,出问题只能提工单等厂商响应,一个模型迁移项目常常要花数周甚至一两个月。开源SAIL相当于主动拆掉这道门槛。

来源:BAAI 智源

清程极智发布Token「前店后厂」架构,跑DeepSeek推理成本降75%

清程极智在WAIC上发布"Token前店后厂"三层一体化架构,试图解决Agent规模化落地时暴露的三个痛点:API接口响应时间波动大、国产GPU买了却因为开源推理引擎原生适配英伟达生态而用不顺、企业多Agent部署后账单说不清是谁在花钱。其核心是清华大学计算机系高性能研究所团队自研的赤兔推理引擎,没有魔改国外开源引擎,而是从零重写以适配国产算力。清程极智介绍,这套架构能把跑DeepSeek一类模型的推理成本压低75%,同时为多智能体场景提供Token计量、成本分配和负荷隔离能力。

来源:BAAI 智源

WAIC观察:模型退居幕后,Agent走向台前,智谱两日市值跌42%

今年WAIC呈现出明显变化:DeepSeek、智谱缺席展台,Kimi虽发布K3但展位低调,MiniMax和阶跃星辰的展示重点也从模型转向智能体和终端;阿里、腾讯、百度等大厂则集中把拳头产品对准办公场景(千问办公、WorkBuddy、百度搭子)。与此同时,市场对模型领先优势的信心正变得脆弱:7月16日晚Kimi K3发布(2.8万亿MoE总参数、约320亿激活参数,编程和长上下文指标部分超过GLM-5.2)后,智谱市值在两个交易日内累计下跌42.47%,从7月17日收盘1107港元跌至7月20日收盘890.5港元,报收4146亿港元。文章同时指出,限售股解禁、此前配股价被击穿等因素叠加放大了这轮调整。

来源:钛媒体

联影集团发布"元医院"战略,医疗AI从模型竞争转向体系重构

WAIC 2026期间,联影集团正式发布"元医院战略",联影集团董事长薛敏在专访中介绍,这不是建一座虚拟医院,也不是把多个AI产品打包,而是希望借助AI打通院内院外、线上线下的边界,把医疗服务从疾病治疗延伸到全生命周期健康管理。薛敏表示,联影的底气来自集团在自研芯片、全栈智能化诊疗装备、可穿戴设备、多模态医疗大模型和统一数据平台上的长期布局,这些资源支撑联影与全球一万六千多家医院合作伙伴共建能力。他还提出,硬件装备层的磁共振、CT等设备将从被动响应工具进化为能自主感知、决策和反馈的具身智能诊疗机器人,在医生监督下自主规划扫描及手术方案。

来源:智东西

商汤大装置WAIC放榜:日均Token破2.42万亿,全年预增25倍

商汤大装置在WAIC"算创·无限"论坛上公布最新数据:日均Token服务量已达2.42万亿,预计到2026年底攀升至日均10万亿,全年增长25倍。论坛上,商汤大装置与国信数算签署全国一体化算力网试验场合作,与晶科科技、宁德时代浦泉资本等能源企业启动"算电协同"合作,并联合香港科技园等平台发起"AI科创加速计划"。中国工程院院士郑纬民在演讲中指出,驱动智能体的Token消耗可达传统对话应用的百倍至千倍级,且"Token与Token并不等值",单纯堆算力基建不等于高效的Token供给。

来源:智东西


📰 独立报道

🤖 AGI 前沿

三大运营商WAIC集体讲"Token故事",日均调用量破140万亿

中国移动、中国电信、中国联通在WAIC期间不约而同讲起"Token经营"。截至今年3月,我国日均Token调用量达140万亿,较2024年年初增长超1000倍。三家侧重不同:中国电信提出"Token经营的本质是提供人工智能服务",推出星辰TokenHub平台,让企业开一个账户、接一套API就能跨模型调用AI能力,并在宁夏启动预估规模164.51亿元的"Token工厂"采购项目;中国移动发布统一工业互联网品牌"移动天工",把工业AI模型、行业智能体和数据工具封装为按Token计费的标准化服务;中国联通走"Agent+Token+AI云"全栈路线,自研四维一体Uni-Infer推理框架降低推理成本。

来源:钛媒体

京东启动首个RoboBase项目,为机器人商业化囤订单和数据

京东在广州黄埔启动全球首个RoboBase项目,规划投资约10亿元,建筑面积19万平方米,预计2028年底建成、2030年全面达产,届时园区年产值约17.5亿元。京东同期在WAIC展示具身智能数据计划:发动最多60万人参与数据采集,两年内积累1000万小时人类真实场景视频和100万小时机器人本体数据,并建设具身智能数据交易平台。此前,京东物流已宣布未来五年计划采购300万台机器人、100万台无人车和10万架无人机;2025年5月至8月,京东连续投资智元机器人、帕西尼、千寻智能等六家具身智能公司。

来源:钛媒体

OpenAI官方提示词指南:精简Prompt能降本超三成

OpenAI针对GPT-5.6发布官方提示词指南,核心建议是精简冗余指令、划分三档行为边界来平衡模型自主权,并用明确的验证与验收标准替代模糊命令。指南指出,精简后的Prompt在评测分数提升的同时,能把Token成本降低超过三成。

来源:小林coding-公众号

腾讯研究院:Agent落地卡在成本与审核瓶颈

腾讯研究院分析指出,Agent在实际应用中正遭遇成本与审核瓶颈,行业核心问题已从"能不能做"转向"如何构建高效人机协同并降低运行成本"。文章提出三个判断:通用智能体正在接入底层系统、试图取代浏览器成为新入口;多智能体与自进化技术正被用于工作流自动化;智能体的普及正在收缩初级岗位的需求。

来源:腾讯研究院-公众号

Synthesia推出AI Roleplay Sessions,把企业培训从视频搬到实时对练

Synthesia发布AI Roleplay Sessions,一款交互式企业培训平台,员工可以和AI数字人练习工作场景对话,系统会给出反馈、打分和分析数据,帮助企业衡量培训效果。这标志着Synthesia的产品重心从此前的AI视频生成,扩展到实时互动培训场景。

来源:TechCrunch

OpenAI将Codex并入ChatGPT桌面端,拆分Work与Codex两种模式

OpenAI已将Codex正式并入ChatGPT桌面端,客户端新增Work与Codex两种切换模式。Work模式面向所有知识工作者:给定一个目标后,系统自行拆解任务、跨工具读取邮件、日历、Google Drive、Slack、GitHub等授权数据,持续执行数十分钟到数小时,直接交付可编辑的文档、表格、幻灯片或托管好的交互式网站。Codex模式专为程序员设计,能加载完整代码仓库、理解项目结构和依赖关系、自主写代码并跑测试生成diff,区别于GitHub Copilot式的逐行补全。

来源:人人都是产品经理

用MCP连Linear加一份Rules文件,让AI自动流转40个任务节点

一位开发者在"Vibe Coding AI编程实战"系列中记录了用MCP(Model Context Protocol)连接项目管理工具Linear的实践:Trae从v1.3.0起支持MCP,配置Linear官方MCP连接器后可调用42个工具,包括创建任务、更新状态、关联代码仓库等。作者把一份拆成40个阶段的Plan文档,通过自然语言指令批量同步为Linear上的40个Todo任务,再叠加一份Markdown格式的Rules文件,让AI在完成每个阶段后自动把任务状态从Todo流转到In Progress再到Done,无需人工逐条标记。

来源:人人都是产品经理

🏢 AI 战略与组织变革

腾讯、阿里同期整合旗下办公Agent产品线

腾讯和阿里近期先后传出整合办公智能体产品的消息:腾讯将QClaw业务并入WorkBuddy部门集中管理,阿里将QoderWork等产品整合推出"千问办公"。文章指出,办公Agent的竞争正从单点能力比拼转向工作流与生态打通,企业更看重的是Agent能否稳定接管原有工作流程,而不是某项单点功能是否领先。

来源:全球风口-公众号

腾讯设计Agent Miora全量上线,脱胎于WorkBuddy团队

腾讯设计Agent平台Miora结束邀请码测试,正式全量开放,产品由WorkBuddy团队打造,界面布局与WorkBuddy高度一致。Miora覆盖品牌设计、影视创意、电商广告、互动游戏、网页应用五个场景模式,每个模式下配有对应的快捷模板(本质是预置Skill)。用户可在Agent底模(Standard/Pro/Max三档,对应不同推理深度和成本)与多模态生成模型(图片、视频、UI、3D等,涵盖NanoBanana、GPT-image、Seedance等主流选项)之间自由切换。

来源:人人都是产品经理

美图CFO:靠自研模型和本地化产品矩阵守住AI应用护城河

美图CFO颜劲良在英文科技商业播客AI Proem中介绍,美图目前产品分为生活场景(美图秀秀、美颜相机、Wink、Picchi)和生产力场景(美图设计室、开拍、Vmake、RoboNeo)两类,服务对象定位为"prosumer"(有设计需求但没受过专业训练的人群)。截至今年5月,开拍月活跃创作者约300万,累计产出内容超4亿条;Vmake今年一季度ARR约400万美元。颜劲良表示,美图每个新产品都脱胎于老产品观察到的用户行为(如美图设计室脱胎于美图秀秀的海报设计功能),而不是从零规划产品地图,这降低了验证成本。

来源:人人都是产品经理

🔧 硬件算力与智能设备

燧原科技WAIC展出高性能超节点,联合中兴打造零线缆组网方案

燧原科技在WAIC期间展出基于自研加速模组的高性能超节点系列,包括与中兴通讯联合打造的正交架构方案"云燧ESL64-O"(零线缆、高密集成,满足信创要求)、成熟Cable-tray方案"云燧ESL64-C"(支持万卡级以上集群组网),以及基于NPO技术的光互连原型系统,用于突破传统铜互连的距离限制,支持512卡以上超节点部署。燧原成立8年来已迭代四代架构、推出5款云端AI芯片。

来源:智东西

智能眼镜市场:Meta无显示品类份额84%,中国厂商押注带显示AR

Counterpoint Research数据显示,2026年第一季度Meta在全球无显示智能眼镜市场份额接近84%,EssilorLuxottica披露其AI眼镜2025财年销量超700万副。但在带显示AR眼镜市场,Rokid、雷鸟、VITURE和XREAL等中国厂商仍占据重要位置;SAG统计的2025年全球AI智能眼镜市场前五名中,除Meta外的四席分别是Rokid、华为、小米和雷鸟创新。文章指出,Meta的优势集中在拍摄、音频和AI助手为核心的无显示产品及以美国为核心的海外市场,其带显示产品尚未在中国大陆发售,且在亚洲用户的脸型适配测试中得分较低。

来源:钛媒体

DRAM、NAND现货价格暴涨十倍,云厂商今年设备投资将达7550亿美元

文章指出,生成式AI的推理运算量比传统搜索高出1万至100万倍,驱动超大规模云服务商加码投资,四大云服务商2026年设备投资额预计达7550亿美元,AI数据中心对存储资源的消耗推动DRAM与NAND现货价格暴涨十倍。文章分析认为,存储市场的增长周期历史上从未超过5年,且物理供给瓶颈与硅周期规律会限制此轮增长的持续时间,预计2027年出现转折。

来源:虎嗅-前沿科技-网站

🎓 学术前沿

ICML2026最佳论文提名:岭回归中首个可证明的Grokking理论

普渡大学徐铭悦的研究获ICML 2026最佳论文荣誉提名。针对带权重衰减的过参数化线性回归模型,该研究首次建立了完整可证明的Grokking理论——即模型过拟合训练数据很久之后才突然出现泛化能力的现象。研究证明训练过程依次经历三个阶段:早期过拟合、过拟合后较差泛化性能持续一段时间、最终泛化误差变小;并首次用训练超参数给出这段"Grokking time"延迟的严格定量界。研究进一步通过实验表明,调节超参数可以增强、削弱甚至消除Grokking现象,且该定量界能定性刻画非线性神经网络中的类似行为。

来源:BAAI 智源