## 发生了什么
发生了什么
OpenAI 在 2026 年 8 月 25 日公布首款自研推理芯片 Jalapeño 的首批测试结果。在 InferenceX 基准上,Jalapeño 跑了 GPT-OSS 120B、DeepSeek R1、Kimi K2.5 1T 三个模型:峰值吞吐下每瓦 AI 工作量比对比系统高 1.5–1.9 倍,端到端延迟低 1.7–3.6 倍;高交互负载下领先幅度扩大到 2.1–4.1 倍。芯片额定功耗 700 瓦,测试负载中实际维持在 550 瓦以下。 Jalapeño 是 OpenAI 与博通合作、约 16 个月做出的推理专用 ASIC,第一次把 OpenAI 主张的“模型—服务软件—芯片—内存—网络”全栈协同落到一颗可实测芯片上,并证明能同时拿到高吞吐和低延迟。
从成本焦虑到一颗可测芯片
2023–2024 年,OpenAI 的收入高度依赖推理,推理账单与用户增速绑死,外部芯片的定价、供应和功耗决定毛利结构。这一阶段的核心诉求不是造一颗比英伟达更快的芯片,而是给自己的推理负载找到不被单一供应商定价的成本曲线。 2024–2025 年,OpenAI 组建硬件团队,芯片负责人 Richard Ho 领衔,设计交给博通,2025 年官宣合作。实质是 OpenAI 定义工作负载和架构需求,博通负责把需求变成硅。 2025–2026 年,Jalapeño 从立项到出结果约 16 个月。2026 年 6 月 OpenAI 与博通强调“创纪录的开发速度”;OpenAI 博客也点明,研发过程借用了自己的模型来加速。 2026 年 8 月 25 日,首批实测给出可核验量:每瓦吞吐 1.5–1.9 倍、端到端延迟降低 1.7–3.6 倍。 后续计划是 2026 年内开始部署;第二代芯片已进入较成熟阶段,预计“未来几个月”流片;第三代已启动概念设计。
在竞争版图中的位置
这次测试的对比系统里排名最高的是英伟达 GB300。Jalapeño 在单位功耗 AI 工作量和响应速度两项指标上领先,但测试没有纳入英伟达刚出货的 Vera Rubin;Jalapeño 是推理专用芯片,训练环节仍高度依赖英伟达。芯片负责人 Richard Ho 表示,OpenAI 算力需求太大,短期内仍与多家供应商合作,英伟达仍是重要合作伙伴。 谷歌 TPU 走得最久,但谷歌同时是芯片方和云厂商;亚马逊有 Trainium/Inferentia,微软有 Maia,Meta 有 MTIA,这些芯片属于云或平台层。Jalapeño 属于一家前沿模型实验室自己的推理负载。同一赛道上的对手是 Anthropic:近三天内业界报道其组建自研芯片团队、谷歌 TPU 创始人 Amir Salek 加盟。Anthropic 还在招人搭团队,OpenAI 已经拿出可测的硅。 Jalapeño 能处理 GPT-OSS 120B、DeepSeek R1、Kimi K2.5 1T 量级模型,补上大模型、高吞吐、低延迟的空档;Cerebras 晶圆级芯片更适合较小模型。推理芯片市场正在分层:通用 GPU、定制 ASIC、晶圆级/存算等异架构各自吃不同负载段。 三块试金石里有两块是中国开放权重模型 DeepSeek R1 和 Kimi K2.5 1T,说明开放权重模型已成为全球芯片评测的公共基准,也说明 OpenAI 把服务第三方模型家族纳入兼容性目标。同日 Harvey 发布基于 Kimi K3 的法律模型。 集邦咨询数据显示,2026 年全球九大云厂商资本开支合计将突破 8867 亿美元,同比增幅接近 90%,几乎全部投向 AI 基础设施。Dylan Patel 判断,OpenAI 和 Anthropic 能拿到最多可用算力,是因为能把算力更快货币化;Jalapeño 把货币化能力从软件层下沉到硅层。
能得出的判断
这件事的意义不是“OpenAI 打败英伟达”,而是前沿实验室第一次拥有可测量的第一方推理路径。OpenAI 未来在推理定价、负载调度和采购谈判上多了一个内部锚点:不再只能用供应商报价定义推理成本,而是可以用自己的硅能跑出什么成本来定义。 它不会撼动英伟达的训练地位,但会改变推理市场的议价结构。训练、CUDA 生态和高阶互联仍是英伟达的护城河;但当 OpenAI、Anthropic、谷歌、亚马逊、微软都有一块自己的推理硅,英伟达在推理侧的“最大客户”会逐步变成“最强竞争对手”。 行业结构正在三极分化:英伟达的通用 GPU、博通/Marvell 承接的定制 ASIC、Cerebras/Groq 等异架构。到 2027 年,第一方推理芯片很可能从前沿实验室的实验项目变成 P&L 里的标准科目,Jalapeño 是第一份被公开测量的样本。
边界与未知
这次对比由 OpenAI 自己主持,未纳入 Vera Rubin;700 瓦额定、550 瓦实测的功耗口径需要看部署后的真实工况;高交互负载下 2.1–4.1 倍的收益取决于 OpenAI 自己的服务软件怎么调度。真正的验收节点是 2026 年内规模化部署后的实际价格、可用性和工作负载混合,以及二代芯片“未来几个月”流片能否兑现。
对中国供应链的含义
OpenAI 拿 DeepSeek R1 和 Kimi K2.5 1T 当评测基准,本身是对开放权重模型能力的背书;同一天 DeepSeek 上线实验性视觉模型、Harvey 发布基于 Kimi K3 的法律模型,强化同一条线:模型层开源化与芯片层自研化并行推进,谁在服务软件、调度、缓存、定价这些中间层做得更实,谁就能把两端能力兑现成成本优势。Jalapeño 的每瓦吞吐数字,最终会通过 API 价格传导到每个开发者的账单上。
信息来源
- OpenAI 官方博客:First measured results from Jalapeño,https://openai.com/index/jalapeno-first-results
- Bloomberg Technology(YouTube):OpenAI Says New Jalapeno Chips Outperformed Nvidia in Testing,https://www.youtube.com/watch?v=i-upHhS-Eis
- 华尔街见闻全球:速度更快、功耗更低,OpenAI JALAPENO 芯片强势叫板英伟达 GB300,https://wallstreetcn.com/articles/3780270
- SemiAnalysis(via Techmeme):A detailed look at Jalapeño, OpenAI's ASIC developed with Broadcom in 16 months,https://www.techmeme.com/260825/p31#a260825p31
- X · kimmonismus:OpenAI's first custom inference chip results,https://x.com/kimmonismus/status/2092261453449327052
- Lingowhale 专题:OpenAI 自研推理芯片亮相,https://lingowhale.com/reader/multi/6a8e0cd167d9ea0f26c15355/web/6a8dcab1375f669f6c2e0fb3?return=%2Ftopics%3Fid%3D6a8e0cd1b0b8e94b7fdad3d0%26mode%3Dpreview
- Dwarkesh Patel 访谈(Dylan Patel):Two labs will soon control most of the world's workforce,https://www.youtube.com/watch?v=aV26V1UvkJw
- 虎嗅:Kimi 涨价、OpenAI 降价:中国“土 AI”冲击美国“山大王”,https://www.huxiu.com/article/4885743.html?type=text