谷歌 CEO 亲口承认 Gemini 编程落后:从 AlphaCode 惊艳到 3.5 Pro 难产,一条走了四年的路线之争
2026/06/22
谷歌 CEO 皮查伊公开承认"在 Agentic Coding 方面确实落后于 OpenAI 和 Anthropic",Gemini 3.5 Pro 被曝定价更高、内容过滤更严、核心"懒惰"顽疾未解。这不是一次孤立的翻车——把它放在谷歌 AI 编程四年演进的时间轴上,再与 OpenAI 和 Anthropic 的同期策略并排看,才能看清问题到底出在哪里。
纵向:四年迭代,四次没追上
谷歌的 AI 编程之路起步并不晚,但每一次关键跳跃都差了一口气。
2022 年,AlphaCode。 谷歌在 Codeforces 竞赛中做到了 85% 人类选手的水平,这在当时是惊艳的。但 AlphaCode 是为竞赛设计的系统,不是给开发者用的工具。它证明了谷歌能做出聪明的编程 AI,但没证明谷歌能让它进入工程流程。
2023 年 12 月,Gemini 1.0。 谷歌宣称 Gemini Ultra 在 HumanEval 上表现优异,还用它驱动了 AlphaCode 2。但此时 OpenAI 的 GPT-4 已经通过 ChatGPT 和 GitHub Copilot 覆盖了数千万开发者。谷歌有模型,没有用户。
2024-2025 年,追逐战。 Gemini 1.5 Pro 带来百万 token 上下文窗口,Gemini Code Assist 免费开放,Gemini 2.5 Pro 引入"思考模式",Gemini CLI 推出"Vibe Coding"。每一步都在追,但"懒惰"问题始终没解决——模型面对长文本和高复杂度任务时输出无意义回应,甚至直接什么都不做。更致命的是,内部自研编程工具 Jetski 未经用户同意就自动重写代码,员工用大量反 AI 表情包嘲讽它制造"垃圾代码"。
2026 年 6 月,裂痕。 Gemini 3.5 Pro 难产,皮查伊公开认输。同一周,Transformer 共同作者 Noam Shazeer 离开谷歌加入 OpenAI,诺贝尔奖得主 John Jumper 转投 Anthropic——48 小时内连失两员大将。Gemini 联合负责人也确认加入 OpenAI。
纵轴的全貌:从 AlphaCode 的惊艳亮相,到每一次迭代的"还差一点",再到人才流失和 CEO 认输。谷歌不缺技术,缺的是把技术转化为开发者信任的能力。
横向:三家公司,三条岔路
同一时间截面上,谷歌、OpenAI、Anthropic 的差距不在模型能力,在战略选择。
模型策略:开放 vs 封闭。 OpenAI Codex 刚刚开放了模型接入层,允许开发者通过 --oss 参数连接本地 Ollama 和 LM Studio 服务。Anthropic Claude Code 通过 Skills、Hooks、Sub-agents 构建了完整的工程生态。谷歌的 Gemini 3.5 Pro 却在定价更高、内容过滤更严——在开发者最需要灵活性的时刻反向操作。
工程范式:从提示词到循环。 Claude Code 创始人 Boris Cherny 公开表示"我已经不再直接提示 Claude,我的工作是写 loops"。Loop Engineering 的核心是把开发者从提示者变成系统设计者——模型只是循环中的一个组件,稳定性比聪明程度更重要。OpenAI Codex 跟进推出了"看一遍就会"的演示学习功能。而谷歌 Jetski 还在和自动改写代码的 bug 做斗争。
人才流向:48 小时失两员大将。 Transformer 架构的设计者去了 OpenAI,AlphaFold 的缔造者去了 Anthropic。当一家公司最聪明的人选择去竞争对手那里做同样的事,问题不在薪酬,在组织。
成本逻辑:涨价 vs 降本。 微软 Copilot Cowork 取消"无限用"套餐改为按量计费,甚至考虑引入 DeepSeek V4 开源模型降本。谷歌却在提高 Gemini 3.5 Pro 定价。在 AI 编程工具从"奢侈品"变成"基础设施"的拐点,逆势涨价是危险的信号。
交叉:谷歌真正的困境不是模型,是信任
纵轴告诉我们谷歌一直在追,横轴告诉我们它追错了方向。
过去四年,谷歌始终在用"模型能力"的逻辑应对"工程化可用性"的竞争。每次落后都被理解为"模型还不够强",于是投入更多算力、更多参数。但开发者的需求已经变了——他们不需要更强的模型,他们需要更稳定的模型。一个能稳定执行循环任务的 7B 模型,比一个偶尔惊艳但经常"摆烂"的 GPT-4.5 级模型更有工程价值。
当你的员工用表情包嘲讽你自研的编程工具,当你的核心人才连续出走,当你的 CEO 不得不公开认输——问题已经不是下一版模型能不能在 HumanEval 上多拿几分了。这是信任赤字:开发者不相信谷歌能把 AI 编程做"好用"。
对于金融科技行业,这意味着两条清晰的判断:第一,依赖单一闭源模型的风险已经从理论变成现实——如果连谷歌都无法保证旗舰模型的稳定性,多模型路由和开源备份就不再是备选方案,而是必选项。第二,AI 编程工具选型上,稳定性优先于基准分数——一个能稳定生成合规代码、可审计可追溯的助手,比一个偶尔写出惊艳代码但经常怠工的助手更有价值,哪怕后者在评测榜上多拿几分。