🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-07-24

Bridgewater 的投研智能体 PAT:把验证闭环做成生产系统,而不是一次性问答

正在发生的事很多,这件帮你看过了

Bridgewater 的投研智能体 PAT:把验证闭环做成生产系统,而不是一次性问答

2026/07/24

2026年7月24日,LangChain 发布了 Bridgewater 团队在 LangChain Interrupt 2026 大会上的演讲视频,披露该基金内部的投研智能体 PAT 已经进入数百名投资者的日常工作,能把原本需要数小时的探索性研究压缩到几分钟内完成 [S1]。

演讲同时披露了 PAT 的运行方式:系统按每名投资者的权限加载对应的数据和工具,先生成一份可供检查的研究计划,再并行生成并执行代码,最后由后台验证流程核对计算结果;团队把这条原则概括为“计划本身就是分析” [S1]。当投资者指出错误时,Teach 功能会把这次错误转成一个新的基准测试,反复调整上下文直到通过,并提交对应的修复变更 [S1]。

这场披露真正值得记录的判断,不是“AI 能做投研”,而是 Bridgewater 把一次模型问答拆成了权限、计划、执行、验证、纠错五个可以单独检查和修复的环节。这套设计背后的核心机制——把决策历史留存下来、让不同角色分权把关——在腾讯微信团队2026年6月发表的 SkillHone 论文的消融实验中,得到了独立的数据支持 [S4][S5]。但两套证据都没有触及投资收益、跨任务长期稳定性或第三方复现,PAT 演讲中一处关键数字(时间序列搜索准确率的起点)在官方简介与第三方转录之间也存在分歧,这些边界决定了当前判断只能停在“系统闭环是生产可用性的必要环节之一”,而不能推进到“自主投研已经成立”。

五个可拆分的环节,把错误定位到具体环节而不是笼统甩给模型

PAT 没有把数据和工具直接暴露给一个通用模型去回答问题,而是先按投资者的权限划定它能看到什么、能调用什么工具,再要求系统写出一份计划——这份计划本身要能被投资者检查,然后才并行生成代码去执行,执行完再由独立的后台流程核对计算结果 [S1][S2]。这样拆分的好处是,一旦答案出错,团队能判断问题出在计划阶段的理解偏差、执行阶段的代码错误,还是验证阶段的遗漏,而不是笼统地说“模型不准”。

这套系统能跑起来,前提也不只是模型和工程架构。Bridgewater 官方说明,PAT 的组成包括数十年积累的投资知识、大语言模型、智能体工作流和现代软件架构 [S3];它依赖的是覆盖主要经济体、具有双时态建模的宏观与市场数据库,加上显式的市场推理语料和资深投资者反馈 [S3]。这些是 Bridgewater 独有的专有资产,不是可以从这套架构里剥离出来单独复制的部分。

Teach 与 SkillHone:决策历史比最终答案更值钱

Teach 功能的做法是,把投资者指出的一次错误转成新的基准测试,迭代上下文直到通过,再提交修复变更 [S1]。这意味着团队想把单次纠错固化成系统能力,而不是让同一个错误反复发生;但演讲没有公布这套流程在跨任务场景下是否稳定、是否经得起审计。

腾讯微信团队的 SkillHone 提供了一组独立证据,指向同一个机制:它把每次技能改进的诊断过程、修改内容、评估证据和最终是否接受这次修改,都保存为持久的决策历史,并让负责优化和负责评估的角色相互分离、互不干扰 [S4]。论文的消融实验显示,在同一个 Qwen3.6-35B-A3B 执行与评估骨干下,去掉决策历史会让 GAIA 和 WebWalkerQA-EN 两个基准分别下降13.4和10.9个百分点,去掉角色分离则分别下降6.4和5.3个百分点 [S5]。换句话说,SkillHone 的提升主要来自“留住错误和验证证据”这套机制本身,而不是换了一个更强的模型。

专有数据和评测口径决定了闭环治理是乘数,不是替代品

把 PAT 和 SkillHone 放在一起看,结论不该是“验证闭环已经能替代模型能力”。PAT 的效果绑定着 Bridgewater 的双时态数据和专家反馈 [S3],SkillHone 的18.8个百分点平均提升也有明确的评测前提:它覆盖计数、聚合、结构解析等七类内部工具化任务,六类有改善,但列表过滤(List filtering)一类完全没有提升;这项测评采用的是与人工核验参考答案做精确匹配的口径 [S5],不能直接外推成投研正确率、投资收益或无人值守场景下的安全性。更准确的说法是模型能力和组织化验证相乘才起作用,闭环治理提升的是能不能把模型的产出用起来,而不是把模型能力问题解决掉。

起点数字的分歧与仍然缺失的复现证据

同一场演讲里,时间序列搜索加入类似人工检查的逻辑后,准确率从多少提升到90%,两个来源给出了不同的起点:LangChain 官方发布的视频简介与章节列表写的是“从50%提升到90%” [S1],而第三方演讲转录镜像记录的演讲者口头表述是“大约从15%提升到90%” [S2]。终点90%两处一致,分歧出现在起点——这是官方书面材料和第三方转录之间的差异,不代表50%这个数字缺少来源支撑。

公开材料目前没有给出第三方复现、跨任务的误差分布,也没有可归因于 PAT 的投资收益或审计结果。这套判断只适用于有重复任务、能构造基准、能记录执行轨迹并划分权限的企业分析流程,不适用于证据稀疏、目标不可验证、责任无法委托的最终投资决策,更不能作为无人值守自主投资已经可行的依据。真正能推翻或收紧这一判断的下一步证据,是同口径的第三方复现、跨任务的长期稳定性数据、错误逃逸和人工升级记录,以及能连接到实际业务结果而非内部基准的测量。

参考资料

图文卡片 ⬇️ 一键下载图文卡片