一图版 🏠 返回首页
前沿科技洞见 · 2026-10-02

Amazon 开源 2B 决策模型:115 毫秒让 Agent 多了一层本地闸门,但还接不住最终审批

阅读时间 5 分钟 · 2,932 字 · 基于 7 个来源
背景
10 月 2 日,Amazon 的 Strands Labs 开源了 Strands Decider 2B。它开放模型权重、训练数据和脚本,采用 Apache 2.0 许可,并可在普通本地设备上运行。
今日事件
Amazon 此次发布指向一个更大的变化:Agent 在生成模型与可执行代码之间,多出了一层快速、结构化的决策模型。核心判断是,决策模型会接走路由、工具选择和动作检查等高频环节,但短期内只能充当可回退的闸门,不能接管复杂推理和最终审批。
核心判断
金融机构此前常用同一个大模型完成理解、规划、判断和输出。新架构可以把部分判断留在本地,用明确选项、概率和升级阈值控制延迟、数据边界与调用成本。不过,Strands 公布的失败数据也表明,输出格式永远合法,并不代表答案可靠。

10 月 2 日,Amazon 的 Strands Labs 开源了 Strands Decider 2B。它开放模型权重、训练数据和脚本,采用 Apache 2.0 许可,并可在普通本地设备上运行。

Amazon 此次发布指向一个更大的变化:Agent 在生成模型与可执行代码之间,多出了一层快速、结构化的决策模型。核心判断是,决策模型会接走路由、工具选择和动作检查等高频环节,但短期内只能充当可回退的闸门,不能接管复杂推理和最终审批。换句话说,强模型继续负责想办法,小模型负责在预设选项里踩刹车;规则系统和人工仍要握住授权权力。

金融机构此前常用同一个大模型完成理解、规划、判断和输出。新架构可以把部分判断留在本地,用明确选项、概率和升级阈值控制延迟、数据边界与调用成本。不过,Strands 公布的失败数据也表明,输出格式永远合法,并不代表答案可靠。

17 天内三家公司押注同一接口,Agent 的决策层被单独拆出

TypeSafe AI、OpenAI 和 Amazon 先后改变了 Agent 的决策接口。

9 月 15 日,TypeSafe AI 发布 Jev,把输入定义为状态与若干类型化问题,只返回选项、评分或真假概率。9 月 29 日,OpenAI 在 DevDay 披露 Decisions API,用 Luna 在预设答案中完成分类、路由和动作选择。10 月 2 日,Amazon 又把同类模型连同训练配方开源。短短 17 天内,闭源创业公司、模型平台和云厂商都把“选择”做成独立能力,这比单个榜单名次更能说明需求已经形成。

Strands 的早期技术选择同时创造了优势与上限。团队以 Qwen3.5-2B-Base 为主体,移除逐词生成文本的语言模型头,换成约 100 万参数的 pointer head(选项指针层)。它比较每个候选项与答案位置的隐藏状态,一次前向计算就给出分布;主体只用 rank-16 LoRA 适配。模型因此不会生成候选集之外的字符串,也省去了逐 Token 解码和事后解析。

Strands Decider 填补了两类旧方案之间的空位。传统分类器延迟低,却通常要围绕固定标签采集数据和重新训练;通用大模型能临时理解新选项,却会为一段最终被代码压成“允许或拒绝”的文本付出生成成本。决策模型保留自然语言定义任务的灵活性,同时把输出域提前封闭。它的历史根源也构成约束:模型只能在开发者给出的答案里选,遗漏的选项不会自己出现,复杂问题也不会靠多步推理补回来。

115 毫秒买到的是可部署性,没买到大模型的推理上限

Strands 首先解决了部署问题。

参考版本 v19 实际有 19 亿参数,在 RTX 3090 上的中位延迟为 115 毫秒,P95 为 299 毫秒。M3 Pro 处理少于 300 Token 的短任务时,热启动中位延迟为 153 毫秒。本地运行让输入不必离开机构网络,也避免每个路由判断都调用托管大模型。

方案部署与接口已公开的强项仍未闭合的证据
Strands Decider 2B开放权重,本地运行;选择、真假概率、量表评分JevBench(用于评测决策类小模型准确率与输出格式合规度的基准测试集)公开集 167/231,格式有效率 100%;普通 GPU 达到百毫秒级公开集困难档仅 50.5%;生产流量尚无独立结果
Jev 1.13托管 API;三种类型化问题独立研究在 37 个数据集、346,009 次请求上验证了低成本与较好校准二元任务的固定 0.5 阈值表现不稳,部署前仍要按任务调阈值
OpenAI Decisions APILuna 托管服务;预设答案与既有 OpenAI Agent 栈集成,适合分类、路由与动作选择仍在有限预览,尚无公开权重、延迟和同口径评测

Strands 在其锁定的 JevBench v1.4.2 榜单上总准确率为 72.3%,在 2B 档位列第三。同一份记录中,GPT-6 Luna 达到 99.6%。两者并非同成本、同部署方式,但差距足以划清边界:小模型用显著更低的延迟换取有限判断力,适合筛掉容易样本;它没有证明可以替代强模型处理难例。

Jev 的独立评测补上了另一部分证据。研究者把 Jev、Qwen3.8-27B 和 Gemma-4-E4B 放到相同请求上,Jev 在 37 个数据集中领先 Qwen 27 个,并领先 Gemma 全部 37 个。可是三者在低资源语言、细粒度标签和按量表评价时都会退化。它的实际价值在于利用置信度分流:低风险样本自动放行,不确定样本送回强模型或人工队列。

Agent 可以增加软判断,交易权限仍应留在硬规则里

Amazon 给出的工具调用示例揭示了实际位置。

Agent 准备调用天气工具前,Strands Decider 会检查参数是否来自用户原话,以及当前是否应该先追问。Strands 的 intervention handler(动作拦截器)再把结果映射为放行、拒绝、人工确认或返回 Agent 重做。模型没有直接执行工具,它只向现有控制点提供一个概率判断。

金融机构可以把本地决策模型放在工具执行之前。模型处理查询分流、候选工具筛选、参数依据检查和低风险内容分类,再把高不确定度样本交给大模型。每次决策都返回固定结构和概率,日志也更容易进入审计链。高频步骤少调用一次生成模型,节省的还包括网络往返、输出 Token 和解析失败后的重试。

金融机构不能把权限边界一并下放。账户权限、交易限额、数据访问和监管禁令仍应由确定性代码或策略引擎执行,因为这些规则要求可证明的一致性。Amazon 自己也注明,同一个拦截器可以接入 Cedar(Amazon 开源的策略即代码授权引擎)策略或其他 Agent,而且示例中的问题、阈值和策略均由开发者手工选择。决策模型适合回答“这次调用看起来是否有依据”,却不应单独决定“这笔交易是否获准”。

采购团队也要改变模型比较的单位。机构不能只比较主模型单价,还要比较完整工作流中有多少请求被本地闸门可靠截住、多少请求升级,以及误放行造成的损失。只有当升级率和错误成本一并计入,115 毫秒才可能转化为真实的容量与成本优势。

观察点:私有流量校准能否跨过误放行这一关

Strands 公布的最强反证来自模型自己的限制说明。

在状态和选项不变时,v19 面对改写后的问题约有 94% 仍给出原答案,带否定词的问题尤其容易被忽略。它在 JevBench 困难档只有 50.5%,对未见过的评分量表为 49.9%,对真正新颖的真假任务为 61.4%。这些结果说明,一次并行判断带来的速度,也拿走了仔细读题和多步推理的空间。

Strands 返回的置信度也不能直接当作生产概率。它只在短文本分类上建立了较稳定的置信区间;转到长文档和答案充分性判断后,模型会低估自身正确率 0.19 至 0.35。公开基准只有 231 题,同一配方六次重训的波动约为 3.2 题,因此不到 10 题的单次差异都不足以下排名结论。类型安全解决了“输出能否被代码读取”,没有解决“判断是否符合机构政策”。

三组失败数据没有推翻本地闸门的价值,但把验证条件压得很清楚。未来 90 天应看三项结果。第一,机构私有流量上的置信度与实际正确率能否对齐。第二,计入升级和重试后,大模型调用量是否仍显著下降。第三,政策措辞、语言和文档长度变化后,误放行率是否保持在预设上限内。三项同时成立,决策模型才会成为 Agent 控制面的常驻组件。任何一项失守,它仍只是一个便宜、灵活,却需要被严格看管的分类器。

信息来源(7)
图文卡片 ⬇️ 一键下载图文卡片