模型#运行时

亚马逊开源 Strands Decider 2B:智能体「决策模型」开始扎堆

AWS Strands Labs 开源 Decider 2B:Qwen3.5-2B 底座的决策模型,免费本地运行,三周内第三家。

经济学家威廉姆·杰文斯的黑白肖像

AWS Strands Labs 10 月 1 日开源 Strands Decider 2B:一个跑在 Qwen3.5-2B 底座上的「决策模型」——供智能体工作流做廉价、确定性的判断,免费、可本地运行;作者是亚马逊杰出工程师 Marc Brooker。这是三周内第三家入场此类模型。

事实部分

  • 产品定位:决策模型(decider)——不写长文不做推理表演,只输出「允许/拦截/转交」这类结构化判断,专门给智能体循环里高频出现的小决策用。
  • 时间线:TypeSafe 的 Jev 9 月 18 日率先发布(名字致敬经济学家杰文斯);OpenAI 9 月 30 日发布同类能力;亚马逊 10 月 1 日开源。
  • 成本逻辑:TechCrunch 引用的对比是每受监控动作 Jev 约 2.94 美元对前沿模型 372 美元——决策外溢到专用小模型后单位成本差两个数量级。
  • 冷水:TypeSafe CEO Diogo Almeida 称这批模型「更像 ML 工程师想实现一个酷架构,而不是真想让智能体更有用」。
  • 开源细节:Decider 2B 免费、本地跑,具体许可证与基准见 strandsagents.com 与 Brooker 的博客。

智能体栈的分层

智能体栈正在长出第三层:前沿模型负责规划与写作,决策模型负责流程判断,沙箱与编排层负责边界——Google AX 管调度、OpenClaw Enterprise 管治理、决策模型管省钱。

编辑判断

杰文斯悖论是这波命名的题眼:判断越便宜,智能体越敢在每一步都做判断,总消耗反而上升。对做智能体的团队,决策模型值得接入但别迷信——Almeida 的质疑(没有过硬基准)目前成立,先在自己的工作流上测误判率再替换掉现行规则引擎。

决策模型实际替代什么

每个生产环境的智能体都已经在跑一个决策层——只是它由正则、阈值和一句「用 JSON 回复」的 LLM 调用拼成。决策模型把这层正式化成训练出来的模型:比前沿调用快,比规则灵活,而且(按 Strands 的框架)便宜到可以插进每次工具调用之间。悬而未决的是错误预算:规则引擎失败得很显眼,2B 模型失败得很自信,而智能体循环会放大自信的错误。

在 Strands 线中的位置

Strands Agents 是 AWS 的智能体 SDK;自家决策模型补齐了这套栈——TypeSafe 和 OpenAI 也是同一个逻辑:谁掌握你的 harness,谁就想掌握你的判断层。Brooker 的博文(9 月 28 日)把它框成基础设施工作,符合他分布式系统的背景;底座选 Qwen 而非自研模型,说明亚马逊要的是成本与开放,不是前沿能力。

基准真空

没有一家发布决策模型的厂商给出过针对真实客户工作流的严格误判率数据——这就是 Almeida 批评的全文。在有人给出之前,采用就是带着回滚方案的信念。可测量的验证方式:把智能体上一周的日志拿出来,在每个决策点用 decider 重放,对照实际执行统计分歧,再给分歧定价。这个测试一个下午就能做完,比任何发布博文都有说服力。

与开源策略的呼应

亚马逊选择开源(而非 API 化)决策模型值得注意:决策层是智能体栈里最不需要护城河的一层——它的价值随生态标准化而放大。对比 pi 框架把决策接口做成可插拔,两边都在赌同一件事:决策层会成为公共件,护城河留在别处。

开源选择还埋着一场比赛:如果 Decider 2B 的权重成为热门开源框架的默认决策件,AWS 不卖一个 token 也能收获生态引力——与 Linux 发行版成为战略资产是同一个剧本。盯哪家框架先集成、按谁的条件集成。