亚马逊入局决策模型:Strands Decider 2B 开源,AI 正在学会"不说话"

2026.10.03 17:20
10月1日,亚马逊通过 Strands Labs 开源 Strands Decider 2B 决策模型,基于Qwen3.5-2B改造,移除文本生成头,换上轻量评分指针。就在两周前,TypeSafe 的 Jev 引爆了决策模型赛道,随后 OpenAI 于9月29日发布 Decisions API。三个顶级玩家在两周内押注同一方向,背后是 AI Agent 从全能模型向分工模型进化的深层逻辑:20亿参数的小模型做判断,万亿参数的大模型做生成。

一个 20 亿参数的模型,不会写任何一句话。它只会在你给它的几个选项里打一个勾,附带一个置信度分数——比如"选 B,95% 确定"。这就是亚马逊在 10 月 1 日通过 Strands Labs 开源的 Strands Decider 2B 决策模型。它不会写诗、不会编程、不会讲笑话,但亚马逊相信,这种"沉默的"小模型,将成为 AI Agent 世界里最重要的守门人。

这件事放在两周前几乎不可想象。9 月 15 日,TypeSafe AI 发布 Jev,自称首个"System One"决策模型。不到 48 小时,社区涌现了 Kev、imajev、Laya 等十几个模仿者。9 月 29 日,OpenAI 在 DevDay 上发布 Decisions API。10 月 1 日,亚马逊正式入场。两周之内,全球最顶尖的 AI 实验室全部涌入一个此前根本不存在的赛道。

一个"沉默"的模型,凭什么被巨头们争相复制

Strands Decider 2B 的技术选择体现了亚马逊一贯的实用主义。它基于阿里巴巴的 Qwen3.5-2B 预训练底座——一个本身就能生成文本的小型语言模型。但亚马逊的工程师做了一件简单而大胆的事:直接删掉了神经网络中负责"预测下一个词"的 LM 头部,换上了一个只有约 104 万参数的轻量评分指针头部。躯干部分通过 rank-16 LoRA 进行微调,整体架构被亚马逊称为"Hobson"。模型的最终版本为 v19,亚马逊公开了全部训练日志和迭代过程。

效果如何?在 JevBench 数据集上,Strands Decider 2B 的准确率达到 72.3%(167/231 任务),预期校准误差(ECE)仅 0.052,在 2B 级模型中排名第三。在 33 个同级别模型中排第三——但排除那些参数刚好超过 2B 门槛的模型后,它在纯 2B 级模型中实际排名第一。

延迟数据同样令人印象深刻。根据亚马逊官方博客的数据,在 RTX 3090 上中位延迟为 115ms(p95 为 299ms),在 M3 MacBook 上小型任务的中位延迟约为 153ms。这意味着一个模型可以在你眨眼的十分之一时间内做出一次判断。更难得的是,这些数字已经包括了单次 HTTP 往返——对于本地部署来说,实际推理延迟还可以更低。

为什么 Agent 需要一个"不说话"的模型

要理解这些巨头同时扑向这个赛道的原因,需要先理解 AI Agent 面临的底层困境。

当前的 AI Agent 在做出一个动作之前,通常的做法是:让一个大型语言模型生成一段文字,再从这段文字中解析出"应该做什么"。问一个数千亿参数的模型"我用哪个工具?",它先给你写 200 字的思考过程,然后你再用正则表达式解析出最后的工具名称。这种模式的效率问题显而易见。更致命的是不可靠性——生成式模型的本质决定了它可能在任何一次输出中产生幻觉。如果一个 Agent 在调用银行转账接口之前产生了幻觉,后果可能是灾难性的。

决策模型的思路完全相反。开发者预先定义有限个选项,模型只在这些选项中选择并给出置信度。它不能自由发挥,不能写新代码,不能搞创意。这种"自我阉割"在绝大多数场景下不是缺点,而是最大的优点。

亚马逊杰出工程师 Marc Brooker 是 Strands Decider 的原作者。据 TechCrunch 报道,Brooker 在看了 Jev 之后,自己动手做了一个实验版本。这个 DIY 项目短暂登顶 JevBench 排名,亚马逊团队将其"清洗"后正式发布。Brooker 对 TechCrunch 的解释抓住了核心:

"这类模型最初吸引我的原因是,它们完美地适合工作流中的决策步骤——'基于当前位置,下一步该做什么?'"

两个阵营,两种赌注

决策模型赛道的竞争格局正在迅速分裂为两种截然不同的商业模式。

API 即服务

TypeSafe 的 Jev 是这一阵营的旗手。它通过 API 提供服务,定价低至每百万输入 token 0.042 美元——10 亿次调用成本不过 42 美元。用户不需要管理任何基础设施,只需调用 API 支付极低的费用。TypeSafe 由前 OpenAI 研究员 Diogo Almeida 创立,在 9 月 15 日宣布了 4000 万美元的种子轮融资。Almeida 对 TechCrunch 表示,他并不担心竞争:

"当前的这批模型更像是 ML 人员想实现一个酷架构,而不是一个真正致力于让智能变得有用的团队。"

开源 + 自托管

亚马逊选择了完全相反的方向。Strands Decider 2B 采用 Apache 2.0 许可证,权重上传至 Hugging Face,训练数据、代码、配方全部公开。开发者可以将模型部署在自己的笔记本电脑上,完全脱离云端。在 VentureBeat 的报道中,亚马逊强调的一个核心卖点是"可复现性"——开发者不仅可以使用模型,还可以检查和修改它的每一个细节。

这种差异反映了两种截然不同的战略逻辑。TypeSafe 卖的是"智能决策即服务",控制权在 TypeSafe 手中,价值捕获也在 TypeSafe 手中。亚马逊卖的是"生态系统"——Strands Decider 是 Strands Agent SDK 的一个组件,是亚马逊更大的 Agent 基础设施战略的一部分。亚马逊不需要从这个模型直接赚钱,只要它能够吸引更多人使用 Strands SDK、运行在 AWS 上,它就赢了。

OpenAI 的 Decisions API 则处于中间地带。它基于 GPT-6 Luna 的专用版本,延迟约 150ms 每次决策,目前处于有限预览阶段。OpenAI 的优势在于规模和品牌信任,劣势在于它在决策模型赛道里并不是先行者,且其 API 模式意味着用户的数据和决策逻辑仍然跑在 OpenAI 的服务器上。

从"会说话"到"会判断":AI 能力的分工进化

决策模型的兴起,本质上是 AI 领域正在发生的更深层次变化的缩影——从"全能模型"向"分工模型"的演进。

过去两年中,行业习惯用同一个模型做所有事情:让 GPT-5 写代码、做决策、写文案、回答问题。但实践证明,这是一种浪费。对于一些最简单的"是/否"判断,调用上千亿参数的模型就像用航空母舰运一枚硬币。

决策模型的出现,本质上是在 Agent 的工作流中插入了一个廉价的、快速的、可靠的检查点。Strands Decider 被设计为直接插入 Strands Agent 的"干预机制"中:当一个 Agent 准备执行某个动作时,Strands Decider 可以在约 115ms 内判断这个动作是否合理,并给出放行、拒绝、请求确认或要求反馈的决策。

亚马逊官方博客展示了一个典型的用例:用户问"天气怎么样?"但没有说城市。Agent 自作主张猜了一个城市并准备调用天气工具。Strands Decider 在工具调用前拦住它,发现"参数值并未基于用户实际提供的事实",于是 Agent 放弃调用,转而向用户追问城市名称——而不是自信地报告一个没人提到的城市的天气。

这种架构将"生成"和"判断"两个能力从同一个模型拆分为两个独立的模块。生成仍然由大模型完成,判断交给决策模型。这是一个关键的解耦:决策模型不需要知道如何写邮件,它只需要知道"在这种情况下,发送这封邮件是否合理"。

校准数据进一步支撑了这种分工的可行性。Strands Decider 在对未见过的短任务测试中,置信度 0.9 以上的判断准确率达到约 95%。这意味着在 20 次决策中,大约只有 1 次需要人工复核——对于大多数 Agent 工作流来说,这是可以接受的自动化率。

局限与风险:为什么说这个赛道还很早期

尽管热情高涨,决策模型赛道距离成熟还有相当距离。VentureBeat 的分析指出,Strands Decider 的最大差异化优势并不是基准测试得分——实际上在 JevBench 上有多款模型得分更高——而是"开源、可自托管、可复现"。

从技术角度看,决策模型存在几个已知的短板。

第一个短板是长文档和多步骤推理场景表现不佳。JevBench 的分层数据显示,Strands Decider 在"困难"级别任务上准确率仅为 50.5%,而"简单"级别为 100%。当需要理解复杂的上下文或进行多步推理时,这种模型仍然力不从心。

第二个短板是校准精度的挑战。ECE 0.052 已经是同级别模型中的领先水平,但对于金融交易审查、医疗诊断决策等高风险场景,这个精度仍然不够。一个错误判断的成本可能远大于调用 SaaS API 的延迟开销。

第三个短板是与 Jev 相比的成本悖论。Jev 有"极低但非零"的 API 定价,而 Strands Decider 免费但自托管。对于已经拥有闲置计算资源或对数据隐私有严格需求的企业来说,自托管更有优势。但对于大多数中小开发者来说,花 42 美元调用 10 亿次 Jev API,比维护一个自托管模型的硬件和运维成本更划算。

这意味着什么

决策模型的爆发,揭示了 AI 产业进入了一个新阶段——从"更强的模型"到"更聪明的工作流"。当 GPT-6、Claude 5 等前沿模型的性能增长逐渐趋于平缓,行业开始寻找在现有算力约束下更高效地使用 AI 的方式。

决策模型提供了一个思路:不需要让一个模型学会做所有事,而是让不同的模型做各自最擅长的事。一个 20 亿参数的小模型做判断,一个数万亿参数的大模型做生成。分工产生效率。

也许更具历史意义的是,这个赛道的发起者不是 OpenAI,不是谷歌,不是微软——而是一家在 9 月 15 日之前几乎无人知晓的创业公司 TypeSafe。它在两周之内引爆了整个行业。这再次证明,在 AI 产业的快速演进中,创新的主导权并不永远掌握在巨头手中。

亚马逊开源 Strands Decider 2B 的最终意图,可能不是做最好的决策模型,而是把这个模型变成 AWS Agent 生态系统的一个螺母。这个螺母不需要最闪亮——它只需要足够好用,并且和 AWS 的机器严丝合缝。

孱弱的决策能力曾是 Agent 落地最大的短板。而今,一百万个参数都不到的微型头部,也许就能补上这块拼图。

大模型负责想象,小模型负责判断。AI 学会了分工协作,这才是真正的"系统一"与"系统二"。

作品声明:内容由AI生成