一个 AI Agent 收到用户消息后做的第一件事,通常不是“思考”——而是“判断”。
这条消息该路由到哪个子 Agent?紧急程度是低、正常、高还是紧急?是否需要转人工?这些判断在一套 Agent 系统里每分钟重复成千上万次。而大部分开发者目前的做法,是把每个判断都丢给一个千亿参数的大语言模型。
这像用波音 747 送外卖。能飞,但没人这么干。
9月24日,Fastino Labs 发布了 GLiNER2.5-Decide,一个 340M 参数的开源决策模型。它不做推理,不生成文本,唯一的能力是从文本中做出符合约束规则的结构化判断。而且,它跑在 CPU 上就够了。
GLiNER2.5-Decide 到底是什么
GLiNER2.5-Decide 是一个非生成式分类器。基于编码器架构,从 gliner2-large-v1 微调而来,340M 参数。不需要 Prompt 模板,不生成 Token。
它的工作方式更像一个“选择题机器”:你传入一段文本,同时传入一个 Schema(模式),其中定义了一系列带类型的问题和每个问题允许的答案。模型同时读取文本和 Schema,为每个允许答案打分,再通过一个约束解码器搜索满足所有规则的最高分联合方案。
举个具体例子。你传入一段客服对话和一个三选一的 Schema——“用户的意图是什么(密码重置/卡片挂失/余额查询)”,“紧急程度是什么”,“应该路由到哪个部门”——模型一次前向传播就返回所有答案,每个答案附带概率分布和置信度分数。
这和传统做法截然不同。传统路径要么为每个分类任务训练一个独立模型,要么把所有分类请求塞给一个大模型并期待它准确输出。GLiNER2.5-Decide 选择了一条中间路线:一个编码器,一次前向传播,多条判断同时输出,答案之间的依赖关系由约束解码器处理。
联合解码为什么重要
Fastino 团队用了一个经典的护栏例子来说明。假设一个模型需要同时判断一条用户输入是否安全,以及如果“不安全”具体是哪种类型的危害。如果两条判断是独立解码的,模型可能检测到 prompt injection 分数 0.82,同时又标记安全分数 0.52。攻击被检测到了,但两条判断自相矛盾——一个不安全的输入同时被标记为安全。
联合解码施加了一条约束规则:只要检测到任何危害类型,安全判定必须是 unsafe。于是模型返回 safety=unsafe 和 harm_type=prompt_injection 这一组合,下游代码可以直接基于此拦截、路由或升级处理。
Schema 还可以表达蕴含关系、互斥关系、基数限制和序数边界。同一个编码器还可以在单次前向传播中提取实体、关系和结构化记录,并返回字符级别的偏移位置。
基准测试:340M 的编码器如何击败 4B 的解码器
Fastino 团队在内部生成的 Fast Decisions 基准套件上做了评估。套件包含 5100 个测试样本,覆盖 17 个数据集,包括客户运营(支持意图、话题分类、转人工判断、邮件分类、工单路由、产品反馈)、领域路由(银行、临床、旅游、福利)和通用内容理解(文档类型、评论情感、新闻话题、学术领域、体育总结、餐厅评价、界面标签)。评估指标是精确匹配准确率——只有预测的标签集和参考答案完全一致才算正确。
- GLiNER2.5-Decide(340M 编码器):60.1%
- JevK5(4B 级 Qwen3.5 解码器):57.5%
- SemIf(Qwen3.5-4B 解码器):56.4%
- GLiFormer large-v1(单次编码器):49.0%
- Laya(421M ModernBERT 编码器):46.6%
340M 参数的平均准确率 60.1%,领先 4B 级解码器约 3 到 4 个百分点。在 17 个数据集中,GLiNER2.5-Decide 领先了 9 个。
在意图路由这个关键任务上,差距更悬殊。支持意图分类上它达到 75.3%,银行意图分类上达到 64.3%,分别领先次优模型 18.6 和 8.6 个百分点。意图路由恰好是 Agent 管道中最高频的决策场景——每一次消息进来,都要先判断“这是来干什么的”。
延迟:CPU 上也能用
Fastino 团队用双头、15 标签的 Schema 做了端到端基准测试。在 64 Token 长度下,p50 延迟为:
- 48-vCPU Intel Xeon Platinum 8581C(纯 CPU):167.3 ms
- NVIDIA T4:43.6 ms
- NVIDIA L4:43.4 ms
- NVIDIA V100:38.3 ms
- NVIDIA A100:47.3 ms
短请求时不同 GPU 之间差距不到 9 毫秒,因为固定预处理和内核启动开销占主导。当输入拉到 1024 Token,A100 的优势显现:52.6 ms,而 V100 是 75.6 ms,L4 是 131.4 ms。
但对低并发场景,纯 CPU 推理的 167.3 ms 已经足够实用。这意味着一个不依赖任何 GPU 的 Agent 系统,可以在 170 毫秒内完成一次完整的结构化判断——意图识别、紧急程度评分、路由决策、护栏检查,一次搞定。
为什么这很重要
Agent 基础设施正在经历一次“角色解耦”
2025 到 2026 年,AI Agent 从概念验证走向生产部署,一个最显著的架构变化是“大模型包揽一切”的范式正在瓦解。
早期的 Agent 架构通常是一个大模型负责所有事情:理解用户输入、决策路由、工具调用、生成回复。这看起来简洁,但在生产环境中暴露出三个死结。
成本。每个判断都调用大模型,Token 消耗巨大。一个简单的意图路由可能只需要几十个 Token 的输入和几个 Token 的输出,但每次调用 GPT-4 或 Claude,都要支付大模型的高昂推理成本。
延迟。大模型的首 Token 延迟通常在数百毫秒到数秒之间。在 Agent 管道的每个环节都叠加一次大模型调用,端到端延迟呈指数级累积。一个需要经过“意图路由→工具选择→信息检索→回复生成”四步的 Agent,如果每一步都等大模型,用户可能要等 5 到 10 秒才能看到回复。
可靠性。大模型是生成式的。它不保证输出格式,不保证遵循指令,有时还会出现幻觉。用于分类和路由这种需要确定性的工作时,这种不确定性是结构性的。你没法信任一个“90% 情况下正确”的路由决策,因为它无法告诉你哪 10% 是错的。
行业正在对此做出反应。一个清晰的趋势是将 Agent 管道中不同角色拆解给不同的模型处理。生成和推理交给大模型;分类、路由、工具选择、护栏判断等高频、确定性的工作,交给专门的小模型。
GLiNER2.5-Decide 就是这个趋势的典型代表。它不是一个“弱化版”的大模型,而是一个为结构化决策这一单一任务从头设计的专用模型。Fastino 团队在模型卡中写得很清楚:“这个版本不是通用模型。它不做推理,不解释,不回答开放式问题。它是用于运营决策的专家。”
为什么 340M 能打败 4B
GLiNER2.5-Decide 在基准测试中击败 JevK5 和 SemIf 这两个 4B 级模型,不是偶然的。这背后是架构选择上的本质差异。
JevK5 和 SemIf 都是基于 Qwen3.5 的解码器模型。它们本质上是为生成文本而设计的大语言模型,被“借用”来做分类——通过 Prompt Engineering 引导模型输出特定格式的文本来完成分类任务。这就像让一个短跑运动员去参加数学竞赛:他能干,但效率不是最优的,结果还不稳定。
GLiNER2.5-Decide 是一个编码器模型。它从设计之初就是为了“理解”而不是“生成”。编码器对输入文本做深层语义表示后,分类头直接在这些表示上做决策。没有生成 Token 的开销,没有解码采样的随机性,没有格式化输出的不确定性。
更重要的是,GLiNER2.5-Decide 的联合解码机制让它可以自然地处理跨标签的约束关系。而独立解码器模型要么做不到这一点——需要每次分类后在业务逻辑层做额外验证——要么需要增加复杂的后处理步骤。
一句话总结:一个做生成的大模型被拿来分类,是一个妥协。一个从零就为分类设计的编码器模型,才是正经工具。
Fastino 的“小模型”战略
Fastino Labs 的背景值得多说几句。
公司成立于 2024 年,总部位于加州帕洛阿尔托。CEO Ash Lewis 和 COO George Hurn-Maloney 此前创办的 DevGPT 让两人亲身体会到大模型推理成本吞噬一切的痛苦——据 Lewis 后来接受采访时所描述的,有一段时间公司在语言模型上的支出甚至比整个团队的薪资成本还高。
这家公司有一个明确到近乎偏执的定位:只做小模型。它的 GLiNER 系列自发布以来已在 Hugging Face 上被下载超过 600 万次,被多家财富 500 强公司投入生产。2026 年 4 月,Fastino 推出了 Pioneer,一个用小模型做微调和自适应推理的 Agent 平台。同年 8 月,它又发布了 GLiNER2.5,用边界预测架构替代了传统的跨度枚举方法。
Fastino 融资总额接近 2500 万美元,投资方包括 Khosla Ventures(OpenAI 的第一个机构投资人)、Insight Partners、M12(微软的 VC 基金)和 NEA。值得注意的是,Fastino 曾宣称其模型可以用总价不到 10 万美元的低端游戏 GPU 完成训练。这在动辄千万美元训练成本的 AI 行业,几乎是另一个量级的故事。
GLiNER2.5-Decide 的发布延续了这个“以小博大”的战略。Fastino 同时发布了三个变体:340M 标准版、1B 的 XL 版(基于 Ettin 1B 编码器,得分 59.6%)、以及 287M 的多语言版(得分 56.7%)。340M 版本在测试中得分最高——参数规模不是一切,数据质量、训练目标和架构设计同样关键。
Apache 2.0 许可协议意味着所有权重对任何人开放——下载、修改、商用部署,甚至断网部署都可以。一行命令 pip install gliner2 完成安装。
这意味着什么
Agent 的分工时代正在到来
GLiNER2.5-Decide 不是孤立事件。它是 AI 基础设施从“万能大模型”走向“专业化小模型分工协作”这个浪潮中的一朵浪花。
2026 年,模型路由已经成为 AI 工程的一个独立分支。NVIDIA、Cognition、OpenRouter、TypeSafe 等公司和团队都在布局。分类模型、路由模型、评分模型、护栏模型——这些“看不见”的模型正在成为 Agent 基础设施中的关键节点。就像互联网时代的 DNS 系统一样——用户感知不到它们的存在,但离开它们,整个系统就会瘫痪。
GLiNER2.5-Decide 提供了一个很有意思的对比:它 340M 参数的平均准确率(60.1%),比 4B 参数模型的 57.5% 和 56.4% 更高。但这不意味着“编码器打败了解码器”这个简单结论。解码器模型能回答开放式问题、能做推理、能结合上下文做复杂判断——编码器做不到。正确的理解是:在“给定有限选项做分类”这个特定任务上,一个设计良好的专用编码器远优于一个被迫做分类的大型解码器。分工,不是取代。
对于那些已经在构建分层模型架构的团队——用大模型做推理和生成,用小模型做路由和分类——GLiNER2.5-Decide 提供了一个性能更好、成本更低的选择。
更重要的是,决策层可以完全本地化了。340M 的模型在 CPU 上 170 毫秒内完成判断,数据不需要出设备,延迟可预测,无需云 API 调用。对于金融、医疗、国防等对隐私和合规有严格要求的场景,这意味着 Agent 架构的一个关键环节可以做到真正的“离线可用”。
Fastino 这样做还有一重意味:在一个动辄千亿参数的时代,一家公司靠 340M 的模型做出了一个生产级产品,还拿到了顶级的融资。资本市场正在对“小模型”路线下注。
当所有人都在追逐更大的模型时,真正的 Agent 基础设施赢家,可能藏在那些小到在 CPU 上都能跑、准到能打败比它大十倍的模型、而专到只愿意做一件事的模型身上。






快报