人人都在造LLM路由,他们亲手砍掉了自己

2026.08.01 13:19
开源 LLM 网关 Manifest 在 2026 年 3 月上线路由功能,经历 7000 个云用户 4 个月真实使用后,于 6 月废弃、9 月彻底关闭。团队发现模型路由在大多数场景下得不偿失:提示词无法预判任务复杂度,缓存降本效果远超路由,行为一致性被打破,不可预测性本身就是隐性成本。当整个行业都在追逐 LLM 路由这个降本方案时,Manifest 用真实数据给出了一个反常识的答案。

所有人都告诉你,LLM 路由是 AI 降本的银弹。Manifest 说不。

2026 年 3 月,Manifest 在其开源 LLM 网关中上线了路由功能,自动将每次请求分配到四个复杂度等级中最合适的模型。逻辑无懈可击:既然小模型也能处理简单任务,何必每次都调用 GPT-4 级别的旗舰模型?三个月后,团队宣布废弃这个功能。9 月 1 日,正式关闭。7000 个云用户、4 个月的真实使用数据,换来一个与整个行业背道而驰的结论。在大多数场景下,模型路由省下的钱,总会在别的地方还回去。

一场降本狂欢中的反叛者

2026 年的 LLM 路由已经从技术概念变成了一个产业赛道。RouteLLM 在 ICLR 2025 上以“85% 成本节省、95% 的 GPT-4 质量保持”的论文数据引爆了行业想象。OpenRouter 聚合数百个模型提供统一 API。Portkey 主打生产级路由加缓存加护栏。LiteLLM 提供开源自托管方案。Not Diamond 和 Martian 专攻“按请求自动选最优模型”。微软 Azure AI Foundry 内置了模型路由作为付费服务。OpenAI 的 GPT-5 内部也集成了路由层来平衡能力与定价。

在这个人人都在造路由的浪潮中,Manifest 的选择显得格格不入。他们亲手砍掉了自己刚做好的路由。

Manifest 是一个开源 LLM 网关,像一层代理服务器坐在应用和 AI 模型之间。2026 年 3 月上线路由功能,核心逻辑是按请求复杂度分发到不同模型以降低成本。2026 年 6 月发布废弃公告,路由功能将在 9 月 1 日正式关闭。

7000 个云用户在 4 个月里给出的答案并不复杂。路由的理论很美,但实际运行中暴露了四个根本性问题。

提示词里藏不住任务的复杂度

路由器的核心假设是:通过分析用户输入的提示词,就能判断任务难度,然后分配给最便宜的模型。

Manifest 团队发现这个假设站不住脚。提示词本身只是触发器,大量决定任务复杂度的上下文是在执行过程中才暴露的。通过工具调用、网络搜索、代码执行等后续步骤,同一个提示词指向不同的代码仓库,任务复杂度可以是天壤之别。

“评估 $GIT_REPO 的测试用例并改进它们。”

如果目标是一个个人网站,简单到只需几条指令。如果目标是 Linux 内核仓库,复杂度会瞬间爆炸。路由器无法看到提示词背后的上下文,无法预知执行路径上的分支,更无法判断一个看似简单的请求是否会触发深度推理链条。

无论是基于关键词的规则路由,还是基于嵌入向量的语义路由,都绕不开这个根本困境:你必须在了解任务全貌之前,就决定谁来处理它。

Manifest 的废弃博客中特别提到,一些流行的智能体框架如 OpenClaw 和 Hermes 经常发送极长的系统提示词,让所有请求都被归类为“复杂”,路由的区分度在真实场景中几乎失效。同时,基于规则的路由只适用于英文提示词,大量使用其他语言的用户直接被排除在外。静态规则的能力上限,决定了它无法真正理解和捕捉人类语言的复杂度。

缓存才是真正的降本利器

如果说路由器的目的是省钱,那它可能找错了对手。

Manifest 团队在实践中发现,缓存的效果远优于路由。带有系统提示词和对话历史的长上下文请求,前缀缓存的命中率极高。缓存读取的成本比非缓存输入低 75% 到 90%。这意味着,如果一个路由器在频繁切换模型,反倒破坏了缓存的有效性。因为缓存依赖的是同一模型对同一前缀的重复命中。

一个“聪明”的路由器,如果考虑缓存效率,反而应该尽量保持请求粘性,持续使用同一个模型。换句话说,路由器的本职工作,恰恰是不要去做路由。这形成了逻辑上的自相矛盾。最优路由策略,就是不做路由。

这个矛盾在真实场景中尤为突出。AI 智能体通常会在一个会话中连续发出多次请求,对话历史逐渐累积为大量前缀 token。如果每次请求都被路由到不同模型,这些前缀缓存永远无法被复用。团队要么放弃缓存收益,要么让路由器“保持粘性”,但一旦保持粘性,路由器的存在意义就消失了。

工程师需要对模型有手感

LLM 路由领域有一个流行说法:工程师不应该关心底层用的是哪个模型,路由应该替他们做决定。

Manifest 团队明确反对这个观点。创始人 Bruno Perez 在文章中打了个比方:画家知道该用什么画笔,工匠知道该选什么工具,工程师同样应该理解不同模型的取舍和细微差异。在 Manifest 内部,每个工程师根据意图自主选择模型和推理参数,而不是交给路由器做黑箱决策。

让路由器在任务会话中频繁切换模型,不仅降低了整体工作质量,还让工程师失去了对工具的掌控感。当一个工程师不知道自己正在调用哪个模型,他也就无法对结果的质量负责。

同一个工作任务的不同步骤由不同模型完成,输出风格的一致性、推理链条的连贯性都会受到影响。一个用 Claude 写的前半段代码,被 GPT 接续修改,再被 DeepSeek 做最终润色。这种混合模型组装听起来高效,实际上牺牲了可维护性和可预测性。当输出出现问题时,你甚至不知道该从哪个模型开始排查。

Manifest 的立场很明确:工程师应该像工匠一样精通自己的工具,而不是把选择权交给一个黑箱路由器。

不可预测性本身就是成本

软件工程师最讨厌什么?不可预测性。

在自动化智能体工作流中,路由引入了一层额外的不确定性。每次请求去往哪个模型,不再是确定性的,而是取决于路由器的“此刻判断”。这对于评估、测试、可观测性和故障排查都带来了挑战。

想象一下你正在调试一个智能体行为异常的问题。同样的输入,今天被路由到 GPT-4,明天被路由到 Claude Opus,后天可能被路由到 DeepSeek V4。每次路由结果不同,每次输出的行为不同,排查问题的难度呈指数级上升。团队需要维护更多评估集、设计更复杂的 fallback 逻辑、追踪更多维度的可观测性指标。

所有这些隐性成本加起来,可能远超路由省下的那点 Token 费用。

Manifest 的观点是:对于大多数自动化智能体工作流,把不同请求隔离,为每个场景手动设置正确的模型、参数和提示词,虽然在初期更费功夫,但长期来看反而是更优的选择。

省下的钱,总会在别处还回去

Manifest 并非全盘否定 LLM 路由的价值。在博客的结尾,他们坦诚地表示:可能有很多场景,LLM 路由是有用的,那些推出路由产品的公司可能也有很好的理由。

但基于他们的真实经验,结论是清晰的。

路由的成本是可量化的。更少的 Token 消耗,更低的 API 账单。但路由的隐性成本,包括断裂的缓存、破碎的一致性、不可预测的调试、失控的工具选择,这些很难被计入 ROI 计算。一个团队可能因为路由省了 30% 的 Token 费用而沾沾自喜,却没有意识到维护成本、调试时间和质量损失已经悄悄吞噬了那 30%。

对于大多数用例,Manifest 给出的建议简单到令人失望:绑定一个经过实战检验的模型,认真理解它的能力边界,然后把它用好。这不是一个性感的答案,但可能是一个正确的答案。

省下的钱,总会在别处还回去。而那笔账,比路由账单更难算清。

作品声明:内容由AI生成