你能想象一家金融科技公司,比你更懂怎么用大模型省钱吗?
7 月 20 日,Ramp——这家以企业信用卡和费用管理起家的纽约金融科技公司——正式对外开放了 Ramp Router。这不是一个财务管理工具,而是一个 AI 模型路由系统:它能在每个 API 请求到达时,自动判断哪一个大模型最适合处理这个任务,然后把请求发到最便宜的模型上。
一个做金融报销的公司,为什么要做 AI 基础设施?
奥运短跑运动员不该去遛狗
2026 年 7 月 20 日,Ramp 联合创始人兼 CEO Eric Glyman 在 X 上发布了一条消息,内容出人意料——不是关于企业信用卡,而是关于 AI 模型路由。
他打了个比方:
你可以雇一个奥运短跑运动员去遛狗。效果肯定很好,但杀鸡用牛刀了。这基本上就是现在大多数公司运行 AI 的方式——用前沿模型处理每一个任务,包括那些一个价格便宜几十倍的模型就能完美搞定的任务。
同一天,Ramp 的 AI 负责人 Veeral Patel 正式宣布 Ramp Router 对外开放。他在推文中写道:
3 年前,我们在 Ramp 内部建立了一个 LLM 路由器,为 70,000 个客户的 AI 产品提供动力。当时主要是为了省钱。现在这个道理已经不言自明:最好的模型在不断变化。GPT、Claude、Gemini、Grok、Qwen、DeepSeek、Kimi、GLM——价格和能力每周都在变。所以我们决定对所有人开放。一个 OpenAI 兼容的端点。每个请求匹配最合适的模型。不用改写你的应用就能降低成本。
这个发布之所以值得关注,不仅仅因为 Ramp 是一家估值 440 亿美元、年化营收超过 10 亿美元的金融科技公司——更因为它揭示了一个正在发生的行业趋势:模型路由正在从聪明的省钱技巧,变成 AI 基础设施的标配层。
Agent 工作流的模型悖论
2026 年的 AI 应用生态已经和两年前完全不同。单一模型部署的时代正在结束。
行业数据显示,超过 75% 的团队在生产环境中使用多个模型,37% 的企业使用了 5 个以上的模型。模型市场已经从几个可选选项膨胀到 200 多个经过评估的 LLM,价格从每百万输入 Token 0.07 美元到 60 美元不等,跨度近千倍。
Agent 工作流的出现让这个问题更加复杂。一个典型的 Agent 任务可能包含意图识别、信息检索、推理决策、内容生成、格式转换等多个步骤。每个步骤对模型能力的要求都不一样。意图识别用小模型就够了,但复杂推理需要前沿模型。一个研究团队在 2026 年初的报告中精确描述了这种困境:一个 Agent 轮次可能包含四步——快速意图分类(便宜)、工具选择决策(中等)、多跳推理链(昂贵)、最终响应合成(中等)。把四个步骤全部通过 Claude Opus 处理是正确但浪费的。全部通过 Haiku 处理则会在第三步崩溃。
问题在于,大多数开发者仍然在用一个模型通吃所有步骤——要么全用 GPT-4o 或 Claude Opus 烧钱,要么全用小模型牺牲质量。没有中间地带。而学术界的研究已经给出了量化答案:RouteLLM(来自 UC Berkeley 和 LMSYS 团队,发表于 ICLR 2025)证明,智能模型路由可以在保持 95% 质量的前提下,将推理成本降低 85%。动态路由的整体潜力区间是 40% 到 85% 的成本削减。
Ramp Router 做了什么
Ramp Router 的核心理念很简单:它测试每一个新模型在实际任务上的表现,然后自动把每个请求路由到能通过质检的最便宜模型。
但实现起来远比听起来复杂。据 Eric Glyman 透露,Ramp Router 在每个请求上会做 100 多次内部调用,来决定:哪些结果可以缓存,哪些请求可以批量处理,什么时候需要升级到更强模型。
效果已经显现。在内部运行中,Ramp Router 已经将 AI 成本降低了 30% 以上,同时输出质量保持不变甚至更好。其 Alpha 组的运行规模已经达到每月 2.75 万亿 Token,可用性达到 99.99%。
更重要的是,Ramp Router 提供了一个 OpenAI 兼容的 API 端点。这意味着开发者不需要改写任何代码——只需要修改一行 API base URL,就能让请求自动路由到最合适的模型。这种零配置体验,加上对 GPT、Claude、Gemini、Grok、Qwen、DeepSeek、Kimi、GLM 等主流模型的全面支持,让迁移成本降到了最低。
为什么是 Ramp 在做这件事
这就引出了最有趣的问题:为什么一个做企业费用管理的公司,做出了可能是目前最实用的模型路由产品?
答案藏在 Ramp 的基因里。Ramp 成立于 2019 年,从第一天起就是一个 AI-native 的金融科技公司。它的核心产品——从费用自动分类、发票 OCR 到 Policy Agent——全部依赖 AI。公司内部在 3 年前就开始构建 LLM 路由系统,因为当时管理层就意识到:用最好的模型处理每一个请求,在财务上不可持续。
换句话说,Ramp 做 Router 不是因为想做 AI 基础设施,而是因为自己被逼着解决了一个真实的问题。这种 dogfooding(自己先用)的产品路径,往往能催生出比纯技术公司的抽象方案更务实的工具。当一家以帮企业省钱起家的公司开始帮自己省钱,它对这个问题的理解比大多数技术栈供应商都要深刻。
此外,Ramp 本身就是一个 AI 重度用户的样本。公司目前估值 440 亿美元,客户包括 Visa、Uber、Shopify、Anduril、Figma 等知名企业。70,000 家客户在使用 Ramp 的 AI 产品,每月 2.75 万亿 Token 的走量本身就是最好的压力测试环境。没有哪个实验室能模拟这种真实世界的流量模式。
模型路由赛道的升温
Ramp 的发布不是孤立事件。2026 年,模型路由赛道正在快速成为 AI 基础设施的热门方向。
从研究层面看,RouteLLM(LMSYS/Berkeley)、MasRouter、Router-R1(NeurIPS 2025)等学术路由方案不断涌现。从商业层面看,OpenRouter、Martian、Not Diamond、LiteLLM、Portkey 等产品都在争夺这个市场。亚马逊 Bedrock 推出了 Intelligent Prompt Routing,Azure AI Foundry 也内置了路由能力。行业数据表明,37% 的企业已经在生产环境中使用 5 个以上的模型,而路由工具的成熟度正在快速追赶这一需求。
但 Ramp Router 的差异化在于:它不是一个配置路由规则的工具,而是一个自动学习加路由的系统。它不需要开发者手动定义哪些任务用哪个模型——系统自动测试、自动判断、自动路由。这种零配置体验,加上 OpenAI 兼容的 API,让迁移成本降到了最低。
Ramp 的入局,给这个赛道带来了一个非典型玩家。金融科技公司做 AI 基础设施,这听起来像是一个跨界,但仔细想想,真正理解省钱的公司,可能恰恰是最适合做这件事的。
这意味着什么
模型路由正在从可选项变成必需品。在模型数量爆炸、价格每周波动、Agent 工作流越来越复杂的今天,不用路由的 AI 应用,就像不用 CDN 的网站——能跑,但成本效率完全不可比。
对于开发者来说,这意味着两件事。第一,不要再让用一个模型通吃所有步骤成为默认选择。第二,关注模型路由层的演进——它可能是 2026 年 AI 基础设施中最被低估的变量。
对于企业决策者来说,Ramp Router 的开放是一个信号:AI 成本控制正在从手工优化走向系统化基础设施。当一家 440 亿美元估值的公司愿意把内部工具对外开放,说明这个需求已经足够大、足够普遍。
模型路由不是技术问题,而是成本哲学问题。当一家以帮企业省钱起家的公司开始帮你省 AI 的钱,你最好认真看看它做了什么。






快报