2.6B参数碾压8B对手:Liquid AI的端侧Agent模型凭什么

2026.08.07 13:20
Liquid AI发布LFM2.5-2.6B,一个仅2.69B参数的端侧Agent模型,在指令遵循和工具调用基准上碾压Gemma 4系列、与9.7B的Qwen3.5-9B打平,推理速度达220 tok/s且内存占用不到2.5GB。文章深入分析了其混合卷积+注意力架构、四段式Agent后训练管线、差异化定位策略及开放权重的商业化平衡,揭示端侧Agent正在从云模型替代品升级为独立物种的趋势。

当整个AI行业还在为千亿参数模型狂热时,一家从MIT走出的初创公司用2.6B参数给出了一个反直觉的答案。Liquid AI本周发布的LFM2.5-2.6B,在指令遵循和工具调用基准上,不仅碾压了参数规模翻倍的Gemma 4-5.1B和Gemma 4-8B,甚至在某些Agent任务中与9.7B的Qwen3.5-9B打平。这不是一个"小模型追赶大模型"的励志故事,而是一个更根本的信号:下一代AI竞争,参数军备竞赛正在让位于部署效率的较量。

2.6B的"越级"表现

8月6日,Liquid AI正式发布LFM2.5-2.6B,一个专为端侧Agent工作负载设计的开放权重语言模型。

参数总量2.69B,30层架构(22个双门控卷积块加8个GQA注意力层)。上下文窗口131,072 tokens,词表大小128,000,预训练数据约34万亿tokens,覆盖16种语言。两个Checkpoint同时上线Hugging Face:LFM2.5-2.6B-Base供开发者微调,LFM2.5-2.6B已完成Agent后训练。模型支持原生、GGUF、MLX、ONNX四种格式,首日即兼容llama.cpp、vLLM、SGLang和LM Studio等主流推理框架。

Liquid AI公布的基准测试数据令人意外。在指令遵循方面,LFM2.5-2.6B在IFBench拿到59.17,Multi-IF达到80.07,IFStruct达到85.49。每一项都大幅领先Gemma 4-5.1B(34.08/69.44/64.85)和Gemma 4-8B(39.24/77.35/76.65)。在工具调用上,BFCLv4得分56.88,ToolSandbox得分77.83,τ³-Bench Banking得分5.67。全部超越同尺寸竞品,与9.7B的Qwen3.5-9B差距在毫厘之间。在Agent任务上,Claw-Eval平均62.85,PinchBench 68.22,BrowseComp+(OpenClaw)26.89。后两项仅略低于Qwen3.5-9B。

更值得注意的是STEM领域。AA Omniscience得分-29.50(越低越好),远超Gemma 4-5.1B的-74.47和Gemma 4-8B的-49.03,甚至优于Qwen3.5-9B的-50.43。AIME25数学竞赛51.87,仅次于Qwen3.5-9B的56.07,是Gemma 4-5.1B(26.33)的近两倍。

Liquid AI在声明中如此总结:Despite being the smallest model in the comparison, it is competitive with, and often outperforms, models nearly four times its size.

架构密码:为什么混合卷积加注意力更适配端侧

LFM2.5-2.6B的底层架构LFM2,是一种混合了短程卷积(double-gated LIV conv)和分组查询注意力(GQA)的独特设计。30层中,22层是卷积块,8层是注意力块。

传统Transformer的注意力机制在长序列上计算量呈二次增长,在端侧CPU上尤其吃力。卷积层则具有线性计算复杂度,对短程依赖关系的建模天然高效。LFM2的混合架构在大多数推理步骤中使用轻量卷积,只在必要时切换到注意力处理长程依赖。

这一架构并非人力设计,而是通过神经架构搜索工具STAR自动发现的。它从搜索空间中自动涌现出的最优解,而非预设的"Transformer替代"方案。这条"非主流"路线让LFM2.5-2.6B在CPU上实现了220 tok/s(Apple M5 Max)和113 tok/s(AMD Ryzen AI Max+ 395)的推理速度,内存占用不到2.5GB。Liquid AI的后训练负责人Maxime Labonne在采访中表示,模型在树莓派上也能"跑得相当快"。实测显示,在智能手机上每秒可生成约30个tokens。

四段式后训练:从"聊天机器"到"行动智能体"

"现在的模型不再通过聊天界面被消费了,它们是通过Agent框架被调用的。"Labonne在发布后接受VentureBeat采访时说,"我们希望确保这个模型不仅擅长数学和代码,还擅长使用工具。"

正是这句话,直接解释了LFM2.5-2.6B最核心的差异。它的后训练流程完全围绕Agent场景设计,而非传统对话。

SFT(监督微调)。两阶段微调,先用广泛数据覆盖所有领域,再聚焦Agent任务(工具调用、搜索、软件工程、Agent轨迹)。训练数据量是LFM2.5-8B-A1B的约7倍。

教师专项化(Teacher Specialization)。从共享SFT检查点出发,为每个目标领域(指令遵循、数学、知识/幻觉控制、代码、工具调用、长上下文)训练一个专家模型,再通过RLVR(带可验证奖励的强化学习)进一步优化。

MOPD(多领域在策略蒸馏)。将6个专家模型的能力蒸馏回一个学生模型。关键创新在于"在策略"。学生模型用自己的策略生成回答,由对应领域的教师以token级别反馈进行监督。由于教师与学生共享同一SFT检查点初始化,教师反馈分布与学生足够接近,不会导致训练不稳定。

Agentic RL(Agent强化学习)。在真实Agent环境(Hermes Agent、OpenClaw等)中进行多轮训练,在沙箱中执行实际的生产力任务,包括研究、写作、编码、数据分析、文档管理、工具调用。优化采用GRPO,结合LLM-as-judge评分、程序化检查和硬性安全门控。

Labonne将这一设计描述为一次"幸福的意外"。专注于Agent的训练不仅提升了Agent能力,还附带提升了数学、指令遵循等所有领域的表现。

差异化定位:不争最强,只争"最合适"

LFM2.5-2.6B的基准表现有一个清晰的模式:指令遵循和工具调用上领先同类,STEM上与更大的模型持平,编码上则明显落后。

这不是短板,而是设计取舍。Liquid AI明确不推荐将LFM2.5-2.6B用于Agentic Coding或知识密集型任务。它的目标场景是高吞吐的端侧Agent工作负载、工具调用、数据提取、RAG、长上下文处理。这些场景中,推理速度、隐私保护和运行成本比纯粹的benchmark分数更重要。

Labonne在采访中说:"We want to make models for another type of user. You should use edge AI when you can't use a cloud model."

这种定位在商业层面迅速得到验证。发布同日,Liquid AI宣布与MacPaw(CleanMyMac和Setapp的开发商)达成战略合作,为其macOS AI助手Eney提供端侧模型。Labonne透露,MacPaw选择Liquid AI的一个关键原因正是模型尺寸。"他们没有足够的内存预算去运行其他模型。"

开放权重与商业化的微妙平衡

LFM2.5-2.6B使用LFM Open License 1.0,基于Apache-2.0,但设定了1000万美元年收入上限。年收入低于这一门槛的企业可免费商用,超出则需与Liquid AI另行协商。非营利组织在非商业和研究用途上豁免。

"部分开放"的策略在AI行业并不新鲜,Meta的Llama和Mistral都采取过类似做法。但Liquid AI的规模较小,对大型企业部署的监控能力存疑。Labonne被问及如何监控大企业违规部署时坦言:"I think this is a question for our legal team, but personally, I don't know."

这句话暴露了开源AI商业化的核心矛盾。模型权重一旦公开,技术上的控制几乎不可能实施。Liquid AI的赌注在于,足够多的企业和开发者会因为合规需求和生态支持而主动与公司接洽。

端侧Agent的拐点

LFM2.5-2.6B的发布,标志着AI行业的一个微妙转折点。

过去两年,行业竞赛的主旋律是"谁更大"。从GPT-4到Llama 3到Claude 3.5,参数规模一路攀升。但2026年,趋势正在分化。前沿模型仍在向万亿参数冲刺,但以LFM2.5-2.6B、SmolLM3、Ministral为代表的小模型阵营,正在定义一条截然不同的竞争路线。

这条路线的核心逻辑是:对大多数企业应用场景来说,模型不需要"最好",只需要"足够好"。而"足够好"加上"部署在任何地方"的成本结构,比"最好"但"只能跑在云端"的商业模式更有竞争力。

当Agent从聊天界面走向后台自动化流程,从单次交互走向全天候运行,Token成本从"可忽略"变成"不可承受"时,端侧Agent的商业价值将从"替代方案"升级为"必选方案"。

当所有人都忙着把模型做大时,真正改变行业格局的,可能是那些把模型做小、做快、做便宜的人。LFM2.5-2.6B证明,端侧Agent不是云模型的廉价替代品,而是一个全新的物种。

作品声明:内容由AI生成