蚂蚁LLaDA 2.2用编辑而非预测改写Agent游戏规则

2026.07.26 04:19
蚂蚁集团旗下 inclusionAI 发布 LLaDA 2.2-flash,首个面向 Agent 场景的大规模扩散语言模型,在 SWE-bench Verified 上拿到 49.28%,τ²-Bench 以 592.80 分碾压对手。其核心突破 Levenshtein Editing 让扩散模型首次能在生成过程中自我纠错,打破了自回归模型对 Agent 任务的垄断。

一个扩散模型,正在做自回归模型最擅长的事——计划、调用工具、自我纠错、在长程多轮交互中独立完成任务。

这不是科幻,而是2026年7月25日刚刚发生的真实事件。蚂蚁集团旗下 inclusionAI 团队发布 LLaDA 2.2-flash,一个面向 Agent 场景的扩散语言模型,MoE 架构,103B 总参数量,权重和代码全部开源。在 SWE-bench Verified 上拿到 49.28%,在 τ²-Bench 上以 592.80 分碾压 Ling-2.6-flash 的 334.90 分,fast mode 更是冲到 705.30 分。

但真正让这场发布值得被记住的,不是这些数字本身。而是它做了一件此前所有扩散模型都做不到的事:在生成过程中自我修正,像一个程序员反复修改自己的代码。

扩散模型的「Agent 时刻」

扩散语言模型从来不是新概念。2025年11月,蚂蚁 inclusionAI 团队发布 LLaDA 2.0,首次将扩散模型参数量级推到 100B,推理速度 535 tokens/s,是对标自回归模型的 2.1 倍。2026年2月,LLaDA 2.1 引入 Token Editing 进一步提速。但业界一直有一个心照不宣的共识:扩散模型适合做生成,但做不了 Agent。

原因很直观。Agent 需要在长程交互中做出正确决策,而扩散模型一次生成所有 token 的机制,意味着早期步骤的每一个错误都会像多米诺骨牌一样,传导到后续所有决策中。自回归模型虽然慢,但每一步都基于最新的正确上下文,天然更稳健。

直到 LLaDA 2.2 出现。

这两天,Elvis(@omarsar0,DAIR.AI 创始人,前 Meta AI 研究员)在 X 上连发数条推文拆解 LLaDA 2.2 的技术细节,引发社区热议。他的核心观点很明确:这是一款为 Agent 工作而生的扩散 LLM,从规划、工具调用到长程轨迹的自我纠错,它都做到了,而且保留了扩散模型天生的速度优势。

从「填空」到「编辑」

理解 LLaDA 2.2 的突破,首先要理解扩散模型的工作原理。

传统扩散语言模型的生成方式是「填空」:从一个几乎全被遮罩的随机序列开始,逐步预测并填充最确定的 token,经过多轮迭代后输出完整文本。这种方式的优势是并行:一次预测多个 token,速度远快于逐 token 生成的自回归模型。但代价是,一旦某一步填错了,错误就固化在序列中,后续步骤只能在这个错误的基础上继续。

LLaDA 2.2 从根本上改变了这个范式。它引入了 Levenshtein Editing,包含四种基本编辑操作:KEEP(保留)、SUBSTITUTE(替换)、DELETE(删除)、INSERT(插入)。模型通过最长公共子序列对齐进行训练,学会在生成过程中主动删除错误的片段、插入缺失的上下文。

这听起来不像一个语言模型,更像一个程序员在写代码:先写一个草稿,然后删掉不合适的部分,插入新的逻辑,替换表达不准确的变量名。它不再是被动地「预测」下一个词,而是主动地「编辑」已有的输出。

错误传播的终结者

在 Agent 场景中,最致命的不是模型能力不够,而是错误被固化在上下文中无法修复。早期的一个错误决策会成为后续所有推理的「硬约束」,每一步都在错误的基础上继续推导,最终导致整个任务失败。

LLaDA 2.2 的强化学习阶段直接针对这个问题设计。L-EBPO(Levenshtein Edit Block-level Policy Optimization)将编辑操作集成到块级策略优化中。模型从环境反馈中学习何时应该切除有缺陷的片段,何时应该填补空白。这从根本上阻断了错误在轨迹层面的传播。

用一句话概括:不是让错误不出现,而是让错误可以被修正。这比任何「提高准确率」的方案都更接近 Agent 的真实需求。因为在真实世界中,Agent 永远不可能完美,但能自我修正的 Agent 比永远正确的 Agent 更有用。

数字说话

理论之外,LLaDA 2.2-flash 的实际表现经得起推敲。

在 SWE-bench Verified 上,LLaDA 2.2-flash 拿到 49.28%。这个数字放到 2026 年 7 月的坐标系里看:GPT-4.1 是 54.6%,o3-mini 是 49.3%,Claude 3.5 Sonnet 是 49.0%。一个扩散模型在软件工程任务上达到与 o3-mini 几乎持平、略高于 Claude 3.5 Sonnet 的水平,而且是首次尝试 Agent 任务,这本身就是信号。

在 τ²-Bench 上,差距更加触目惊心。τ²-Bench 由 Sierra Research 开发,模拟真实的多轮客服对话和工具调用场景。LLaDA 2.2-flash 拿到 592.80 分,而参考模型 Ling-2.6-flash 只有 334.90 分。在 fast mode 下,LLaDA 2.2-flash 更是冲到 705.30 分,超过对手两倍以上。

速度方面,LLaDA 2.2-flash 的 BF16 吞吐量平均是 Ling-2.6-flash 的 1.64 倍。FP8 量化在此基础上再提升 18.6%。考虑到 Agent 任务通常需要大量推理调用,这种速度优势在规模化部署时会被放大。

架构上,LLaDA 2.2-flash 支持原生 128K 上下文,通过渐进式训练从 8K 逐步扩展到 128K。MoE 架构确保每次推理只激活部分参数,Block Routing 策略进一步削减了不必要的计算开销。这意味着它既快又省,在 Agent 需要频繁调用的场景下,成本优势显著。

谁在推动这件事

LLaDA 2.2 来自蚂蚁集团的 inclusionAI 团队。这是蚂蚁面向 AGI 的自主研发团队,此前已经发布了 LLaDA 2.0(100B 扩散模型)、Ling 系列等多个模型。值得注意的是,inclusionAI 选择全部开源:Apache-2.0 协议,模型权重和代码完全开放,托管在 Hugging Face 和 GitHub 上。

在闭源模型主导 Agent 生态的今天,这为开发者社区提供了一个重要的开放选项。在 Hugging Face 上,LLaDA 2.2-flash 的模型权重已经收获大量关注,支持 Transformers、vLLM、SGLang 等多种推理框架。

这意味着什么

扩散模型的「Agent 无用论」被彻底推翻。LLaDA 2.2 证明,通过合适的编辑和纠错机制,扩散模型不仅可以做 Agent,还能在速度上碾压自回归模型的同时,在 Agent 基准上取得竞争性成绩。Levenshtein Editing 可能成为扩散模型迈向 Agent 的标准范式。

蚂蚁集团在 AI 基础模型上的投入正在加速兑现。从 LLaDA 2.0 到 2.2,不到一年时间迭代了三代。如果用一句话概括蚂蚁的路线:不做最大的模型,做最快的扩散模型。这条路线正在被验证。

自回归架构的「垄断」正在被打破。自 GPT 以来,几乎所有主流大语言模型都采用自回归架构,从左到右逐 token 预测。扩散模型提供了另一种可能:更快、可并行、可编辑、可纠错。如果未来有更多证据表明扩散模型在复杂 Agent 任务上能与自回归模型匹敌,整个大模型的技术路线图可能需要重新绘制。

当然,LLaDA 2.2 并非完美答案。SWE-bench Verified 49.28% 距离一线闭源模型还有明显差距。Agent 场景中,模型在等待工具响应时大部分时间处于空闲状态,扩散模型的并行解码优势在这部分被稀释。社区也有观点指出,真正的 Agent 瓶颈往往不在 LLM 推理步骤,而在工具调用边界的等待时间。

但如果说 LLaDA 2.2 给出了什么确定的信号,那就是:扩散模型从「可以做生成」到「可以做 Agent」的拐点,已经到来。

自回归统治了十年。但编辑,或许比预测更接近思考的本质。

作品声明:内容由AI生成