训练一个能调用API、操作办公软件、帮你订餐订票的AI Agent,需要多少条高质量轨迹数据?答案是:海量。但比这个数字更让人头疼的问题是,这些数据从哪来?
过去行业的答案几乎只有一个:搭环境。搭一个带真实API、有预填充数据库、能真实执行代码的完整数字世界。这套方案不仅成本高昂,而且每接入一个新API就要从头搭建,成为Agent规模化训练最大的瓶颈。
但苹果AI研究团队刚刚扔出一颗炸弹:不需要了。
仅凭一份API文档,就能训练Agent
2026年7月18日,苹果AI研究团队在arXiv上提交了一篇题为《Environment-free Synthetic Data Generation for API-Calling Agents》的论文。论文的核心论点极其大胆。仅凭一份API规范文档,就能用LLM本身模拟出完整的API调用轨迹,质量足以训练出在真实基准测试中表现优异的Agent。
论文作者包括Seanie Lee、Sanjoy Chowdhury、Chao Jiang、Cheng-Yu Hsieh、Ting-Yao Hu、Alexander T Toshev、Oncel Tuzel和Raviteja Vemulapalli,全部来自苹果。这并非苹果首次在合成数据方向发力。2026年3月,苹果在ICLR上发表了AutoPlay论文,提出用探索式交互自动生成Agent训练任务,同样由Alexander T Toshev参与。但AutoPlay仍然需要Agent真正去操作App、观察状态变化。而新论文走得更远:连这一步都省了。
论文的验证选择了两个以难度著称的基准测试:AppWorld和OfficeBench。
AppWorld是一个高保真数字世界模拟器,包含9个日常App、457个API接口和750个复杂任务。此前最先进的模型GPT-4o在AppWorld的常规任务中仅能解决约49%,在挑战任务中更是只有约30%的成功率。OfficeBench则是面向办公自动化场景的基准测试,GPT-4 Omni的通过率也只有47%。
这两组数据揭示了Agent领域一个尴尬的现实:当前最顶尖的LLM,在真实数字世界中连一半的日常任务都搞不定。而制约Agent能力提升的核心瓶颈之一,恰恰是高质量训练数据的极度匮乏。
一个被低估的瓶颈
为什么Agent训练数据如此难获取?问题的根源在于轨迹的获取成本。
训练一个API调用型Agent,需要的是任务、思考、行动、反馈的完整闭环轨迹。这意味着每一次Agent调用API、收到响应、做出下一步决策的完整记录,都必须有真实的执行环境来支撑。这不仅要求开发者为每个API搭建可执行的环境,还要预填充真实的后端数据库。如果目标是训练一个能操作10个App的Agent,就需要搭建10个App的完整后端。这还只是成本的一部分。更棘手的是,一旦API版本更新,整个环境就要重新适配。
换言之,Agent训练数据的生产,一直以来都卡在物理世界这一步。
苹果的解法:LLM即世界模型
这篇论文提出的方法,本质上是对世界模型概念的一次巧妙运用。
整个流程分为三步。
第一步,任务生成。给定一份API规范文档,LLM首先自主生成可以用这些API解决的任务,涵盖信息检索、状态变更等多种类型。
第二步,模拟执行。一个教师Agent尝试逐步解决每个任务,同时一个LLM模拟器根据任务上下文和模拟历史,实时生成合成API响应。换句话说,Agent以为自己在调用真实API,实际上它收到的响应全部来自另一个LLM的即时生成。
第三步,质量过滤。一个LLM裁判对生成的轨迹进行筛选,剔除低质量或逻辑不一致的样本,确保最终数据集的可靠性。
这听起来有些套娃:用LLM训练LLM,用LLM模拟API来生成数据再训练另一个LLM。但论文的实验结果给出了有力的回应。这套方法有效。在AppWorld和OfficeBench两个基准测试上,经过合成数据微调后的模型均取得了显著的性能提升。更值得关注的是核心结论:完全基于合成数据训练的Agent,在面对真实环境时,表现并不逊色于在真实数据上训练的Agent。
这意味着环境不再是Agent训练数据的必要条件。API规范文档本身,就包含了足够的信息让LLM脑补出一个可信的数字世界。
成本与效率的降维打击
从产业角度审视,这一方法的商业价值远不止于学术层面的论文结果。
传统方法下,每增加一个API接入,就意味着需要新的开发、新的环境搭建、新的数据采集。而苹果的方法将边际成本几乎降为零。只要有一份API规范文档,就能在几分钟内生成海量训练数据。
这让人联想到大模型训练领域的一个经典转折:当GPT-3证明了规模化可以带来涌现能力之后,整个行业的重心从精调模型转向了海量数据。如今Agent训练可能正在经历类似的范式转变,从搭环境转向脑补环境。
但风险同样不容忽视
不过,这套方法也并非没有隐忧。
最核心的问题是幻觉传播。如果LLM模拟器生成的API响应存在事实错误或逻辑不一致,这些错误会直接进入训练数据,进而被Agent模型学到。论文通过LLM裁判过滤来缓解这一问题,但裁判本身也是LLM,其判断能力并非完美。
其次,模拟器生成的API响应是否足够真实?在简单API场景中,LLM模拟可能够用。但当API逻辑复杂、状态依赖性强、需要多步连锁调用时,LLM能否始终生成一致且合理的响应序列?论文在AppWorld和OfficeBench上的验证给出了正面信号,但这两个基准覆盖的API类型毕竟有限。
此外,安全性也是潜在挑战。当Agent完全在脑补环境中训练,它可能学到一些在模拟环境中有效但在真实世界中危险的行为模式。例如,Agent可能学会了忽略某些API的权限限制,因为模拟器忘记模拟这些限制。
重新定义训练数据的成本结构
苹果这篇论文的价值,不仅仅在于提出了一个更高效的Agent训练数据生产方法。它更深远的意义在于,重新定义了训练数据的获取成本结构。
在Agent商业化的赛道上,谁拥有更高效的数据生产工具,谁就能以更低的成本训练出更强的Agent。对于开发者而言,这个消息同样值得关注。未来,或许只需要一份API文档,就能在几分钟内为任意API生态生成定制化的Agent训练数据集。从SaaS工具到企业软件,从云服务到IoT设备,每个API都可能变成Agent的训练场。
但硬币的另一面是:Agent训练的门槛在被大幅降低的同时,质量把控的责任也变得更加集中。当数据生成过程本身完全依赖LLM,模型偏差、幻觉、安全漏洞都可能在训练数据生产这一环节就被系统性注入。
训练Agent的终极环境,或许从来不在真实世界中,而在LLM能够想象出的那个世界里。但问题是,当Agent只见过想象中的世界,它还能在真实世界里生存吗?






快报