从卖芯片到卖整个AI工作流:英伟达发布Nemotron 3.5与模型路由器

AGI
输出快4倍,任务提速30%。英伟达新模型Nemotron 3.5给企业AI补上“调度层”。

企业选模型的标准正在从“哪个最强”转向“哪个够用、哪个快、哪个划算”。当AI智能体成为企业应用的标配,它们承担的任务从成批的简单小任务,一路延伸到需要跨深度知识领域的复杂推理。前者交给能快速处理批量小任务的轻量模型即可,后者才需要高智能、强推理的前沿模型。

问题已经不再是谁的算力更强,而是哪一个任务该交给哪一个模型。

英伟达今天的两个发布,是对这条逻辑的直接回应。

它推出了一款高度可定制、主打高效率的新模型Nemotron 3.5 Lightning,以及一个名为NeMo Switchyard的智能体模型路由器。前者补上“执行型”模型的位置,后者则解决“模型足够多之后,谁来调度”的问题。

一款为“执行”而生的轻模型

Nemotron 3.5 Lightning是一个总参数约300亿的混合专家模型,单次推理只激活约30亿参数。英伟达称,相比同类模型,它的输出速度最高提升约4倍,智能体任务完成速度提升约30%。

它的定位不是取代最强的前沿模型,而是成为多智能体系统里的“执行型”模型。在一个复杂的企业AI系统里,大模型负责任务规划和复杂推理,Lightning则承担大量代码审查、安全监控、数据处理、告警分析这类专业化工作。混合专家架构的价值正在于此,总参数不小,但每次推理只激活其中一小部分,单次token计算成本随之下降。

这里需要厘清一个落差,输出快4倍,并不意味着整个任务能快4倍。

模型推理只是智能体工作流的一环,工具调用、API响应、多智能体之间的任务编排都会形成新的瓶颈,实际任务提速被压缩到约30%。这也是英伟达在同一个节点端出Switchyard的原因,只解决“单个模型跑得快”远远不够,还要解决“每一步该用哪个模型”。

第三方评测机构Artificial Analysis的数据印证了Lightning的执行能力。它的Intelligence Index得分为24,比上一代小尺寸型号Nemotron 3 Nano高出9分,与OpenAI的gpt-oss-120b相当,仅落后于规模约为其4倍的Nemotron 3 Super 2分。在代理任务相关的GDPval-AA v2评测上,它的Elo达到824,超越Nemotron 3 Super和gpt-oss-120b;在Terminal-Bench v2.1上拿到24%的成绩,而Nemotron 3 Nano只有7%。在预发布测试中,其输出速度接近每秒670个token。

模型足够多之后,路由成为新软件层

Lightning的另一重差异化在于它开放且易于定制。企业可以在自己的硬件上,用NeMo针对专有领域数据、工具和工作流进行二次训练。

“我们听到的是,Lightning极易定制。”英伟达生成式AI副总裁Kari Briski说。据她介绍,CodeRabbit用英伟达的标准模型配方训练了一个epoch,约两小时、花85美元就产出了一个路由智能体。另一个伙伴把Lightning直接放进已有的后训练栈,“无需任何改动”。还有一个公司用单张H100卡就完成了训练,另一个干脆晚上跑训练任务,早上来取结果。

“这正在把后训练和微调变成把碗放进洗碗机、然后按下启动键。”Briski说。

英伟达同时放出了它的数据集、后训练数据集,以及训练模型所用的配方和框架。开发者可以把英伟达的后训练数据与企业自有数据混在一起,做出“取两家之长”的混合模型。“这就是为什么我们看到人们很快得到很好的结果。”Briski说。

NeMo Switchyard是一个开源的模型路由库。它会考虑当前有多少模型可用、各自能力如何,在智能体工作流的每一步,把请求路由到当时最合适、最高效的模型。开发者可以根据质量、延迟、成本等优先级,自定义路由策略。

对未来的多智能体系统而言,真正重要的或许已经不是“哪个模型最好”,而是哪个任务该由哪个模型完成。企业不必让每一个任务都用最贵的模型。英伟达与Boomi、Cadence Design Systems、Classmethod、Cognition、Kong、Langchain、Nous Research、Siemens等一批生态伙伴合作,把智能路由接入开发者已在使用的工具。

把Lightning和Switchyard放在一起看,英伟达的判断清晰可见,随着模型数量越来越多,模型之间的调度和协同会成为新的软件层。

从Nemotron 4到与OpenAI的微妙关系

这两次发布只是英伟达开源模型战略的局部。Nemotron 3家族去年12月推出,当时有三个尺寸,Nano、Super、Ultra。据The Information报道,英伟达正在开发下一代Nemotron 4,目标参数量至少1万亿,约为其现有最大模型Nemotron 3 Ultra的两倍,旨在与全球顶尖开源模型比肩。

它还组建了一个包含Reflection、Cursor、Thinking Machines、Mistral等在内的“Nemotron联盟”,多方在推进自身模型的同时,向Nemotron 4贡献训练数据、评估支持和设计方案。

这背后是英伟达微妙的处境。其芯片需求高度集中于OpenAI、微软SpaceX等少数前沿实验室和云服务商,而英伟达已向OpenAI投资300亿美元;另一边,Nemotron 4恰恰定位为企业提供成本更低的替代方案,与这些前沿实验室形成竞争。它一边给客户供芯片,一边下场造模型,边界正在变得模糊。

不过对英伟达而言,这未必是零和游戏。AI模型评测机构Arena的首席执行官Anastasios Angelopoulos的一句话点破逻辑,“无论哪家公司做出优秀的开源模型,英伟达都是赢家。”开源生态越繁荣、参与主体越多元,GPU的整体需求就越旺盛。

英伟达的角色正在从卖芯片的,变成卖整个AI工作流的。只要模型跑在英伟达的路由、推理和部署体系里,无论企业最终选择谁的模型,它都能从整个工作流中获得价值。这才是Switchyard与Nemotron 3.5放在一起发布的真正含义。(本文首发钛媒体APP,作者 | 硅谷Tech_news,编辑 | 秦聪慧) 

作品声明:内容由AI生成
本文系作者 硅谷Tech news 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

登录后输入评论内容

扫描下载App