全新的轻量级开源模型与路由库,让用户对 AI、数据和工作流拥有更强的控制力——覆盖边缘设备、PC、工作站、数据中心和云端。
来源:NVIDIA 博客
作者:[Kari Briski](https://www.linkedin.com/in/karibriski/),NVIDIA 生成式 AI 副总裁
随着 AI 从聊天机器人演进为自主 Agent,开源模型正在满足市场对 AI 运行位置、部署方式及演进方式的全面控制需求。
今天,NVIDIA 扩展了 Nemotron 3 模型家族,推出 Nemotron 3.5 Lightning——同类中面向长时间运行 Agent 式 AI 工作负载效率最高的模型。该版本紧随 Nemotron 3 Nano 发布,体现了 NVIDIA 持续改进开源模型、追求更高精度与速度的承诺。
Nemotron 3.5 Lightning 专为大型多 Agent 系统中的专业化任务而设计,是一个拥有 300 亿参数的混合专家模型,有助于打造更智能、更高效的 Agent 应用。
此外,NVIDIA 还发布了 NeMo Switchyard——一个在主流 Agent 工具中实现智能路由的开源库。企业可以基于自身需求构建路由器。部署后,NeMo Switchyard 能够智能地将每个请求引导至最能胜任且最合适的模型,而无需开发者重写应用程序。
Nemotron 3.5 Lightning 与 NeMo Switchyard 携手,让用户对 AI 的部署方式、运行位置和运行效率拥有更强的控制力——覆盖 PC、工作站、数据中心和云端。

图 1:Nemotron 3.5 Lightning 以小巧、可定制的开源模型形态提供前沿级智能,专为高吞吐量的 Agent 工作流而打造。
常驻 Agent 需要模型系统
现代 Agent 系统——也就是常驻 Agent——越来越多地以模型系统(即模型集成)的方式运行,不同模型分别专攻不同任务。
NVIDIA Nemotron 开源模型正是为这种架构而设计。像 Nemotron 3 Ultra 或 GPT-5.6 这样的前沿推理模型可以负责规划与编排工作流,而 Nemotron 3.5 Lightning 等更小的专业模型则可以执行代码审查、工具调用、安全告警监控和账单问题解答等定向任务。
以 Nemotron 3.5 Lightning 驱动大规模专业化任务
NVIDIA Nemotron 3.5 Lightning 是一款完全可定制的开源模型,专为支撑常驻 Agent 的大规模任务而打造。该模型的开发凝聚了 Nemotron Coalition 的贡献,其成员提供了评估方法、推理软件和数据集,共同推动模型进步。
与同类模型相比,该模型的输出速度最高提升 4 倍,Agent 任务完成速度提升 30%。同时,得益于开源且可定制的特性,Nemotron 3.5 Lightning 可以使用 NVIDIA NeMo 在企业的自有领域数据、工具和工作流上进行轻松的后训练,从而提高专业化任务的准确性。

图 2:PinchBench 基准评测显示,与同类模型相比,Nemotron 3.5 Lightning 能以更快的速度完成 Agent 任务,同时保持前沿级准确性。
来自各行各业的 AI 领导者正在针对自身工作负载定制 Nemotron 3.5 Lightning,包括 @CrowdStrike 用于网络安全、@Harvey 与 @TrajectoryLabs 合作用于法律服务、@CodeRabbitAI 与 @Baseten 合作用于代码审查,助力提升特定领域 Agent 任务的准确性。此外,@LilaSciences 正在帮助提升物理与生命科学领域 Agent 任务的推理能力,@FastinoAI 则对模型进行了定制,在软件开发、金融和医疗健康工作负载上取得了领先的准确性。

图 3:企业已定制 Nemotron 3.5 Lightning,在其 Agent 工作流中为专业化任务实现了领先的准确性。
Nemotron 3.5 Lightning 还让组织能够掌控隐私与部署方式。它可以在本地 AI 系统上运行——包括 NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station 和 NVIDIA Jetson——帮助用户最大化现有基础设施投资,也可以扩展至边缘 AI 设备、NVIDIA RTX PRO 工作站、数据中心和云环境,满足企业级应用场景。此外,对于需要快速响应的大规模专业化任务,Nemotron 3.5 Lightning 可以在本地或私有化环境中运行。
同时,与历次 Nemotron 发布一样,NVIDIA 也公开了训练数据与技术,支持可追溯性、可审计性,并可用于训练其他模型。随 Nemotron 3.5 Lightning 一同发布的还有两个用于其后训练的全新开源强化学习数据集:Nemotron-RL-Agentic-Terminal-Pivot(一个 Agent 代码环境)和 Nemotron-RL-Lighting-Training-Blend(一个更广泛的 RL 数据混合集,基于此前随 Nemotron Ultra 发布的数据构建)。
通过模型路由打造更高效的 AI 应用
有些模型擅长编程,有些擅长推理,有些适合轻量级任务,还有些针对本地运行进行了优化,以提升隐私性和效率。如果客户只依赖一个默认模型,要么会超支,要么会损失质量;如果手动管理路由,又会产生大量集成工作,拖慢部署进度。
NVIDIA NeMo Switchyard 是一个面向 AI Agent 的开源模型路由库。该技术能够根据具体需求,自动将提示词路由到 Agent 工作流每一步中能力最强、效率最高的模型。Agent 应用开发者可以通过不同的路由算法调整或修改路由器,以匹配质量、延迟和成本等优先级需求。在模型系统中,企业可以打造强大的 AI Agent,并获得更优的 Token 经济性。
内部基准测试显示,NeMo Switchyard 在保持前沿级准确性的同时,将任务完成成本降低到仅使用 Opus 4.8 时的近三分之一。

图 4:NVIDIA 内部基准测试显示,NeMo Switchyard 在保持前沿级准确性的同时,将任务完成成本降低到仅使用 Opus 4.8 时的近三分之一。
NVIDIA 正在与 AI 生态中的合作伙伴携手,将智能模型路由引入开发者已经在使用的工具和平台。
- @Boomi:在五项路由能力上对 Switchyard 进行了评估,实现了 100% 的领域路由准确率,将 59% 的流量发送至速度快 5 倍的微调模型,并将后续轮次延迟降低了 21%。
- @Cadence:在形式验证用例中使用 ChipStack AI Super Agent,效率提升了 9.9%。
- @Classmethod:在内部使用 NeMo Switchyard 运行 opencode 和 Fireworks 工作负载,初步测试显示成本降低了 27%,同时质量保持不变。
- @Cognition:已将 NVIDIA NeMo Switchyard 分阶段路由器集成到 Devin Desktop 中供 NVIDIA 内部使用,在 FrontierCode Main 上取得了接近前沿水平的性能,同时相比将所有请求路由到单一底层前沿模型,平均成本降低了 28%。
- @Kong:通过 Kong AI Gateway 原生提供 NeMo Switchyard 路由能力。
- @LangChain:借助 NeMo Switchyard,在 145 个多轮 Deep Agents 任务中仅将 7% 的调用路由到前沿模型,就实现了 74% 的成本降低,准确率折损 6%。
- @LiteLLM:正在将 NeMo Switchyard 作为插件集成到其代理层中,让开发者无需更换现有技术栈即可享受这些优势。
- @NousResearch:已将 NeMo Switchyard 集成到 Hermes 中,为开发者提供易于配置的路由系统,提升 Agent 效率。
- @TryRamp:在 Ramp SWE-Bench 中使用 NeMo Switchyard,在匹配前沿模型性能的同时,将成本降低了 58%,运行时间缩短了 33%。
- @Siemens:正在对其 Fuse EDA AI Agent 进行基准测试,以提升效率。
Nemotron 3.5 Lightning 可在 Hugging Face、ModelScope、OpenRouter 和 build.nvidia.com 上以 NVIDIA NIM 微服务的形式获取,也可通过 NVIDIA 云合作伙伴、后训练平台、推理平台和云服务提供商组成的广泛生态获取。NeMo Switchyard 可在 GitHub 上获取,并将很快登陆合作伙伴平台。





