NVIDIA Nemotron 3.5 Lightning 与 NeMo Switchyard 助力实现更快、更智能、更高效的 Agentic AI

@nvidia
英语2026年8月11日
118K
897
137
95
108

TL;DR

NVIDIA 推出了 30B 参数的 MoE 模型 Nemotron 3.5 Lightning,以及用于 AI Agents 智能模型路由的开源库 NeMo Switchyard。

全新的轻量级开源模型与路由库,让用户对 AI、数据和工作流拥有更强的控制力——覆盖边缘设备、PC、工作站、数据中心和云端。

来源:NVIDIA 博客

作者:[Kari Briski](https://www.linkedin.com/in/karibriski/),NVIDIA 生成式 AI 副总裁

随着 AI 从聊天机器人演进为自主 Agent,开源模型正在满足市场对 AI 运行位置、部署方式及演进方式的全面控制需求。

今天,NVIDIA 扩展了 Nemotron 3 模型家族,推出 Nemotron 3.5 Lightning——同类中面向长时间运行 Agent 式 AI 工作负载效率最高的模型。该版本紧随 Nemotron 3 Nano 发布,体现了 NVIDIA 持续改进开源模型、追求更高精度与速度的承诺。

Nemotron 3.5 Lightning 专为大型多 Agent 系统中的专业化任务而设计,是一个拥有 300 亿参数的混合专家模型,有助于打造更智能、更高效的 Agent 应用。

此外,NVIDIA 还发布了 NeMo Switchyard——一个在主流 Agent 工具中实现智能路由的开源库。企业可以基于自身需求构建路由器。部署后,NeMo Switchyard 能够智能地将每个请求引导至最能胜任且最合适的模型,而无需开发者重写应用程序。

Nemotron 3.5 Lightning 与 NeMo Switchyard 携手,让用户对 AI 的部署方式、运行位置和运行效率拥有更强的控制力——覆盖 PC、工作站、数据中心和云端。

NVIDIA - inline image

图 1:Nemotron 3.5 Lightning 以小巧、可定制的开源模型形态提供前沿级智能,专为高吞吐量的 Agent 工作流而打造。

常驻 Agent 需要模型系统

现代 Agent 系统——也就是常驻 Agent——越来越多地以模型系统(即模型集成)的方式运行,不同模型分别专攻不同任务。

NVIDIA Nemotron 开源模型正是为这种架构而设计。像 Nemotron 3 Ultra 或 GPT-5.6 这样的前沿推理模型可以负责规划与编排工作流,而 Nemotron 3.5 Lightning 等更小的专业模型则可以执行代码审查、工具调用、安全告警监控和账单问题解答等定向任务。

以 Nemotron 3.5 Lightning 驱动大规模专业化任务

NVIDIA Nemotron 3.5 Lightning 是一款完全可定制的开源模型,专为支撑常驻 Agent 的大规模任务而打造。该模型的开发凝聚了 Nemotron Coalition 的贡献,其成员提供了评估方法、推理软件和数据集,共同推动模型进步。

与同类模型相比,该模型的输出速度最高提升 4 倍,Agent 任务完成速度提升 30%。同时,得益于开源且可定制的特性,Nemotron 3.5 Lightning 可以使用 NVIDIA NeMo 在企业的自有领域数据、工具和工作流上进行轻松的后训练,从而提高专业化任务的准确性。

NVIDIA - inline image

图 2:PinchBench 基准评测显示,与同类模型相比,Nemotron 3.5 Lightning 能以更快的速度完成 Agent 任务,同时保持前沿级准确性。

来自各行各业的 AI 领导者正在针对自身工作负载定制 Nemotron 3.5 Lightning,包括 @CrowdStrike 用于网络安全、@Harvey@TrajectoryLabs 合作用于法律服务、@CodeRabbitAI@Baseten 合作用于代码审查,助力提升特定领域 Agent 任务的准确性。此外,@LilaSciences 正在帮助提升物理与生命科学领域 Agent 任务的推理能力,@FastinoAI 则对模型进行了定制,在软件开发、金融和医疗健康工作负载上取得了领先的准确性。

NVIDIA - inline image

图 3:企业已定制 Nemotron 3.5 Lightning,在其 Agent 工作流中为专业化任务实现了领先的准确性。

Nemotron 3.5 Lightning 还让组织能够掌控隐私与部署方式。它可以在本地 AI 系统上运行——包括 NVIDIA RTX PCNVIDIA DGX SparkNVIDIA DGX StationNVIDIA Jetson——帮助用户最大化现有基础设施投资,也可以扩展至边缘 AI 设备、NVIDIA RTX PRO 工作站、数据中心和云环境,满足企业级应用场景。此外,对于需要快速响应的大规模专业化任务,Nemotron 3.5 Lightning 可以在本地或私有化环境中运行。

同时,与历次 Nemotron 发布一样,NVIDIA 也公开了训练数据与技术,支持可追溯性、可审计性,并可用于训练其他模型。随 Nemotron 3.5 Lightning 一同发布的还有两个用于其后训练的全新开源强化学习数据集:Nemotron-RL-Agentic-Terminal-Pivot(一个 Agent 代码环境)和 Nemotron-RL-Lighting-Training-Blend(一个更广泛的 RL 数据混合集,基于此前随 Nemotron Ultra 发布的数据构建)。

通过模型路由打造更高效的 AI 应用

有些模型擅长编程,有些擅长推理,有些适合轻量级任务,还有些针对本地运行进行了优化,以提升隐私性和效率。如果客户只依赖一个默认模型,要么会超支,要么会损失质量;如果手动管理路由,又会产生大量集成工作,拖慢部署进度。

NVIDIA NeMo Switchyard 是一个面向 AI Agent 的开源模型路由库。该技术能够根据具体需求,自动将提示词路由到 Agent 工作流每一步中能力最强、效率最高的模型。Agent 应用开发者可以通过不同的路由算法调整或修改路由器,以匹配质量、延迟和成本等优先级需求。在模型系统中,企业可以打造强大的 AI Agent,并获得更优的 Token 经济性。

内部基准测试显示,NeMo Switchyard 在保持前沿级准确性的同时,将任务完成成本降低到仅使用 Opus 4.8 时的近三分之一。

NVIDIA - inline image

图 4:NVIDIA 内部基准测试显示,NeMo Switchyard 在保持前沿级准确性的同时,将任务完成成本降低到仅使用 Opus 4.8 时的近三分之一。

NVIDIA 正在与 AI 生态中的合作伙伴携手,将智能模型路由引入开发者已经在使用的工具和平台。

  • @Boomi:在五项路由能力上对 Switchyard 进行了评估,实现了 100% 的领域路由准确率,将 59% 的流量发送至速度快 5 倍的微调模型,并将后续轮次延迟降低了 21%。
  • @Cadence:在形式验证用例中使用 ChipStack AI Super Agent,效率提升了 9.9%。
  • @Classmethod:在内部使用 NeMo Switchyard 运行 opencode 和 Fireworks 工作负载,初步测试显示成本降低了 27%,同时质量保持不变。
  • @Cognition:已将 NVIDIA NeMo Switchyard 分阶段路由器集成到 Devin Desktop 中供 NVIDIA 内部使用,在 FrontierCode Main 上取得了接近前沿水平的性能,同时相比将所有请求路由到单一底层前沿模型,平均成本降低了 28%。
  • @Kong:通过 Kong AI Gateway 原生提供 NeMo Switchyard 路由能力。
  • @LangChain:借助 NeMo Switchyard,在 145 个多轮 Deep Agents 任务中仅将 7% 的调用路由到前沿模型,就实现了 74% 的成本降低,准确率折损 6%。
  • @LiteLLM:正在将 NeMo Switchyard 作为插件集成到其代理层中,让开发者无需更换现有技术栈即可享受这些优势。
  • @NousResearch:已将 NeMo Switchyard 集成到 Hermes 中,为开发者提供易于配置的路由系统,提升 Agent 效率。
  • @TryRamp:在 Ramp SWE-Bench 中使用 NeMo Switchyard,在匹配前沿模型性能的同时,将成本降低了 58%,运行时间缩短了 33%。
  • @Siemens:正在对其 Fuse EDA AI Agent 进行基准测试,以提升效率。

Nemotron 3.5 Lightning 可在 Hugging FaceModelScopeOpenRouterbuild.nvidia.com 上以 NVIDIA NIM 微服务的形式获取,也可通过 NVIDIA 云合作伙伴、后训练平台、推理平台和云服务提供商组成的广泛生态获取。NeMo Switchyard 可在 GitHub 上获取,并将很快登陆合作伙伴平台。

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章