全新的輕量級開源模型與路由函式庫,讓你在邊緣裝置、PC、工作站、資料中心與雲端環境中,對 AI、資料與工作流程擁有更大的掌控力。
來源:NVIDIA 部落格
作者:Kari Briski,NVIDIA 生成式 AI 副總裁
隨著 AI 從聊天機器人演進為自主 Agent,開源模型正滿足市場對於完全掌控 AI 執行位置、部署方式與演進方向的需求。
今日,NVIDIA 宣布擴充 Nemotron 3 模型系列,推出 Nemotron 3.5 Lightning——同級產品中效率最高、專為長時間運行的 Agent 式 AI 工作負載所設計的模型。此次發布緊接在 Nemotron 3 Nano 之後,展現了 NVIDIA 持續改善開源模型以提升準確度與速度的承諾。
Nemotron 3.5 Lightning 專為大型多 Agent 系統中的特定任務而打造,是擁有 300 億參數的混合專家模型,有助於建立更智慧、更高效的 Agent 應用程式。
此外,NVIDIA 也發布了 NeMo Switchyard——一個可在熱門 Agent 工具中實現智慧路由的開源函式庫。企業可以根據自身需求打造專屬路由器。部署後,NeMo Switchyard 能智慧地將每個請求導向最強大、最適合該任務的模型,且開發者無需改寫應用程式。
透過 Nemotron 3.5 Lightning 與 NeMo Switchyard 的結合,企業將能更全面地掌控 AI 的部署方式、執行位置與運行效率——無論是在 PC、工作站、資料中心還是雲端環境。

圖 1. Nemotron 3.5 Lightning 以小巧、可自訂的開源模型形式,提供前沿等級的智慧能力,專為高流量的 Agent 工作流程而設計。
常駐 Agent 需要一個模型系統
現代的 Agent 系統——也就是常駐 Agent——越來越常以模型系統(即模型集成)的形式運作,由不同模型分別專精於不同任務。
NVIDIA Nemotron 開源模型正是為此架構而設計。像 Nemotron 3 Ultra 或 GPT-5.6 這類前沿推理模型可以規劃與編排工作流程,而 Nemotron 3.5 Lightning 等較小型的專業模型則能執行程式碼審查、工具使用、安全警報監控與帳單問題回覆等特定任務。
以 Nemotron 3.5 Lightning 驅動高流量的專業任務
NVIDIA Nemotron 3.5 Lightning 是一款完全可自訂的開源模型,專為驅動常駐 Agent 的高流量任務而打造。此模型由 Nemotron Coalition 成員共同貢獻開發,成員們提供了評估方法、推論軟體與資料集,協助推動模型的進展。
此模型的輸出速度最高提升 4 倍,與同級其他模型相比,Agent 任務完成速度加快 30%。由於它開源且可自訂,企業可以使用 NVIDIA NeMo,針對組織自身的領域資料、工具與工作流程輕鬆進行後續訓練,以提升專業任務的準確度。

圖 2. PinchBench 基準測試顯示,與同級其他模型相比,Nemotron 3.5 Lightning 能以更快的速度完成 Agent 任務,同時維持前沿等級的準確度。
各產業的 AI 領導者正在針對自身工作負載客製化 Nemotron 3.5 Lightning,包括 @CrowdStrike 用於網路安全、@Harvey 攜手 @TrajectoryLabs 用於法律服務,以及 @CodeRabbitAI 搭配 @Baseten 用於程式碼審查,協助提升特定領域的 Agent 任務準確度。此外,@LilaSciences 正在協助改善物理與生命科學領域中 Agent 任務的推理能力,而 @FastinoAI 則客製化了此模型,在軟體開發、金融與醫療保健工作負載上展現領先的準確度。

圖 3. 企業已透過客製化 Nemotron 3.5 Lightning,在各自的 Agent 工作流程中實現領先的專業任務準確度。
Nemotron 3.5 Lightning 也讓組織能夠掌控隱私與部署方式。它可以運行於本機 AI 系統——包括 NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station 與 NVIDIA Jetson——協助使用者最大化既有基礎設施投資,也能擴展至邊緣 AI 裝置、NVIDIA RTX PRO 工作站、資料中心與雲端環境,滿足企業級應用需求。此外,Nemotron 3.5 Lightning 可以在地端或內部部署環境中運行,處理需要快速回應的高流量專業任務。
此外,與每次 Nemotron 發布一樣,NVIDIA 都會公開訓練資料與技術,以實現可追溯性、稽核以及其他模型的訓練。伴隨 Nemotron 3.5 Lightning,NVIDIA 同步發布了兩個用於後續訓練的全新開源強化學習資料集:Nemotron-RL-Agentic-Terminal-Pivot(一個 Agent 程式碼環境)與 Nemotron-RL-Lighting-Training-Blend(一個更廣泛的 RL 資料混合集,建構於先前隨 Nemotron Ultra 發布的資料之上)。
透過模型路由打造更高效的 AI 應用程式
有些模型擅長程式編寫,有些擅長推理,有些適合輕量任務,還有些則針對本機運行進行最佳化以提升隱私與效率。如果客戶只依賴單一預設模型,可能會造成成本超支或品質損失;如果手動管理路由,則會增加整合工作量,拖慢部署進度。
NVIDIA NeMo Switchyard 是一個專為 AI Agent 設計的開源模型路由函式庫。這項技術會根據具體需求,自動將提示詞路由到 Agent 工作流程中每個步驟最強大且最有效率的模型。Agent 應用程式開發者可以調整或修改路由器,採用不同的路由演算法來符合自身優先考量,例如品質、延遲與成本要求。在模型系統中,企業可以建立效能強大、tokenomics 更優的 AI Agent。
內部基準測試顯示,NeMo Switchyard 在維持前沿等級準確度的同時,能將任務完成成本降至僅使用 Opus 4.8 時的三分之一左右。

圖 4. NVIDIA 內部基準測試顯示,NeMo Switchyard 在維持前沿等級準確度的同時,能將任務完成成本降至僅使用 Opus 4.8 時的三分之一左右。
NVIDIA 正與 AI 生態系統中的合作夥伴攜手,將智慧模型路由導入開發者日常使用的工具與平台。
- @Boomi:在五項路由能力上評估 Switchyard,達成 100% 的領域路由準確度,將 59% 的流量導向速度快 5 倍的微調模型,並將後續輪次的延遲降低了 21%。
- @Cadence:在形式驗證應用場景中使用 ChipStack AI Super Agent,效率提升了 9.9%。
- @Classmethod:內部使用 NeMo Switchyard 運行 opencode 與 Fireworks 工作負載,初步測試顯示在維持品質的同時成本降低了 27%。
- @Cognition:已將 NVIDIA NeMo Switchyard 的分階段路由器整合至 Devin Desktop 供 NVIDIA 內部使用,在 FrontierCode Main 上達成接近前沿的效能,同時與將所有請求路由至單一基礎前沿模型相比,平均成本降低了 28%。
- @Kong:透過 Kong AI Gateway 原生提供 NeMo Switchyard 路由功能。
- @LangChain:使用 NeMo Switchyard 後,在 145 個多輪 Deep Agents 任務中僅將 7% 的呼叫路由至前沿模型,成本降低了 74%,準確度僅犧牲 6%。
- @LiteLLM:正在將 NeMo Switchyard 作為外掛程式整合至其代理層,讓開發者無需變更現有技術堆疊即可享受這些優勢。
- @NousResearch:已將 NeMo Switchyard 整合至 Hermes,為開發者提供易於設定的路由系統,以提升 Agent 效率。
- @TryRamp:在 Ramp SWE-Bench 中使用 NeMo Switchyard,達到與前沿模型相當的效能,同時成本降低 58%、運行時間縮短 33%。
- @Siemens:正在進行基準測試,以提升其 Fuse EDA AI Agent 的效率。
Nemotron 3.5 Lightning 已於 Hugging Face、ModelScope、OpenRouter 與 build.nvidia.com 以 NVIDIA NIM 微服務形式提供,並可透過 NVIDIA Cloud Partners、後續訓練平台、推論平台與雲端服務供應商的廣泛生態系統取得。NeMo Switchyard 已於 GitHub 上發布,並即將登陸合作夥伴平台。





