NVIDIA Nemotron 3.5 Lightning 與 NeMo Switchyard 實現更快速、更智慧、更高效的 Agentic AI

@nvidia
英語2026年8月11日
118K
897
137
95
108

TL;DR

NVIDIA 已推出 30B 參數的 MoE 模型 Nemotron 3.5 Lightning,以及用於 AI Agents 智慧模型路由的開源函式庫 NeMo Switchyard。

全新的輕量級開源模型與路由函式庫,讓你在邊緣裝置、PC、工作站、資料中心與雲端環境中,對 AI、資料與工作流程擁有更大的掌控力。

來源:NVIDIA 部落格

作者:Kari Briski,NVIDIA 生成式 AI 副總裁

隨著 AI 從聊天機器人演進為自主 Agent,開源模型正滿足市場對於完全掌控 AI 執行位置、部署方式與演進方向的需求。

今日,NVIDIA 宣布擴充 Nemotron 3 模型系列,推出 Nemotron 3.5 Lightning——同級產品中效率最高、專為長時間運行的 Agent 式 AI 工作負載所設計的模型。此次發布緊接在 Nemotron 3 Nano 之後,展現了 NVIDIA 持續改善開源模型以提升準確度與速度的承諾。

Nemotron 3.5 Lightning 專為大型多 Agent 系統中的特定任務而打造,是擁有 300 億參數的混合專家模型,有助於建立更智慧、更高效的 Agent 應用程式。

此外,NVIDIA 也發布了 NeMo Switchyard——一個可在熱門 Agent 工具中實現智慧路由的開源函式庫。企業可以根據自身需求打造專屬路由器。部署後,NeMo Switchyard 能智慧地將每個請求導向最強大、最適合該任務的模型,且開發者無需改寫應用程式。

透過 Nemotron 3.5 Lightning 與 NeMo Switchyard 的結合,企業將能更全面地掌控 AI 的部署方式、執行位置與運行效率——無論是在 PC、工作站、資料中心還是雲端環境。

NVIDIA - inline image

圖 1. Nemotron 3.5 Lightning 以小巧、可自訂的開源模型形式,提供前沿等級的智慧能力,專為高流量的 Agent 工作流程而設計。

常駐 Agent 需要一個模型系統

現代的 Agent 系統——也就是常駐 Agent——越來越常以模型系統(即模型集成)的形式運作,由不同模型分別專精於不同任務。

NVIDIA Nemotron 開源模型正是為此架構而設計。像 Nemotron 3 Ultra 或 GPT-5.6 這類前沿推理模型可以規劃與編排工作流程,而 Nemotron 3.5 Lightning 等較小型的專業模型則能執行程式碼審查、工具使用、安全警報監控與帳單問題回覆等特定任務。

以 Nemotron 3.5 Lightning 驅動高流量的專業任務

NVIDIA Nemotron 3.5 Lightning 是一款完全可自訂的開源模型,專為驅動常駐 Agent 的高流量任務而打造。此模型由 Nemotron Coalition 成員共同貢獻開發,成員們提供了評估方法、推論軟體與資料集,協助推動模型的進展。

此模型的輸出速度最高提升 4 倍,與同級其他模型相比,Agent 任務完成速度加快 30%。由於它開源且可自訂,企業可以使用 NVIDIA NeMo,針對組織自身的領域資料、工具與工作流程輕鬆進行後續訓練,以提升專業任務的準確度。

NVIDIA - inline image

圖 2. PinchBench 基準測試顯示,與同級其他模型相比,Nemotron 3.5 Lightning 能以更快的速度完成 Agent 任務,同時維持前沿等級的準確度。

各產業的 AI 領導者正在針對自身工作負載客製化 Nemotron 3.5 Lightning,包括 @CrowdStrike 用於網路安全、@Harvey 攜手 @TrajectoryLabs 用於法律服務,以及 @CodeRabbitAI 搭配 @Baseten 用於程式碼審查,協助提升特定領域的 Agent 任務準確度。此外,@LilaSciences 正在協助改善物理與生命科學領域中 Agent 任務的推理能力,而 @FastinoAI 則客製化了此模型,在軟體開發、金融與醫療保健工作負載上展現領先的準確度。

NVIDIA - inline image

圖 3. 企業已透過客製化 Nemotron 3.5 Lightning,在各自的 Agent 工作流程中實現領先的專業任務準確度。

Nemotron 3.5 Lightning 也讓組織能夠掌控隱私與部署方式。它可以運行於本機 AI 系統——包括 NVIDIA RTX PCNVIDIA DGX SparkNVIDIA DGX StationNVIDIA Jetson——協助使用者最大化既有基礎設施投資,也能擴展至邊緣 AI 裝置、NVIDIA RTX PRO 工作站、資料中心與雲端環境,滿足企業級應用需求。此外,Nemotron 3.5 Lightning 可以在地端或內部部署環境中運行,處理需要快速回應的高流量專業任務。

此外,與每次 Nemotron 發布一樣,NVIDIA 都會公開訓練資料與技術,以實現可追溯性、稽核以及其他模型的訓練。伴隨 Nemotron 3.5 Lightning,NVIDIA 同步發布了兩個用於後續訓練的全新開源強化學習資料集:Nemotron-RL-Agentic-Terminal-Pivot(一個 Agent 程式碼環境)與 Nemotron-RL-Lighting-Training-Blend(一個更廣泛的 RL 資料混合集,建構於先前隨 Nemotron Ultra 發布的資料之上)。

透過模型路由打造更高效的 AI 應用程式

有些模型擅長程式編寫,有些擅長推理,有些適合輕量任務,還有些則針對本機運行進行最佳化以提升隱私與效率。如果客戶只依賴單一預設模型,可能會造成成本超支或品質損失;如果手動管理路由,則會增加整合工作量,拖慢部署進度。

NVIDIA NeMo Switchyard 是一個專為 AI Agent 設計的開源模型路由函式庫。這項技術會根據具體需求,自動將提示詞路由到 Agent 工作流程中每個步驟最強大且最有效率的模型。Agent 應用程式開發者可以調整或修改路由器,採用不同的路由演算法來符合自身優先考量,例如品質、延遲與成本要求。在模型系統中,企業可以建立效能強大、tokenomics 更優的 AI Agent。

內部基準測試顯示,NeMo Switchyard 在維持前沿等級準確度的同時,能將任務完成成本降至僅使用 Opus 4.8 時的三分之一左右。

NVIDIA - inline image

圖 4. NVIDIA 內部基準測試顯示,NeMo Switchyard 在維持前沿等級準確度的同時,能將任務完成成本降至僅使用 Opus 4.8 時的三分之一左右。

NVIDIA 正與 AI 生態系統中的合作夥伴攜手,將智慧模型路由導入開發者日常使用的工具與平台。

  • @Boomi在五項路由能力上評估 Switchyard,達成 100% 的領域路由準確度,將 59% 的流量導向速度快 5 倍的微調模型,並將後續輪次的延遲降低了 21%。
  • @Cadence:在形式驗證應用場景中使用 ChipStack AI Super Agent,效率提升了 9.9%。
  • @Classmethod:內部使用 NeMo Switchyard 運行 opencode 與 Fireworks 工作負載,初步測試顯示在維持品質的同時成本降低了 27%。
  • @Cognition:已將 NVIDIA NeMo Switchyard 的分階段路由器整合至 Devin Desktop 供 NVIDIA 內部使用,在 FrontierCode Main 上達成接近前沿的效能,同時與將所有請求路由至單一基礎前沿模型相比,平均成本降低了 28%。
  • @Kong:透過 Kong AI Gateway 原生提供 NeMo Switchyard 路由功能。
  • @LangChain:使用 NeMo Switchyard 後,在 145 個多輪 Deep Agents 任務中僅將 7% 的呼叫路由至前沿模型,成本降低了 74%,準確度僅犧牲 6%。
  • @LiteLLM:正在將 NeMo Switchyard 作為外掛程式整合至其代理層,讓開發者無需變更現有技術堆疊即可享受這些優勢。
  • @NousResearch:已將 NeMo Switchyard 整合至 Hermes,為開發者提供易於設定的路由系統,以提升 Agent 效率。
  • @TryRamp:在 Ramp SWE-Bench 中使用 NeMo Switchyard,達到與前沿模型相當的效能,同時成本降低 58%、運行時間縮短 33%。
  • @Siemens:正在進行基準測試,以提升其 Fuse EDA AI Agent 的效率。

Nemotron 3.5 Lightning 已於 Hugging FaceModelScopeOpenRouterbuild.nvidia.com 以 NVIDIA NIM 微服務形式提供,並可透過 NVIDIA Cloud Partners、後續訓練平台、推論平台與雲端服務供應商的廣泛生態系統取得。NeMo Switchyard 已於 GitHub 上發布,並即將登陸合作夥伴平台。

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章