NVIDIA Nemotron 3.5 Lightning 및 NeMo Switchyard로 더 빠르고 스마트하며 효율적인 에이전트형 AI 구현

@nvidia
영어2026년 8월 11일
118K
897
137
95
108

TL;DR

NVIDIA는 30B 파라미터 MoE 모델인 Nemotron 3.5 Lightning과 AI 에이전트의 지능형 모델 라우팅을 위한 오픈 소스 라이브러리인 NeMo Switchyard를 출시했습니다.

새로운 경량 오픈 모델과 라우팅 라이브러리는 엣지 디바이스, PC, 워크스테이션, 데이터 센터, 클라우드 전반에서 AI, 데이터, 워크플로우에 대한 더 큰 제어력을 제공합니다.

출처: NVIDIA 블로그

글: Kari Briski, NVIDIA 생성형 AI 부문 부사장

AI가 챗봇에서 자율 에이전트로 전환됨에 따라, 오픈 모델은 AI가 실행되는 위치와 배포 및 발전 방식을 완전히 제어하려는 시장의 수요를 충족하고 있습니다.

오늘 NVIDIA는 장기 실행 에이전트형 AI 워크로드에 최적화된 동급 최고 효율 모델인 Nemotron 3.5 Lightning으로 Nemotron 3 모델 제품군을 확장합니다.

이번 출시는 Nemotron 3 Nano에 이은 것으로, 정확도와 속도 향상을 위해 오픈 모델을 지속적으로 개선하려는 NVIDIA의 의지를 반영합니다.

대규모 멀티 에이전트 시스템 내 특화 작업을 위해 설계된 Nemotron 3.5 Lightning은 300억 파라미터의 혼합 전문가(MoE) 모델로, 더 스마트하고 효율적인 에이전트형 애플리케이션을 만드는 데 도움을 줍니다.

또한 NVIDIA는 널리 사용되는 에이전트 도구 내 스마트 라우팅을 위한 오픈소스 라이브러리인 NeMo Switchyard를 출시합니다.

기업은 NeMo Switchyard를 사용하여 자체 요구 사항에 맞는 라우터를 구축할 수 있습니다.

배포 시 NeMo Switchyard는 개발자가 애플리케이션을 다시 작성할 필요 없이 각 요청을 해당 작업에 가장 적합한 모델로 지능적으로 라우팅합니다.

Nemotron 3.5 Lightning과 NeMo Switchyard는 함께 PC, 워크스테이션, 데이터 센터, 클라우드 전반에서 AI의 배포 방식, 실행 위치, 운영 효율성에 대한 더 큰 제어력을 제공합니다.

NVIDIA - inline image

그림 1. Nemotron 3.5 Lightning은 대규모 에이전트 워크플로우를 위해 설계된 소형의 맞춤화 가능한 오픈 모델에서 프론티어 수준의 지능을 제공합니다.

상시 가동 에이전트에는 모델 시스템이 필요합니다

현대의 에이전트 시스템(상시 가동 에이전트)은 점점 더 모델 시스템, 즉 모델 앙상블로 운영되며, 각 모델은 서로 다른 작업에 특화되어 있습니다.

NVIDIA Nemotron 오픈 모델은 이러한 아키텍처를 위해 설계되었습니다.

Nemotron 3 Ultra 또는 GPT-5.6과 같은 프론티어 추론 모델은 워크플로우를 계획하고 조율하는 반면, Nemotron 3.5 Lightning과 같은 소형 특화 모델은 코드 리뷰, 도구 사용, 보안 알림 모니터링, 청구 질문 응답과 같은 특정 작업을 수행할 수 있습니다.

Nemotron 3.5 Lightning으로 대규모 특화 작업 지원

NVIDIA Nemotron 3.5 Lightning은 상시 가동 에이전트를 구동하는 대규모 작업을 위해 설계된 완전히 맞춤화 가능한 오픈 모델입니다.

이 모델은 Nemotron Coalition의 기여로 개발되었으며, 멤버들은 모델 발전을 위해 평가 방법론, 추론 소프트웨어, 데이터셋을 제공했습니다.

이 모델은 동급 모델 대비 최대 4배 빠른 출력 속도를 제공하여 에이전트 작업 완료 시간을 30% 단축합니다. 또한 오픈 모델이면서 맞춤화가 가능하므로, Nemotron 3.5 Lightning은 NVIDIA NeMo를 통해 조직의 자체 도메인 데이터, 도구, 워크플로우로 쉽게 사후 학습하여 특화 작업의 정확도를 높일 수 있습니다.

NVIDIA - inline image

그림 2. PinchBench 벤치마크는 Nemotron 3.5 Lightning이 동급 모델 대비 프론티어 수준의 정확도로 더 빠른 에이전트 작업 완료를 제공함을 보여줍니다.

다양한 업계의 AI 리더들이 자체 워크로드에 맞게 Nemotron 3.5 Lightning을 커스터마이징하고 있습니다. 사이버 보안 분야의 @CrowdStrike, 법률 서비스 분야의 @TrajectoryLabs와 협력하는 @Harvey, 코드 리뷰 분야의 @Baseten과 협력하는 @CodeRabbitAI가 도메인 특화 에이전트 작업의 정확도 향상에 기여하고 있습니다. 또한 @LilaSciences는 물리과학 및 생명과학 전반의 에이전트 작업에 대한 추론 능력 향상을 지원하고 있으며, @FastinoAI는 모델을 커스터마이징하여 소프트웨어 개발, 금융, 헬스케어 워크로드에서 선도적인 정확도를 달성하고 있습니다.

NVIDIA - inline image

그림 3. 기업들은 에이전트 워크플로우의 특화 작업에서 선도적인 정확도를 달성하기 위해 Nemotron 3.5 Lightning을 커스터마이징했습니다.

Nemotron 3.5 Lightning은 또한 조직에 프라이버시와 배포에 대한 제어권을 제공합니다. 이 모델은 NVIDIA RTX PC, NVIDIA DGX Spark, NVIDIA DGX Station, NVIDIA Jetson을 포함한 로컬 AI 시스템에서 실행할 수 있어 사용자가 기존 인프라 투자를 극대화하거나, 엔터프라이즈 사용 사례를 위해 엣지 AI 디바이스, NVIDIA RTX PRO 워크스테이션, 데이터 센터, 클라우드 환경으로 확장할 수 있습니다. 또한 Nemotron 3.5 Lightning은 빠른 응답이 필요한 대규모 특화 작업을 위해 로컬 또는 온프레미스 환경에서 실행할 수 있습니다.

또한 모든 Nemotron 출시와 마찬가지로 NVIDIA는 훈련 데이터와 기법을 공개하여 추적 가능성, 감사, 다른 모델의 훈련을 가능하게 합니다. Nemotron 3.5 Lightning과 함께 NVIDIA는 사후 학습에 사용되는 두 가지 새로운 오픈 강화 학습 데이터셋을 공개합니다. 에이전트 코드 환경인 Nemotron-RL-Agentic-Terminal-Pivot과, Nemotron Ultra와 함께 이전에 공개된 데이터를 기반으로 구축된 광범위한 RL 데이터 블렌드인 Nemotron-RL-Lighting-Training-Blend입니다.

모델 라우팅으로 더 효율적인 AI 애플리케이션 구현

어떤 모델은 코딩에 더 적합하고, 어떤 모델은 추론에, 또 어떤 모델은 경량 작업에 적합합니다. 일부 모델은 프라이버시와 효율성을 높이기 위해 로컬 실행에 최적화되어 있습니다. 고객이 단일 기본 모델에 의존하면 비용이 과다하게 지출되거나 품질이 저하될 수 있습니다. 라우팅을 수동으로 관리하면 통합 작업이 되어 배포가 지연될 수 있습니다.

NVIDIA NeMo Switchyard는 AI 에이전트를 위한 오픈소스 모델 라우팅 라이브러리입니다. 이 기술은 특정 요구 사항에 따라 에이전트 워크플로우의 각 단계를 가장 유능하고 효율적인 모델로 자동 라우팅합니다. 에이전트 애플리케이션 개발자는 품질, 지연 시간, 비용 요구 사항과 같은 우선순위에 맞게 다양한 라우팅 알고리즘으로 라우터를 튜닝하거나 수정할 수 있습니다. 모델 시스템에서 기업은 개선된 토크노믹스로 강력한 AI 에이전트를 만들 수 있습니다.

내부 벤치마크에 따르면 NeMo Switchyard는 프론티어 수준의 정확도를 유지하면서 단일 Opus 4.8 대비 작업 완료 비용을 약 3분의 1로 줄입니다.

NVIDIA - inline image

그림 4. NVIDIA 내부 벤치마크는 NeMo Switchyard가 프론티어 수준의 정확도를 유지하면서 단일 Opus 4.8 대비 작업 완료 비용을 약 3분의 1로 줄이는 것을 보여줍니다.

NVIDIA는 AI 생태계 전반의 파트너들과 협력하여 개발자들이 이미 사용하는 도구와 플랫폼에 지능형 모델 라우팅을 도입하고 있습니다.

  • @Boomi: 5가지 라우팅 기능 전반에 걸쳐 Switchyard를 평가하여 100% 도메인 라우팅 정확도를 달성하고, 트래픽의 59%를 5배 더 빠른 파인튜닝 모델로 전송하며, 후속 턴 지연 시간을 21% 줄였습니다.
  • @Cadence: 정형 검증 사용 사례에 ChipStack AI Super Agent를 적용하여 효율성을 9.9% 개선했습니다.
  • @Classmethod: 내부적으로 NeMo Switchyard를 사용하여 opencode 및 Fireworks 워크로드를 실행하고 있으며, 초기 테스트에서 품질을 유지하면서 비용을 27% 절감했습니다.
  • @Cognition: NVIDIA 내부 사용을 위해 NeMo Switchyard 스테이지드 라우터를 Devin Desktop에 통합하여, 모든 요청을 단일 기본 프론티어 모델로 라우팅할 때와 비교해 평균 비용을 28% 줄이면서 FrontierCode Main에서 프론티어에 근접한 성능을 달성했습니다.
  • @Kong: Kong AI Gateway를 통해 NeMo Switchyard 기반 라우팅을 기본 제공합니다.
  • @LangChain: NeMo Switchyard를 사용하여 145개 멀티턴 Deep Agents 작업에서 호출의 7%만 프론티어 모델로 라우팅함으로써 정확도는 6% 낮아졌지만 비용을 74% 절감했습니다.
  • @LiteLLM: 프록시 계층에 NeMo Switchyard를 플러그인으로 추가하여 개발자가 기존 스택을 변경하지 않고도 이러한 이점을 활용할 수 있게 하고 있습니다.
  • @NousResearch: 에이전트 효율성 개선을 위한 간편한 구성의 라우팅 시스템을 개발자에게 제공하기 위해 NeMo Switchyard를 Hermes에 통합했습니다.
  • @TryRamp: Ramp SWE-Bench에서 NeMo Switchyard를 사용하여 프론티어 모델과 동일한 성능을 유지하면서 비용은 58%, 런타임은 33% 절감했습니다.
  • @Siemens: Fuse EDA AI Agent의 효율성 개선을 위해 벤치마킹을 진행하고 있습니다.

Nemotron 3.5 Lightning은 Hugging Face, ModelScope, OpenRouterbuild.nvidia.com에서 NVIDIA NIM 마이크로서비스로 제공되며, 광범위한 NVIDIA 클라우드 파트너, 사후 학습 플랫폼, 추론 플랫폼, 클라우드 서비스 제공업체 에코시스템을 통해서도 이용할 수 있습니다. NeMo Switchyard는 GitHub에서 제공되며 곧 파트너 플랫폼에도 출시될 예정입니다.

YouMind에서 다시 만들기

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기