NVIDIA Nemotron 3.5 Lightning e NeMo Switchyard entregam uma IA agentiva mais rápida, inteligente e eficiente

@nvidia
INGLÊS11/08/2026
118K
897
137
95
108

TL;DR

A NVIDIA lançou o Nemotron 3.5 Lightning, um modelo MoE de 30B de parâmetros, juntamente com o NeMo Switchyard, uma biblioteca de código aberto para roteamento inteligente de modelos em agentes de IA.

O novo modelo aberto leve e a biblioteca de roteamento oferecem maior controle sobre IA, dados e fluxos de trabalho em dispositivos de borda, PCs, estações de trabalho, data centers e nuvem.

Fonte: Blog da NVIDIA

Por Kari Briski, Vice-Presidente de IA Generativa, NVIDIA

À medida que a IA evolui de chatbots para agentes autônomos, os modelos abertos estão atendendo às demandas do mercado por controle total sobre onde a IA é executada e como ela é implantada e evolui.

Hoje, a NVIDIA está expandindo sua família de modelos Nemotron 3 com o Nemotron 3.5 Lightning, o modelo de maior eficiência em sua classe para cargas de trabalho de IA agêntica de longa duração. Este lançamento segue o Nemotron 3 Nano e reflete o compromisso da NVIDIA em melhorar continuamente os modelos abertos para maior precisão e velocidade.

Projetado para tarefas especializadas em sistemas multiagentes maiores, o Nemotron 3.5 Lightning, um modelo de mistura de especialistas com 30 bilhões de parâmetros, ajuda a criar aplicações agênticas mais inteligentes e eficientes.

Além disso, a NVIDIA está lançando o NeMo Switchyard, uma biblioteca de código aberto para roteamento inteligente em ferramentas de agentes populares. As empresas podem usá-la para criar um roteador com base em suas necessidades específicas. Quando implantado, o NeMo Switchyard pode direcionar inteligentemente cada solicitação para o modelo mais capaz e adequado para a tarefa, sem exigir que os desenvolvedores reescrevam suas aplicações.

Juntos, o Nemotron 3.5 Lightning e o NeMo Switchyard oferecem maior controle sobre como a IA é implantada, onde é executada e com que eficiência opera — em PCs, estações de trabalho, data centers e nuvem.

NVIDIA - inline image

Figura 1. O Nemotron 3.5 Lightning oferece inteligência de nível de fronteira em um modelo aberto pequeno e personalizável, projetado para fluxos de trabalho agênticos de alto volume.

Agentes Sempre Ativos Precisam de um Sistema de Modelos

Sistemas agênticos modernos — agentes sempre ativos — operam cada vez mais como sistemas de modelos, ou conjuntos de modelos, com diferentes modelos especializados em diferentes tarefas.

Os modelos abertos NVIDIA Nemotron são projetados para essa arquitetura. Um modelo de raciocínio de fronteira, como o Nemotron 3 Ultra ou o GPT-5.6, pode planejar e orquestrar um fluxo de trabalho, enquanto modelos especializados menores, como o Nemotron 3.5 Lightning, podem executar tarefas específicas, como revisão de código, uso de ferramentas, monitoramento de alertas de segurança e resposta a perguntas sobre faturamento.

Impulsionando Tarefas Especializadas de Alto Volume com o Nemotron 3.5 Lightning

O NVIDIA Nemotron 3.5 Lightning é um modelo aberto totalmente personalizável, projetado para tarefas de alto volume que alimentam agentes sempre ativos. Ele foi desenvolvido com contribuições da Nemotron Coalition, cujos membros forneceram metodologias de avaliação, software de inferência e conjuntos de dados para ajudar a avançar o modelo.

O modelo oferece até 4x mais velocidade de saída, resultando em conclusão de tarefas agênticas 30% mais rápida em comparação com outros modelos de sua classe. E, por ser aberto e personalizável, o Nemotron 3.5 Lightning pode ser facilmente pós-treinado com o NVIDIA NeMo nos dados, ferramentas e fluxos de trabalho próprios de uma organização para melhorar a precisão em tarefas especializadas.

NVIDIA - inline image

Figura 2. Os benchmarks PinchBench demonstram que o Nemotron 3.5 Lightning oferece conclusão de tarefas agênticas mais rápida com precisão de nível de fronteira em comparação com outros modelos de sua classe.

Líderes de IA de diversos setores estão personalizando o Nemotron 3.5 Lightning para suas cargas de trabalho, incluindo @CrowdStrike para cibersegurança, @Harvey com @TrajectoryLabs para serviços jurídicos e @CodeRabbitAI com @Baseten para revisão de código, ajudando a melhorar a precisão em tarefas agênticas específicas de cada domínio. Além disso, a @LilaSciences está ajudando a melhorar as capacidades de raciocínio para tarefas agênticas nas ciências físicas e da vida, e a @FastinoAI personalizou o modelo e está obtendo precisões líderes para cargas de trabalho de desenvolvimento de software, finanças e saúde.

NVIDIA - inline image

Figura 3. Empresas personalizaram o Nemotron 3.5 Lightning para alcançar precisão líder em suas tarefas especializadas em fluxos de trabalho agênticos.

O Nemotron 3.5 Lightning também dá às organizações controle sobre privacidade e implantação. Ele pode ser executado em sistemas de IA locais — incluindo PCs NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station e NVIDIA Jetson — para ajudar os usuários a maximizar os investimentos em infraestrutura existente, ou escalar em dispositivos de IA de borda, estações de trabalho NVIDIA RTX PRO, data centers e ambientes de nuvem para casos de uso empresariais. E o Nemotron 3.5 Lightning pode ser executado localmente ou on-premises para tarefas especializadas de alto volume que exigem respostas rápidas.

Além disso, como em todo lançamento do Nemotron, a NVIDIA publica os dados e as técnicas de treinamento, o que permite rastreabilidade, auditoria e treinamento de outros modelos. Junto com o Nemotron 3.5 Lightning, a NVIDIA está lançando dois novos conjuntos de dados abertos de aprendizado por reforço usados para pós-treiná-lo: Nemotron-RL-Agentic-Terminal-Pivot, um ambiente de código agêntico, e Nemotron-RL-Lighting-Training-Blend, uma combinação mais ampla de dados de RL construída sobre dados lançados anteriormente com o Nemotron Ultra.

Aplicações de IA Mais Eficientes com Roteamento de Modelos

Alguns modelos são melhores para codificação, outros para raciocínio, outros para tarefas leves e alguns são otimizados para executar localmente para maior privacidade e eficiência. Se os clientes dependem de um único modelo padrão, podem gastar demais ou perder qualidade; se gerenciam o roteamento manualmente, isso se torna um trabalho de integração que pode atrasar uma implantação.

O NVIDIA NeMo Switchyard é uma biblioteca de roteamento de modelos de código aberto para agentes de IA. A tecnologia roteia prompts automaticamente para o modelo mais capaz e eficiente em cada etapa de um fluxo de trabalho de agente, com base nas necessidades específicas. Os desenvolvedores de aplicações de agentes podem ajustar ou modificar o roteador com diferentes algoritmos de roteamento para atender às suas prioridades, como requisitos de qualidade, latência e custo. Em um sistema de modelos, as empresas podem criar agentes de IA poderosos com tokenomics aprimorada.

Benchmarks internos mostram que o NeMo Switchyard mantém precisão de nível de fronteira enquanto reduz o custo de conclusão de tarefas para quase um terço do custo do Opus 4.8 isoladamente.

NVIDIA - inline image

Figura 4. Benchmarks internos da NVIDIA mostram que o NeMo Switchyard mantém precisão de nível de fronteira enquanto reduz o custo de conclusão de tarefas para quase um terço do custo do Opus 4.8 isoladamente.

A NVIDIA está trabalhando com parceiros em todo o ecossistema de IA para levar o roteamento inteligente de modelos para as ferramentas e plataformas que os desenvolvedores já usam.

  • @Boomi: Avaliou o Switchyard em cinco capacidades de roteamento, alcançando 100% de precisão no roteamento por domínio, enviando 59% do tráfego para um modelo ajustado 5x mais rápido e reduzindo a latência de turnos posteriores em 21%.
  • @Cadence: Melhorou a eficiência em 9,9% usando o ChipStack AI Super Agent para um caso de uso de verificação formal.
  • @Classmethod: Está executando cargas de trabalho opencode e Fireworks usando o NeMo Switchyard internamente, com testes iniciais mostrando uma redução de custo de 27% mantendo a qualidade.
  • @Cognition: Integrou o roteador em estágios do NVIDIA NeMo Switchyard ao Devin Desktop para uso interno da NVIDIA, alcançando desempenho próximo ao de fronteira no FrontierCode Main ao mesmo tempo em que reduziu o custo médio em 28% em relação ao roteamento de todas as solicitações para um único modelo de fronteira subjacente.
  • @Kong: Oferece roteamento com o NeMo Switchyard nativamente por meio do Kong AI Gateway.
  • @LangChain: Com o NeMo Switchyard, alcançou 74% de redução de custo em 145 tarefas multi-turno do Deep Agents roteando apenas 7% das chamadas para um modelo de fronteira, com um trade-off de 6% na precisão.
  • @LiteLLM: Está adicionando o NeMo Switchyard como plug-in em sua camada de proxy para que os desenvolvedores possam acessar esses benefícios sem alterar sua stack existente.
  • @NousResearch: Integrou o NeMo Switchyard ao Hermes para fornecer aos desenvolvedores um sistema de roteamento fácil de configurar para melhorar a eficiência dos agentes.
  • @TryRamp: Usou o NeMo Switchyard para igualar o desempenho de um modelo de fronteira enquanto reduziu custos em 58% e o tempo de execução em 33% no Ramp SWE-Bench.
  • @Siemens: Está realizando benchmarks para melhorar a eficiência em seu Fuse EDA AI Agent.

O Nemotron 3.5 Lightning está disponível no Hugging Face, no ModelScope, no OpenRouter e no build.nvidia.com como um microserviço NVIDIA NIM, bem como por meio de um amplo ecossistema de NVIDIA Cloud Partners, plataformas de pós-treinamento, plataformas de inferência e provedores de serviços de nuvem. O NeMo Switchyard está disponível no GitHub e chegará em breve às plataformas parceiras.

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais