El nuevo modelo abierto ligero y la biblioteca de enrutamiento ofrecen mayor control sobre la IA, los datos y los flujos de trabajo en dispositivos periféricos, PC, estaciones de trabajo, centros de datos y la nube.
Fuente: Blog de NVIDIA
Por Kari Briski, vicepresidenta de IA generativa, NVIDIA
A medida que la IA pasa de los chatbots a los agentes autónomos, los modelos abiertos están respondiendo a las demandas del mercado de tener control total sobre dónde se ejecuta la IA y cómo se implementa y evoluciona.
Hoy, NVIDIA amplía su familia de modelos Nemotron 3 con Nemotron 3.5 Lightning, el modelo de mayor eficiencia de su clase para cargas de trabajo de IA agéntica de larga duración. Este lanzamiento sigue a Nemotron 3 Nano y refleja el compromiso de NVIDIA de mejorar continuamente los modelos abiertos para lograr mayor precisión y velocidad.
Diseñado para tareas especializadas dentro de sistemas multiagente más grandes, Nemotron 3.5 Lightning, un modelo de mezcla de expertos de 30 mil millones de parámetros, ayuda a crear aplicaciones agénticas más inteligentes y eficientes.
Además, NVIDIA lanza NeMo Switchyard, una biblioteca de código abierto para el enrutamiento inteligente dentro de las herramientas de agentes más populares. Las empresas pueden usarla para crear un enrutador según sus necesidades específicas. Al implementarse, NeMo Switchyard puede dirigir inteligentemente cada solicitud al modelo más capaz y adecuado para la tarea, sin que los desarrolladores tengan que reescribir sus aplicaciones.
En conjunto, Nemotron 3.5 Lightning y NeMo Switchyard brindan mayor control sobre cómo se implementa la IA, dónde se ejecuta y con qué eficiencia opera, en PC, estaciones de trabajo, centros de datos y la nube.

Figura 1. Nemotron 3.5 Lightning ofrece inteligencia de nivel fronterizo en un modelo abierto pequeño y personalizable, diseñado para flujos de trabajo agénticos de alto volumen.
Los agentes siempre activos necesitan un sistema de modelos
Los sistemas agénticos modernos —agentes siempre activos— operan cada vez más como sistemas de modelos, o conjuntos de modelos, con diferentes modelos especializados en distintas tareas.
Los modelos abiertos NVIDIA Nemotron están diseñados para esta arquitectura. Un modelo de razonamiento fronterizo como Nemotron 3 Ultra o GPT-5.6 puede planificar y orquestar un flujo de trabajo, mientras que modelos especializados más pequeños como Nemotron 3.5 Lightning pueden realizar tareas específicas, como revisión de código, uso de herramientas, monitoreo de alertas de seguridad y respuesta a preguntas sobre facturación.
Impulsando tareas especializadas de alto volumen con Nemotron 3.5 Lightning
NVIDIA Nemotron 3.5 Lightning es un modelo abierto totalmente personalizable, diseñado para tareas de alto volumen que impulsan agentes siempre activos. Se desarrolló con contribuciones de la Coalición Nemotron, cuyos miembros proporcionaron metodologías de evaluación, software de inferencia y conjuntos de datos para ayudar a avanzar el modelo.
El modelo ofrece una velocidad de salida hasta 4 veces mayor, lo que se traduce en una finalización de tareas agénticas un 30 % más rápida en comparación con otros modelos de su clase. Y, como es abierto y personalizable, Nemotron 3.5 Lightning puede reentrenarse fácilmente con NVIDIA NeMo sobre los datos de dominio, las herramientas y los flujos de trabajo propios de una organización para mejorar la precisión en tareas especializadas.

Figura 2. Los benchmarks de PinchBench demuestran que Nemotron 3.5 Lightning ofrece una finalización más rápida de tareas agénticas con una precisión de nivel fronterizo en comparación con otros modelos de su clase.
Los líderes de IA de diversas industrias están personalizando Nemotron 3.5 Lightning para sus cargas de trabajo, incluidos @CrowdStrike para ciberseguridad, @Harvey con @TrajectoryLabs para servicios legales y @CodeRabbitAI con @Baseten para revisión de código, lo que ayuda a mejorar la precisión en tareas agénticas específicas del dominio. Además, @LilaSciences está ayudando a mejorar las capacidades de razonamiento para tareas agénticas en ciencias físicas y de la vida, y @FastinoAI personalizó el modelo y está obteniendo precisiones líderes en cargas de trabajo de desarrollo de software, finanzas y salud.

Figura 3. Las empresas han personalizado Nemotron 3.5 Lightning para lograr una precisión líder en sus tareas especializadas dentro de sus flujos de trabajo agénticos.
Nemotron 3.5 Lightning también brinda a las organizaciones control sobre privacidad e implementación. Puede ejecutarse en sistemas de IA locales, incluidos PCs NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station y NVIDIA Jetson, para ayudar a los usuarios a maximizar sus inversiones en infraestructura existente, o escalar en dispositivos de IA en el borde, estaciones de trabajo NVIDIA RTX PRO, centros de datos y entornos de nube para casos de uso empresarial. Además, Nemotron 3.5 Lightning puede ejecutarse de forma local o en las instalaciones del cliente para tareas especializadas de alto volumen que requieren respuestas rápidas.
Además, como en cada lanzamiento de Nemotron, NVIDIA publica los datos y las técnicas de entrenamiento, lo que permite la trazabilidad, la auditoría y el entrenamiento de otros modelos. Junto con Nemotron 3.5 Lightning, NVIDIA lanza dos nuevos conjuntos de datos abiertos de aprendizaje por refuerzo utilizados para reentrenarlo: Nemotron-RL-Agentic-Terminal-Pivot, un entorno de código agéntico, y Nemotron-RL-Lighting-Training-Blend, una mezcla más amplia de datos de RL creada sobre datos publicados anteriormente con Nemotron Ultra.
Aplicaciones de IA más eficientes con enrutamiento de modelos
Algunos modelos son mejores para programar, otros para razonar, otros para tareas ligeras y algunos están optimizados para ejecutarse localmente con mayor privacidad y eficiencia. Si los clientes dependen de un único modelo predeterminado, podrían gastar de más o perder calidad; si gestionan el enrutamiento manualmente, se convierte en un trabajo de integración que puede retrasar la implementación.
NVIDIA NeMo Switchyard es una biblioteca de código abierto para el enrutamiento de modelos en agentes de IA. La tecnología enruta automáticamente las indicaciones al modelo más capaz y eficiente para cada paso de un flujo de trabajo de agente, según las necesidades específicas. Los desarrolladores de aplicaciones de agentes pueden ajustar o modificar el enrutador con diferentes algoritmos de enrutamiento para alinearlos con sus prioridades, como requisitos de calidad, latencia y costo. En un sistema de modelos, las empresas pueden crear agentes de IA potentes con una mejor economía de tokens.
Los benchmarks internos muestran que NeMo Switchyard mantiene una precisión de nivel fronterizo mientras reduce el costo de finalización de tareas a casi un tercio del costo de utilizar únicamente Opus 4.8.

Figura 4. Los benchmarks internos de NVIDIA muestran que NeMo Switchyard mantiene una precisión de nivel fronterizo mientras reduce el costo de finalización de tareas a casi un tercio del costo de usar solo Opus 4.8.
NVIDIA está trabajando con socios de todo el ecosistema de IA para llevar el enrutamiento inteligente de modelos a las herramientas y plataformas que los desarrolladores ya usan.
- @Boomi: Evaluó Switchyard en cinco capacidades de enrutamiento, logrando un 100 % de precisión en el enrutamiento por dominio, enviando el 59 % del tráfico a un modelo ajustado 5 veces más rápido y reduciendo la latencia de turnos posteriores en un 21 %.
- @Cadence: Mejoró la eficiencia en un 9.9 % al usar el ChipStack AI Super Agent para un caso de uso de verificación formal.
- @Classmethod: Está ejecutando cargas de trabajo de opencode y Fireworks con NeMo Switchyard internamente, y las pruebas iniciales muestran una reducción de costos del 27 % manteniendo la calidad.
- @Cognition: Integró el enrutador por etapas de NVIDIA NeMo Switchyard en Devin Desktop para uso interno de NVIDIA, logrando un rendimiento casi de frontera en FrontierCode Main mientras reduce el costo promedio en un 28 % en comparación con enrutar todas las solicitudes a un único modelo fronterizo subyacente.
- @Kong: Ofrece enrutamiento con NeMo Switchyard de forma nativa a través de Kong AI Gateway.
- @LangChain: Con NeMo Switchyard, logró un costo 74 % menor en 145 tareas de Deep Agents de múltiples turnos al enrutar solo el 7 % de las llamadas a un modelo fronterizo, con una compensación del 6 % en precisión.
- @LiteLLM: Está añadiendo NeMo Switchyard como complemento en su capa proxy para que los desarrolladores puedan acceder a estos beneficios sin cambiar su stack existente.
- @NousResearch: Integró NeMo Switchyard en Hermes para ofrecer a los desarrolladores un sistema de enrutamiento fácil de configurar que mejore la eficiencia de los agentes.
- @TryRamp: Usó NeMo Switchyard para igualar el rendimiento de un modelo fronterizo, reduciendo los costos en un 58 % y el tiempo de ejecución en un 33 % en Ramp SWE-Bench.
- @Siemens: Está realizando benchmarks para mejorar la eficiencia en su Fuse EDA AI Agent.
Nemotron 3.5 Lightning está disponible en Hugging Face, ModelScope, OpenRouter y build.nvidia.com como microservicio NVIDIA NIM, así como a través de un amplio ecosistema de NVIDIA Cloud Partners, plataformas de post-entrenamiento, plataformas de inferencia y proveedores de servicios en la nube. NeMo Switchyard está disponible en GitHub y pronto llegará a las plataformas de los socios.





