NVIDIA Nemotron 3.5 Lightning y NeMo Switchyard ofrecen una IA agente más rápida, inteligente y eficiente

@nvidia
INGLÉS11 ago 2026
118K
897
137
95
108

TL;DR

NVIDIA ha lanzado Nemotron 3.5 Lightning, un modelo MoE de 30B de parámetros, junto con NeMo Switchyard, una biblioteca de código abierto para el enrutamiento inteligente de modelos en agentes de IA.

El nuevo modelo abierto ligero y la biblioteca de enrutamiento ofrecen un mayor control sobre la IA, los datos y los flujos de trabajo en dispositivos de borde, PC, estaciones de trabajo, centros de datos y la nube.

Fuente: Blog de NVIDIA

Por Kari Briski, vicepresidenta de IA Generativa en NVIDIA

A medida que la IA pasa de los chatbots a los agentes autónomos, los modelos abiertos están respondiendo a las demandas del mercado de un control total sobre dónde se ejecuta la IA y cómo se implementa y evoluciona.

Hoy, NVIDIA amplía su familia de modelos Nemotron 3 con Nemotron 3.5 Lightning, el modelo de mayor eficiencia de su clase para cargas de trabajo de IA agéntica de larga duración. Este lanzamiento sigue a Nemotron 3 Nano y refleja el compromiso de NVIDIA de mejorar continuamente los modelos abiertos para lograr una mayor precisión y velocidad.

Diseñado para tareas especializadas dentro de sistemas multiagente más grandes, Nemotron 3.5 Lightning, un modelo de mezcla de expertos de 30 mil millones de parámetros, ayuda a crear aplicaciones agénticas más inteligentes y eficientes.

Además, NVIDIA lanza NeMo Switchyard, una biblioteca de código abierto para el enrutamiento inteligente dentro de las herramientas de agentes más populares. Las empresas pueden usarla para crear un enrutador basado en sus necesidades específicas. Una vez implementado, NeMo Switchyard puede dirigir inteligentemente cada solicitud al modelo más capaz y adecuado para la tarea, sin que los desarrolladores tengan que reescribir sus aplicaciones.

En conjunto, Nemotron 3.5 Lightning y NeMo Switchyard ofrecen un mayor control sobre cómo se implementa la IA, dónde se ejecuta y con qué eficiencia opera, en PC, estaciones de trabajo, centros de datos y la nube.

NVIDIA - inline image

Figura 1. Nemotron 3.5 Lightning ofrece inteligencia de vanguardia en un modelo abierto pequeño y personalizable, diseñado para flujos de trabajo agénticos de alto volumen.

Los agentes siempre activos necesitan un sistema de modelos

Los sistemas agénticos modernos (agentes siempre activos) operan cada vez más como sistemas de modelos, o conjuntos de modelos, con diferentes modelos especializados en distintas tareas.

Los modelos abiertos de NVIDIA Nemotron están diseñados para esta arquitectura. Un modelo de razonamiento de vanguardia, como Nemotron 3 Ultra o GPT-5.6, puede planificar y orquestar un flujo de trabajo, mientras que modelos especializados más pequeños, como Nemotron 3.5 Lightning, pueden realizar tareas específicas como revisión de código, uso de herramientas, monitoreo de alertas de seguridad y respuesta a consultas de facturación.

Impulsando tareas especializadas de alto volumen con Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning es un modelo abierto totalmente personalizable, diseñado para tareas de alto volumen que impulsan agentes siempre activos. Se desarrolló con las contribuciones de la Coalición Nemotron, cuyos miembros proporcionaron metodologías de evaluación, software de inferencia y conjuntos de datos para ayudar a avanzar en el modelo.

El modelo ofrece una velocidad de salida hasta 4 veces mayor, lo que se traduce en una finalización de tareas agénticas un 30% más rápida en comparación con otros modelos de su clase. Y como es abierto y personalizable, Nemotron 3.5 Lightning se puede post-entrenar fácilmente con NVIDIA NeMo utilizando los datos, las herramientas y los flujos de trabajo propios de una organización para mejorar la precisión en tareas especializadas.

NVIDIA - inline image

Figura 2. Los benchmarks de PinchBench demuestran que Nemotron 3.5 Lightning logra una finalización más rápida de tareas agénticas con una precisión de vanguardia en comparación con otros modelos de su clase.

Los líderes de IA de diversos sectores están personalizando Nemotron 3.5 Lightning para sus cargas de trabajo, entre ellos @CrowdStrike para ciberseguridad, @Harvey con @TrajectoryLabs para servicios legales y @CodeRabbitAI con @Baseten para revisión de código, lo que ayuda a mejorar la precisión en tareas agénticas específicas de cada dominio. Además, @LilaSciences está contribuyendo a mejorar las capacidades de razonamiento para tareas agénticas en ciencias físicas y de la vida, y @FastinoAI personalizó el modelo y está logrando precisiones líderes en cargas de trabajo de desarrollo de software, finanzas y salud.

NVIDIA - inline image

Figura 3. Las empresas han personalizado Nemotron 3.5 Lightning para lograr una precisión líder en sus tareas especializadas dentro de sus flujos de trabajo agénticos.

Nemotron 3.5 Lightning también brinda a las organizaciones control sobre la privacidad y la implementación. Puede ejecutarse en sistemas de IA locales, incluidos PC con NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station y NVIDIA Jetson, para ayudar a los usuarios a maximizar sus inversiones en infraestructura existente, o escalar a dispositivos de IA de borde, estaciones de trabajo NVIDIA RTX PRO, centros de datos y entornos de nube para casos de uso empresarial. Además, Nemotron 3.5 Lightning puede ejecutarse localmente o en las instalaciones para tareas especializadas de alto volumen que requieren respuestas rápidas.

Además, como en cada lanzamiento de Nemotron, NVIDIA publica los datos y las técnicas de entrenamiento, lo que permite la trazabilidad, la auditoría y el entrenamiento de otros modelos. Junto con Nemotron 3.5 Lightning, NVIDIA lanza dos nuevos conjuntos de datos abiertos de aprendizaje por refuerzo utilizados para su post-entrenamiento: Nemotron-RL-Agentic-Terminal-Pivot, un entorno de código agéntico, y Nemotron-RL-Lighting-Training-Blend, una mezcla de datos de RL más amplia construida sobre datos publicados anteriormente con Nemotron Ultra.

Aplicaciones de IA más eficientes con enrutamiento de modelos

Algunos modelos son mejores para programación, otros para razonamiento, otros para tareas ligeras y algunos están optimizados para ejecutarse localmente con mayor privacidad y eficiencia. Si los clientes dependen de un único modelo predeterminado, pueden gastar de más o perder calidad; si gestionan el enrutamiento manualmente, se convierte en un trabajo de integración que puede ralentizar la implementación.

NVIDIA NeMo Switchyard es una biblioteca de código abierto para el enrutamiento de modelos de agentes de IA. La tecnología enruta automáticamente las indicaciones (prompts) al modelo más capaz y eficiente para cada paso de un flujo de trabajo de agentes, según las necesidades específicas. Los desarrolladores de aplicaciones de agentes pueden ajustar o modificar el enrutador con diferentes algoritmos de enrutamiento para adaptarlo a sus prioridades, como los requisitos de calidad, latencia y costo. En un sistema de modelos, las empresas pueden crear potentes agentes de IA con una tokenómica mejorada.

Los benchmarks internos muestran que NeMo Switchyard mantiene una precisión de vanguardia mientras reduce el costo de finalización de tareas a casi un tercio del de Opus 4.8 por sí solo.

NVIDIA - inline image

Figura 4. Los benchmarks internos de NVIDIA muestran que NeMo Switchyard mantiene una precisión de vanguardia mientras reduce el costo de finalización de tareas a casi un tercio del de Opus 4.8 por sí solo.

NVIDIA está trabajando con socios de todo el ecosistema de IA para llevar el enrutamiento inteligente de modelos a las herramientas y plataformas que los desarrolladores ya utilizan.

  • @Boomi: Evaluó Switchyard en cinco capacidades de enrutamiento, logrando un 100% de precisión en el enrutamiento por dominio, enviando el 59% del tráfico a un modelo ajustado 5 veces más rápido y reduciendo la latencia de los turnos posteriores en un 21%.
  • @Cadence: Mejoró la eficiencia en un 9,9% al utilizar el ChipStack AI Super Agent en un caso de uso de verificación formal.
  • @Classmethod: Está ejecutando cargas de trabajo de opencode y Fireworks con NeMo Switchyard internamente, y las pruebas iniciales muestran una reducción de costos del 27% manteniendo la calidad.
  • @Cognition: ​Integró el enrutador por etapas de NVIDIA NeMo Switchyard en Devin Desktop para uso interno de NVIDIA, logrando un rendimiento casi de vanguardia en FrontierCode Main mientras reduce el costo medio en un 28% en comparación con enrutar todas las solicitudes a un único modelo de vanguardia subyacente.
  • @Kong: Ofrece enrutamiento con NeMo Switchyard de forma nativa a través de Kong AI Gateway.
  • @LangChain: Con NeMo Switchyard, logró un costo 74% menor en 145 tareas de Deep Agents multi-turno al enrutar solo el 7% de las llamadas a un modelo de vanguardia, con una pérdida de precisión del 6%.
  • @LiteLLM: Está añadiendo NeMo Switchyard como plugin en su capa de proxy para que los desarrolladores puedan acceder a estos beneficios sin cambiar su stack existente.
  • @NousResearch: Integró NeMo Switchyard en Hermes para ofrecer a los desarrolladores un sistema de enrutamiento fácil de configurar que mejore la eficiencia de los agentes.
  • @TryRamp: Utilizó NeMo Switchyard para igualar el rendimiento de un modelo de vanguardia mientras reducía los costos en un 58% y el tiempo de ejecución en un 33% en Ramp SWE-Bench.
  • @Siemens: Está realizando benchmarks para mejorar la eficiencia de su Fuse EDA AI Agent.

Nemotron 3.5 Lightning está disponible en Hugging Face, ModelScope, OpenRouter y build.nvidia.com como microservicio NVIDIA NIM, así como a través de un amplio ecosistema de NVIDIA Cloud Partners, plataformas de post-entrenamiento, plataformas de inferencia y proveedores de servicios en la nube. NeMo Switchyard está disponible en GitHub y pronto llegará a las plataformas de los socios.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales