NVIDIA lanzó Nemotron 3.5 Lightning, un modelo de lenguaje abierto de 30.000 millones de parámetros diseñado específicamente para ejecutar tareas dentro de agentes de IA que trabajan durante períodos largos. Junto al modelo, la compañía publicó NeMo Switchyard, un sistema de enrutamiento que dirige cada paso de un agente hacia el modelo más barato capaz de resolverlo. Ambos se ofrecen bajo licencia abierta, lo que permite a desarrolladores y empresas usarlos y adaptarlos.

La pieza clave del anuncio es una arquitectura conocida como mezcla de expertos (MoE, por sus siglas en inglés). En lugar de activar todos sus parámetros en cada consulta, el modelo enciende solo una fracción especializada según la tarea: aunque tiene 30.000 millones de parámetros totales, apenas 3.000 millones se activan en cada operación. Ese diseño reduce el costo de cómputo y acelera las respuestas sin sacrificar demasiada capacidad.

Para qué sirve y a quién apunta

El objetivo declarado no es competir con los modelos conversacionales de propósito general, sino ocupar la capa de ejecución de los agentes: las herramientas de software que encadenan múltiples pasos para completar un objetivo, como consultar bases de datos, llamar a otras aplicaciones o procesar documentos. En esos flujos, muchas acciones son rutinarias y no requieren un modelo grande y costoso.

Ahí entra NeMo Switchyard. El enrutador evalúa cada paso de la tarea y lo asigna al modelo adecuado, buscando el más económico que aún resuelva bien el problema. La idea de repartir el trabajo entre modelos según su dificultad se ha vuelto una tendencia en la industria para controlar el gasto en inferencia, la fase en la que un modelo ya entrenado genera respuestas. Propuestas similares, como Fireworks Nexus, apuntan al mismo problema desde otro ángulo.

Según la documentación técnica de NVIDIA, el modelo está orientado a ejecución de tareas especializadas de forma rápida y precisa, un requisito importante cuando un agente debe sostener sesiones prolongadas sin degradar su rendimiento ni disparar la factura.

Abierto y disponible en varias plataformas

Nemotron 3.5 Lightning se publicó en Hugging Face con pesos disponibles para descarga, mientras que el código de NeMo Switchyard está en GitHub. El modelo se distribuye bajo la licencia OpenMDW-1.1, un esquema pensado para pesos y artefactos de modelos de aprendizaje automático.

La estrategia de distribución también busca reducir la fricción para llegar a producción. Además del acceso directo a los pesos, el modelo ya figura en catálogos de proveedores de infraestructura de terceros como Baseten, Together AI y Nebius, que ofrecen endpoints listos para consumir sin gestionar servidores propios.

El lanzamiento se enmarca en la familia Nemotron, la línea de modelos abiertos de NVIDIA orientada a casos empresariales y de agentes, que incluye variantes de mayor tamaño como Nemotron 3 Ultra, enfocada en razonamiento. La versión Lightning representa el extremo ligero de esa familia: menos parámetros activos, respuestas más rápidas y un costo por operación menor.

Por qué importa

La apuesta refuerza una idea que gana terreno entre quienes construyen sistemas con agentes: no todo requiere el modelo más potente. Combinar un modelo eficiente con un enrutador que decide cuándo escalar a algo mayor puede recortar de forma notable el gasto de operar agentes a escala, uno de los principales frenos para su adopción masiva en empresas. Que NVIDIA lo ofrezca de forma abierta y compatible con su ecosistema de hardware añade un incentivo difícil de ignorar para los equipos técnicos que ya trabajan sobre sus GPU.