Nvidia publicó el 15 y 16 de julio de 2026 la colección Nemotron 3 Embed, un conjunto de modelos abiertos de embeddings cuyo modelo más grande, de 8.000 millones de parámetros, quedó en el primer puesto del ranking RTEB, una prueba independiente que mide la calidad de los sistemas de recuperación de información. El objetivo declarado es dar a desarrolladores y empresas una base sólida para buscar y organizar grandes volúmenes de texto sin depender de servicios cerrados.
Los modelos de embeddings convierten texto en vectores numéricos, es decir, listas de números que capturan el significado de una frase o documento. Sobre esos vectores se construyen buscadores semánticos y los sistemas de recuperación aumentada por generación (RAG), la técnica que permite a un chatbot consultar una base de documentos antes de responder para reducir errores e inventos.
Tres versiones para distintos presupuestos
La colección incluye tres puntos de control publicados en Hugging Face. El más capaz, Nemotron-3-Embed-8B-BF16, alcanzó una puntuación promedio de 78,46 en la métrica NDCG@10 de RTEB, que evalúa qué tan bien el modelo ordena los resultados más relevantes en primeros lugares.
Las otras dos versiones apuntan a un tamaño más manejable, con 1.000 millones de parámetros. Según el anuncio oficial de Nvidia en Hugging Face, el modelo de 1B se obtuvo mediante poda de red neuronal con la herramienta ModelOpt NAS y una fase de destilación —un proceso en el que un modelo pequeño aprende a imitar a uno grande— usando el 8B como maestro.
La tercera variante, Nemotron-3-Embed-1B-NVFP4, usa un formato numérico comprimido de baja precisión. Nvidia asegura que conserva más del 99% de la exactitud de recuperación de la versión BF16 mientras duplica el rendimiento en las GPU con arquitectura Blackwell. Ese equilibrio entre precisión y velocidad es el argumento central para quienes necesiten procesar millones de consultas a bajo costo.
Contexto largo y licencia permisiva
Los tres modelos aceptan entradas de hasta 32.768 tokens, el equivalente a documentos extensos procesados en una sola pasada, algo útil para indexar contratos, manuales o artículos completos sin trocearlos. Se distribuyen bajo la licencia OpenMDW-1.1, que permite su uso comercial.
El lanzamiento se enmarca en la estrategia de Nvidia de acompañar la venta de sus chips con software y modelos abiertos que corren de forma óptima en su propio hardware. Al liberar los pesos y una versión optimizada para Blackwell, la compañía facilita que empresas construyan buscadores internos y sistemas RAG sin pagar por API de terceros, a la vez que refuerza la demanda de sus aceleradores.
La apuesta por modelos abiertos y compactos es una tendencia marcada del año. Técnicas como la destilación y la poda buscan acercar capacidades de modelos grandes a equipos con menos recursos, un camino que también exploran proyectos como la compresión de modelos de razonamiento para dispositivos móviles.
Los modelos ya están disponibles para descarga en la colección de Nvidia en Hugging Face. Queda por ver cómo se comportan en cargas de trabajo reales, donde el ranking de un benchmark no siempre anticipa el resultado en producción.
