Google presentó el 9 de julio de 2026 LiteRT.js, una biblioteca que permite ejecutar modelos de inteligencia artificial directamente en el navegador web, sin enviar datos a un servidor. La herramienta es la versión en JavaScript de LiteRT, el motor de inferencia en dispositivo de la compañía, y ejecuta archivos con formato .tflite aprovechando el hardware de la máquina del usuario.
La inferencia es el momento en que un modelo ya entrenado produce resultados a partir de nuevos datos: reconocer una imagen, clasificar un texto o generar una respuesta. Hacer que ese proceso ocurra en el propio navegador tiene ventajas concretas de privacidad, latencia y costos, porque la información no sale del equipo y no depende de una conexión constante con la nube.
Cómo aprovecha el hardware del navegador
Según el anuncio oficial en el blog para desarrolladores de Google, LiteRT.js apoya sus cálculos en WebAssembly, una tecnología que permite correr código de alto rendimiento en el navegador. Para el procesamiento en CPU utiliza XNNPACK, una biblioteca optimizada de operaciones matemáticas.
El salto de rendimiento llega cuando entra en juego la placa gráfica. La herramienta usa un componente llamado ML Drift sobre WebGPU, la interfaz moderna que da a las páginas web acceso a la GPU. También incorpora soporte experimental para WebNN, pensado para las NPU, los chips especializados en tareas de IA que ya vienen en muchos equipos recientes.
Google afirma mejoras de hasta 3 veces frente a otros motores de inferencia web, y de entre 5 y 60 veces cuando se usa GPU o NPU en lugar de su propia ruta por CPU. Son cifras reportadas por la propia empresa y dependen del modelo y del equipo donde se ejecuten, de modo que conviene tomarlas como referencia y no como una garantía uniforme.
Un detalle que el anuncio deja de lado
Hay un aspecto técnico que la presentación no destaca y que importa a quien vaya a construir con la herramienta: la gestión manual de la memoria. Los tensores —las estructuras de datos con las que trabajan los modelos— deben eliminarse a mano una vez usados. Si el desarrollador olvida liberarlos, la aplicación puede acumular consumo de memoria hasta degradarse. Es una responsabilidad poco habitual en el desarrollo web moderno, acostumbrado a que el lenguaje limpie por sí solo.
La pieza se suma a un conjunto de proyectos abiertos que Google mantiene alrededor de LiteRT, entre ellos ai-edge-torch, que convierte modelos de PyTorch al formato compatible, y herramientas de cuantización para reducir el tamaño de los modelos. El objetivo de fondo es que la IA en dispositivo no quede restringida a aplicaciones nativas de móvil y llegue a la web con un rendimiento competitivo.
Por qué interesa a los desarrolladores
Correr modelos en el navegador abre casos de uso donde enviar datos a un servidor resulta caro, lento o problemático desde el punto de vista de la privacidad. Un asistente que procesa texto localmente, un filtro de imagen que no sube fotos a la nube o funciones de accesibilidad que operan sin conexión son ejemplos que se benefician de este enfoque.
La apuesta de Google por el hardware del cliente contrasta con la tendencia dominante de concentrar la inferencia en centros de datos. Ninguna de las dos vías anula a la otra: los modelos más grandes seguirán viviendo en la nube, pero una porción creciente de tareas cotidianas puede resolverse en el propio equipo. LiteRT.js empuja esa frontera un poco más adentro del navegador.
