Cerebras Systems presentó el CS-4, su nueva generación de acelerador para inteligencia artificial, con la que asegura duplicar el rendimiento respecto al modelo anterior sin cambiar el tamaño del chip. El director ejecutivo de la compañía, Andrew Feldman, lo describió como el sistema más rápido de la industria y afirmó que supera con holgura a las soluciones basadas en tarjetas gráficas convencionales.

La propuesta de Cerebras se aparta del enfoque dominante en el sector. En lugar de conectar miles de GPU individuales, la empresa fabrica un único procesador del tamaño de una oblea de silicio, mucho mayor que cualquier chip tradicional. Esa arquitectura busca reducir los cuellos de botella que aparecen cuando la información tiene que viajar entre múltiples componentes separados, algo especialmente costoso al ejecutar modelos de lenguaje de gran escala.

Más velocidad sin agrandar el silicio

El anuncio principal del CS-4 es que mantiene el mismo procesador físico de la generación previa pero entrega, según la compañía, el doble de rendimiento. En el comunicado oficial, Cerebras sostiene que el sistema es hasta 30 veces más rápido que soluciones equivalentes armadas con GPU para determinadas cargas de inferencia.

La inferencia es la fase en la que un modelo ya entrenado responde a las peticiones de los usuarios, es decir, cuando genera texto, resume documentos o contesta preguntas. En ese terreno, la velocidad se mide muchas veces en tokens por segundo: cuántas unidades de texto puede producir el sistema en un lapso determinado. Cerebras ha construido buena parte de su discurso comercial alrededor de esa métrica, apostando por respuestas casi instantáneas frente a la latencia habitual de otros proveedores.

Una apuesta por competir con Nvidia

El lanzamiento se produce en un momento de fuerte presión sobre el suministro de chips para IA, un mercado donde Nvidia mantiene una posición dominante. Compañías como Cerebras, Groq y otros fabricantes de silicio especializado intentan abrirse un hueco ofreciendo alternativas orientadas a la velocidad de inferencia, un segmento que gana peso a medida que más empresas ponen en producción asistentes y agentes de IA que deben responder en tiempo real.

Esa diversificación de proveedores también se refleja en la carrera por construir infraestructura de cómputo. En los últimos meses han surgido operadores de nube especializados y nuevas ofertas de potencia de cálculo contratada, en un intento por reducir la dependencia de un único fabricante.

Para América Latina, el acceso a este tipo de hardware sigue estando mediado casi por completo por servicios en la nube. Prácticamente ninguna empresa de la región compra sistemas como el CS-4 de forma directa; lo habitual es consumir capacidad de inferencia a través de proveedores internacionales, donde la latencia, el precio en dólares y la distancia física de los centros de datos condicionan la experiencia. Un salto de velocidad como el que anuncia Cerebras podría traducirse, con el tiempo, en respuestas más ágiles para desarrolladores y compañías locales que integran modelos en sus productos, siempre que ese rendimiento llegue a través de servicios accesibles desde la región.

Cerebras no detalló públicamente todos los precios ni un calendario de disponibilidad general junto al anuncio. Su capacidad para convertir las cifras de laboratorio en despliegues comerciales sostenidos será la verdadera prueba, en un sector donde las comparaciones de rendimiento dependen mucho del modelo, la carga de trabajo y las condiciones de medición.