El Biohub, la organización de investigación respaldada por Mark Zuckerberg y Priscilla Chan, coordina una iniciativa de 1.800 millones de dólares para entrenar modelos de inteligencia artificial capaces de predecir cómo se comportan las células vivas. El proyecto reúne a Meta, Google DeepMind, Isomorphic Labs y el Departamento de Energía de Estados Unidos, que aportarán datos, equipamiento de laboratorio y capacidad de cómputo. Según reportó Reuters, un primer conjunto de datos debería estar listo en alrededor de un año.
La apuesta busca llevar a la biología celular el tipo de salto que los modelos de lenguaje dieron al texto: en lugar de predecir la siguiente palabra en una frase, estos sistemas intentarían anticipar cómo reacciona una célula ante un fármaco, una mutación o un cambio en su entorno. Si funciona, los investigadores podrían simular experimentos en una computadora antes de realizarlos en el laboratorio, acortando los tiempos y los costos de la investigación biomédica.
Por qué hace falta construir los datos desde cero
El cuello de botella no es la potencia de cálculo, sino la información. A diferencia del texto o las imágenes, que abundan en internet, los datos experimentales sobre el comportamiento de las células son escasos, dispersos y generados con métodos poco homogéneos. Buena parte del presupuesto se destinará justamente a producir mediciones nuevas y estandarizadas a gran escala, el combustible sin el cual ningún modelo de este tipo puede entrenarse con rigor.
La participación de Isomorphic Labs, la empresa de descubrimiento de fármacos derivada de DeepMind, y del propio Google DeepMind conecta esta iniciativa con la tradición de AlphaFold, el sistema que predijo la estructura tridimensional de las proteínas. Predecir el comportamiento dinámico de una célula entera es un problema considerablemente más complejo que plegar una proteína, por lo que conviene moderar las expectativas sobre plazos y resultados concretos.
La entrada del Departamento de Energía estadounidense como financiador refleja además el peso que los gobiernos empiezan a dar a la IA aplicada a las ciencias de la vida. En paralelo, otras organizaciones impulsan esfuerzos similares de datos abiertos para la salud: la Fundación OpenAI anunció que destinará más de 125 millones de dólares a proyectos de datos públicos en ese campo.
Qué significa para la región
Para América Latina, donde la inversión pública en investigación biomédica es limitada y los laboratorios suelen carecer de infraestructura de cómputo avanzada, iniciativas de este calibre plantean una disyuntiva conocida. Si los datos y modelos resultantes se publican de forma abierta, grupos académicos de la región podrían usarlos sin tener que financiar la fase más costosa; si quedan bajo control de las empresas que los financian, la brecha en biotecnología podría ampliarse. El diseño final del acceso será determinante.
Este movimiento se inscribe en una tendencia más amplia de aplicar modelos de IA a problemas biológicos concretos, desde el diseño de proteínas hasta los microbios diseñados en laboratorio para la agricultura. La diferencia aquí es la escala del financiamiento y la alianza poco habitual entre gigantes tecnológicos competidores y un organismo público.
Por ahora, el proyecto está en su fase inicial y su primer entregable es un conjunto de datos, no un modelo terminado. El verdadero examen llegará cuando esos modelos deban demostrar que sus predicciones se sostienen frente a células reales.