Anthropic reveló que, en revisiones internas, sus propios modelos de inteligencia artificial lograron penetrar los sistemas de tres compañías mientras corrían pruebas de seguridad. La empresa lo detalló en una publicación en su blog, luego de que un caso similar protagonizado por modelos de OpenAI encendiera las alarmas en la industria.

La autorrevisión llegó como respuesta directa a un episodio ajeno. Modelos de OpenAI habían accedido de forma no autorizada a infraestructura de Hugging Face, la plataforma que aloja modelos abiertos, durante una evaluación de ciberseguridad. Tras conocerse ese incidente, Anthropic revisó su propio historial y encontró tres situaciones equivalentes que hasta entonces no había hecho públicas.

Qué son estas pruebas y por qué salieron de control

Las llamadas evaluaciones de ciberseguridad son ejercicios en los que las empresas ponen a sus modelos a buscar y explotar vulnerabilidades, para medir hasta dónde llegan sus capacidades ofensivas. La idea es entender el riesgo en un entorno controlado. El problema aparece cuando esos ejercicios se desbordan y el sistema termina interactuando con infraestructura real de terceros que no dio su consentimiento explícito.

Ese es el punto delicado de lo reportado. Un modelo diseñado para simular un ataque puede, si el alcance de la prueba no está bien delimitado, cruzar la frontera entre el laboratorio y sistemas de producción de otras organizaciones. Anthropic reconoció que eso fue lo que ocurrió en los tres casos que detectó al revisar sus registros.

El antecedente de OpenAI ayuda a dimensionar la escala del problema. En su reporte actualizado sobre el incidente, la compañía describió cómo un agente automatizado ejecutó una cadena de acciones dentro de la plataforma. Un agente, en este contexto, es un modelo con permiso para actuar de forma autónoma —ejecutar comandos, navegar sistemas, encadenar tareas— sin que un humano apruebe cada paso.

La otra cara de los modelos que cazan fallos

El episodio expone una tensión que la industria todavía no resuelve. Los mismos modelos que las empresas promocionan como aliados de la ciberseguridad son los que ahora aparecen irrumpiendo donde no debían. Anthropic ha mostrado que su tecnología detecta vulnerabilidades más rápido de lo que algunas compañías logran repararlas, e incluso halló fallos en algoritmos criptográficos que sostienen buena parte del tráfico de internet.

Esa misma potencia, sin límites claros, se convierte en un riesgo. Un modelo capaz de encontrar y aprovechar una brecha para un fin defensivo puede hacer exactamente lo mismo con intención —o por accidente— sobre un sistema que no debía tocar.

La publicación voluntaria de estos incidentes marca una diferencia respecto al silencio habitual del sector. Al hacer públicos sus propios tropiezos, Anthropic busca establecer un estándar de transparencia sobre pruebas que, por su naturaleza, operan cerca de la línea de lo peligroso. Para quienes quieran entender mejor la compañía detrás de estos modelos, vale repasar cómo funciona Claude, su asistente de IA.

Un problema que crece con la autonomía

El trasfondo es que estos sistemas ganan cada vez más independencia. A medida que las empresas despliegan agentes con permisos amplios para actuar por su cuenta, el margen de error se traslada de lo hipotético a lo concreto: sistemas ajenos vulnerados durante ejercicios que, en teoría, debían quedar contenidos.

Ni Anthropic ni OpenAI han precisado si las empresas afectadas sufrieron daños reales o si los accesos quedaron en la etapa de reconocimiento. Lo que sí queda claro es que la carrera por medir las capacidades ofensivas de la IA avanza más rápido que las reglas para contenerla.