Los mismos mecanismos que OpenAI y Anthropic instalaron para evitar que sus modelos ayuden a ciberdelincuentes están estorbando a quienes trabajan del lado defensivo. Investigadores de seguridad ofensiva —profesionales que buscan vulnerabilidades desconocidas y desarrollan herramientas para explotarlas antes de que lo hagan los atacantes— sostienen que las restricciones de estos sistemas les complican tareas legítimas, según recogió TechCrunch tras hablar con varios de ellos.

El conflicto es de fondo. Un modelo de lenguaje entrenado para rechazar cualquier petición que huela a intrusión no distingue con facilidad entre un delincuente que quiere colarse en un sistema ajeno y un especialista contratado para poner a prueba las defensas de una empresa. Para la máquina, ambos escriben peticiones parecidas.

Qué hacen estos investigadores

El trabajo consiste en encontrar y, en ocasiones, vender los llamados «zero-days»: fallas de seguridad que el fabricante del software todavía desconoce y para las que, por lo tanto, no existe parche. Analizar código en busca de esos huecos, redactar pruebas de concepto o automatizar parte del proceso son actividades cotidianas en esta disciplina. Cuando un asistente de IA se niega a colaborar en cualquiera de ellas, el profesional pierde una herramienta que ya había incorporado a su flujo de trabajo.

Las barreras de seguridad, conocidas en inglés como guardrails, son las reglas y filtros que las compañías aplican para que sus modelos no generen contenido peligroso. Su lógica es preventiva: ante la duda, rechazar. Ese sesgo hacia la negativa es el que choca con un campo donde la línea entre ataque y defensa se define por la intención y el contrato, no por el texto de la petición.

Las empresas ensayan accesos verificados

Tanto OpenAI como Anthropic reconocen la tensión y han empezado a ofrecer vías diferenciadas para usuarios de confianza. OpenAI presentó su programa Trusted Access for Cyber, orientado a ampliar el acceso a capacidades de ciberdefensa para actores verificados. Anthropic, por su parte, puso en marcha un Cyber Verification Program con salvaguardas en tiempo real sobre sus modelos Claude Opus y Sonnet.

La idea detrás de ambos esquemas es la misma: verificar quién está del otro lado para relajar las restricciones solo con quienes demuestran un uso legítimo. Es una respuesta razonable, aunque traslada al investigador la carga de acreditarse y deja fuera, al menos por ahora, a buena parte de la comunidad que trabaja de forma independiente.

Un equilibrio difícil de calibrar

El dilema no tiene solución sencilla. Si los filtros son demasiado estrictos, penalizan a los profesionales que refuerzan la seguridad de todos. Si son demasiado laxos, entregan capacidades ofensivas a cualquiera que sepa formular la pregunta adecuada. Las compañías caminan sobre esa cuerda floja mientras sus modelos se vuelven más capaces de razonar sobre código.

El sector ya explora caminos alternativos. Herramientas como los modelos abiertos que Cisco lanzó para detectar fallas en el código apuntan a un enfoque especializado, donde la seguridad se construye pensando en el defensor desde el diseño. Mientras tanto, los investigadores de seguridad ofensiva seguirán negociando, petición por petición, con asistentes programados para desconfiar de ellos.