Los grandes modelos de lenguaje que impulsan a ChatGPT, Claude o Gemini no pueden protegerse por completo frente a ataques, y la causa está en el modo mismo en que funcionan. Así lo sostiene un equipo de investigadores en un trabajo presentado este mes en la Conferencia Internacional sobre Aprendizaje Automático (ICML), uno de los encuentros de referencia del sector. La conclusión tiene consecuencias directas para la seguridad de una tecnología que ya se usa a diario en empresas, escuelas y servicios de atención al cliente.
El argumento central es incómodo para la industria: no se trata de un error puntual que un parche pueda corregir, sino de una limitación estructural. Un modelo de lenguaje —un sistema entrenado con enormes cantidades de texto para predecir la siguiente palabra— procesa todo lo que recibe como una misma corriente de texto. Ahí radica el problema.
Por qué el modelo no distingue una orden de un ataque
Cuando una empresa configura un asistente, le da instrucciones de sistema: reglas sobre qué puede decir y qué debe rechazar. Pero esas instrucciones y los mensajes que escribe el usuario terminan mezclados en el mismo flujo de entrada. El modelo no cuenta con una frontera real que separe «lo que ordena el desarrollador» de «lo que pide quien lo está usando».
Esa confusión de roles es la que aprovechan las técnicas conocidas como inyección de instrucciones (prompt injection) y los llamados jailbreaks, mensajes diseñados para que el modelo ignore sus restricciones. Un atacante puede insertar texto que el sistema interpreta como una orden legítima, y así lograr que revele información que debía ocultar o ejecute acciones que tenía prohibidas.
La implicación práctica es que ningún filtro adicional resuelve el fondo del asunto. Se puede reducir la superficie de ataque, entrenar el modelo para resistir mejor ciertos intentos o añadir capas de verificación, pero mientras la arquitectura mezcle instrucciones y datos en un mismo canal, siempre existirá una vía para engañarlo.
Un riesgo que crece con los agentes de IA
El planteo cobra más peso justo cuando la industria empuja hacia los agentes de IA: sistemas que no solo responden, sino que ejecutan tareas por su cuenta, como leer correos, navegar por la web o mover archivos. Si un agente puede ser manipulado con texto camuflado, las consecuencias dejan de ser una respuesta indebida en un chat para convertirse en acciones reales sobre sistemas y datos.
Ese temor no es hipotético. Ya se han documentado incidentes en los que un agente descontrolado ejecutó miles de acciones no previstas, una muestra de lo que ocurre cuando estos sistemas operan con autonomía y sin barreras infranqueables.
La preocupación por la seguridad de los modelos abiertos también ha empujado ejercicios colectivos para encontrar sus grietas. OpenAI, por ejemplo, organizó una competencia de red-teaming sobre su modelo gpt-oss-20b, invitando a la comunidad a exponer vulnerabilidades antes de que lo hagan actores malintencionados.
Qué cambia para usuarios y empresas
La lectura de los investigadores no es que estos sistemas sean inutilizables, sino que conviene abandonar la idea de una seguridad perfecta. Para quien despliega un asistente con acceso a información sensible, eso obliga a diseñar con la sospecha de que el modelo puede ser engañado: limitar sus permisos, aislar lo que puede tocar y sumar controles externos que no dependan de la buena voluntad del propio modelo.
El hallazgo apunta a una tensión que acompañará a la tecnología mientras conserve su diseño actual. Cuanto más capaz y autónomo se vuelve un modelo de lenguaje, más terreno hay que proteger, y la propia forma en que aprende sigue dejando la puerta entreabierta.
