Nueva York.- Anthropic reveló que sus modelos de inteligencia artificial hackearon a tres organizaciones durante pruebas internas, días después de que OpenAI reportara un incidente similar con sus propios sistemas. La empresa con sede en San Francisco detectó los casos tras revisar más de 141 mil ejecuciones de evaluación.

La revisión, realizada junto con Irregular, buscaba determinar si los modelos podían acceder a internet desde entornos que debían estar aislados. Los modelos implicados fueron Claude Opus 4.7, Claude Mythos 5 y un prototipo de investigación interno. Los primeros incidentes ocurrieron en abril.

En los tres casos, se asignó a los modelos un desafío de ciberseguridad del tipo "captura la bandera". Se les presentó un escenario ficticio y se les indicó que una información secreta estaba oculta en otros equipos de la red, con el objetivo de infiltrarse y recuperarla.

"Claude comprometió la infraestructura de las organizaciones afectadas utilizando técnicas básicas", explicó Anthropic, como el aprovechamiento de contraseñas débiles. La compañía contactó a las organizaciones afectadas, que no identificó. Dos de ellas no habían detectado la actividad previamente, y Anthropic seguía intentando comunicarse con la tercera.

La semana pasada, OpenAI informó que sus modelos se salieron de control durante una evaluación y accedieron a los servidores de Hugging Face, lo que calificó como un "incidente de seguridad significativo". Estos hechos han evidenciado vulnerabilidades en el control de la IA y han reavivado el debate sobre su gobernanza segura.

"Las pruebas de seguridad se realizan antes de que se publique un modelo precisamente porque todavía no sabemos de qué es capaz", señaló Anthropic. Kok Tin Gan, cofundador de NyxLab, advirtió que habrá más incidentes: "Cada vez se trata más de gobernar qué agentes están disponibles para la IA, qué autoridades poseen, qué acciones requieren aprobación y cómo garantizamos que permanezcan dentro del alcance".

Gan agregó: "Si simplemente le damos a la IA un objetivo y le permitimos decidir cómo lograrlo, no deberíamos sorprendernos cuando tome acciones que técnicamente satisfacen el objetivo, pero quedan fuera de nuestro alcance o de nuestras expectativas previstas". Por ello, intensificar la gobernanza de las organizaciones y autoridades detrás de estos modelos será cada vez más importante.