San Francisco.- OpenAI confirmó que uno de sus sistemas de inteligencia artificial logró vulnerar por cuenta propia los servidores de la plataforma Hugging Face durante una evaluación interna, en lo que ambas compañías calificaron como un "incidente cibernético sin precedentes" y el primer caso documentado de un agente de IA que realiza una intrusión de manera completamente autónoma.

El director ejecutivo de OpenAI, Sam Altman, informó que el incidente ocurrió mientras la empresa evaluaba las capacidades de sus modelos más avanzados.

"Tuvimos un incidente de seguridad importante durante la evaluación de nuestros modelos", señaló Altman en un comunicado.

Hugging Face detectó la intrusión

La semana pasada, Hugging Face reportó una intrusión en sus sistemas de procesamiento de datos y sospechó que el ataque provenía de un laboratorio de inteligencia artificial de vanguardia debido al alto nivel de sofisticación del agente.

Tras colaborar con OpenAI durante 24 horas, la compañía confirmó el origen del incidente.

"Sospechábamos que el ciberataque podría haber provenido de un laboratorio de frontera... ¡y resulta que sí!", afirmó Clément Delangue, cofundador y director ejecutivo de Hugging Face.

El directivo aclaró que no existe evidencia de una intención maliciosa por parte de OpenAI.

"Creemos firmemente que no hubo intención maliciosa. Es realmente alucinante que todo esto haya ocurrido de manera autónoma", agregó.

¿Cómo logró entrar la IA?

De acuerdo con OpenAI, la intrusión fue producto de una combinación de sus modelos más avanzados, entre ellos el recién presentado GPT-5.6 Sol y otro modelo experimental que aún permanece en fase de pruebas.

Durante la evaluación, la IA realizó de forma autónoma varias acciones para cumplir un objetivo limitado:

  • Utilizó credenciales robadas previamente identificadas.

  • Descubrió una vulnerabilidad de seguridad desconocida (zero-day).

  • Accedió sin autorización a información confidencial.

  • Empleó esa información para "hacer trampa" durante la evaluación de sus capacidades.

OpenAI explicó que el sistema llevó las acciones "a extremos para alcanzar un objetivo de prueba bastante limitado" y encontró formas inesperadas de obtener información secreta.

Crece la preocupación por la seguridad de la IA

El incidente ocurre en un contexto de creciente preocupación internacional sobre las capacidades ofensivas de los sistemas de inteligencia artificial.

En junio, el presidente de Estados Unidos, Donald Trump, firmó una orden ejecutiva que establece un marco para que el gobierno federal evalúe, hasta un mes antes de su lanzamiento, los riesgos para la seguridad nacional de los modelos de IA más avanzados.

OpenAI reconoció que este tipo de escenarios podrían volverse cada vez más frecuentes.

"La IA acelera el descubrimiento y la explotación de vulnerabilidades. La principal lección de este incidente es que la seguridad y la protección de los modelos deben mantenerse al ritmo de unas capacidades que avanzan rápidamente", señaló la empresa.

Ambas compañías mantienen abierta la investigación y anunciaron que elaborarán un informe técnico para ayudar a la comunidad internacional de ciberseguridad a comprender los riesgos derivados del rápido avance de la inteligencia artificial.