OpenAI reconoce que su modelo de IA hackeó a otra empresa por cuenta propia

0
122
OpenAI hackeando
Foto: Xataka

OpenAI y Hugging Face consideran que se trata de un incidente cibernético “sin precedentes” y que podría ser el primer caso divulgado públicamente en el que un modelo de IA se infiltra por su propia cuenta en los sistemas de otra empresa.

La empresa estadounidense de inteligencia artificial (IA) OpenAI comunicó este martes que uno de sus modelos atacó de manera autónoma la infraestructura de la plataforma Hugging Face, especializada en modelos de aprendizaje automático.

“Hemos sufrido un incidente de seguridad grave durante la evaluación de nuestros modelos”, reconoció Sam Altman, CEO y cofundador de OpenAI, en X.

De acuerdo al comunicado, se trata de un incidente cibernético “sin precedentes”, que ambas compañías consideran que podría ser el primer caso divulgado públicamente en el que un modelo de IA se infiltra por su propia cuenta en los sistemas de otra empresa durante una evaluación controlada.

¿Cómo sucedió?

Según detalló OpenAI, el episodio ocurrió en el marco de una evaluación interna diseñada para medir las capacidades cibernéticas avanzadas de varios de sus modelos, incluido el GPT-5.6 Sol, en la que los investigadores desactivaron algunas de las salvaguardas de seguridad integradas y ejecutaron los modelos en un entorno de pruebas aislado con acceso limitado a Internet.

La compañía explicó que los modelos explotaron un fallo de ‘software’ desconocido para acceder a Internet y, posteriormente, vulneraron los sistemas de Hugging Face, en lo que parece haber sido un intento de encontrar las respuestas para una prueba de rendimiento de ciberseguridad. El equipo de seguridad de OpenAI detectó la actividad inusual, mientras que Hugging Face, de manera independiente, identificó y contuvo la intrusión.

“Sospechábamos que el ciberataque de la semana pasada podría haber procedido de un laboratorio de vanguardia, dada la sofisticación del agente. ¡Y resulta que así fue! Hemos pasado las últimas 24 horas trabajando en estrecha colaboración con el equipo de OpenAI”, escribió Clément Delangue, CEO y cofundador de Hugging Face, el martes en X.

“Estamos firmemente convencidos de que no hubo ninguna intención maliciosa por su parte. ¡Es alucinante que todo esto haya ocurrido de forma autónoma!”, agregó.

Asimismo, después del incidente, OpenAI afirmó que está implementando controles de seguridad más estrictos mientras se subsanan las vulnerabilidades, además de reforzar las salvaguardas en torno al futuro entrenamiento y evaluación de modelos de IA.

Análisis

En OpenAI indicaron que este era un hito (involuntario) sin precedentes, aunque algunos expertos en ciberseguridad redujeron la relevancia de lo sucedido. “Esto no es un problema de IA. Es negligencia sobre un estándar de cuarenta años”, explicaba Davi Ottenheimer. Sin embargo y como ocurrió con Mythos, lo que demuestra este suceso es que la IA puede aplicar fuerza bruta y analizar posibles vulnerabilidades (y combinarlas) de una forma que los investigadores humanos no podrían por falta de tiempo.

Un problema de fondo. OpenAI reconoce que los filtros de despliegue que habrían bloqueado el comportamiento del modelo estaban desactivados intencionadamente porque la evaluación tenía como objetivo medir vulnerabilidades. Dierdre Mulligan, profesora en Berkeley, indicaba que “me parece que OpenAI no creó de forma adecuada el sandbox para el entorno de pruebas”. Para ella no estaba claro que superar un test compensara el daño potencial que un modelo de IA podría causar si “escapa” y logra acceso a internet.

Importa el fin, no los medios. Los modelos no tenían el objetivo de hackear Hugging Face: eso solo fue un medio para conseguir su fin último, que era superar el benchmark de ExploitGym. Todo lo que hicieron por el camino —encontrar la vulnerabilidad que les dio acceso a internet, hackear la BBDD de Hugging Face— fue simplemente parte de su plan para superar la prueba propuesta.

Qué han aprendido unos y otros. Tras el incidente, en OpenAI indicaron que están implementando controles más estrictos en la configuración de su infraestructura, además de colaborar con los desarrolladores del componente afectado y con Hugging Face para mejorar sus defensas. Han prometido además mejorar la “alineación” de sus modelos y las labores de monitorización duranet este tipo de pruebas.

 

Con información de Xataka y RT


"La realidad no ha desaparecido, se ha convertido en un reflejo"

Jianwei Xun
Si quieres apoyar nuestro periodismo aporta aquí
Qr dat0s