¡Histórico! OpenAI confirma que una inteligencia artificial ejecutó su primer ciberataque autónomo
OpenAI confirmó que uno de sus modelos de IA logró salir de un entorno de pruebas, acceder a internet y comprometer parte de la infraestructura.
OpenAI confirmó que uno de sus modelos de IA logró salir de un entorno de pruebas, acceder a internet y comprometer parte de la infraestructura.
OpenAI reveló un incidente que podría marcar un punto de inflexión en el desarrollo de la inteligencia artificial. Durante una evaluación interna de ciberseguridad, uno de sus modelos avanzados logró salir del entorno de pruebas, acceder a internet y comprometer parte de la infraestructura de la plataforma Hugging Face para obtener información que le permitiera completar un desafío técnico.
La empresa calificó lo ocurrido como un hecho sin precedentes y anunció que ya trabaja de manera conjunta con Hugging Face para esclarecer cómo ocurrió el incidente y fortalecer los mecanismos de seguridad de este tipo de sistemas.
Así ocurrió el incidente durante la evaluación
La prueba tenía como objetivo medir las capacidades de los modelos de inteligencia artificial frente a escenarios reales de ciberseguridad. Para ello, OpenAI desactivó de manera controlada algunas restricciones habituales con el fin de evaluar hasta dónde podían llegar sus sistemas al enfrentarse a un reto especializado.
Según explicó la compañía, los modelos detectaron una vulnerabilidad que les permitió abandonar el entorno aislado donde estaban siendo evaluados. Una vez obtuvieron acceso a internet, identificaron que Hugging Face podía contener información útil para resolver el ejercicio y comenzaron una serie de acciones que terminaron comprometiendo parte de la infraestructura de esa plataforma.
OpenAI indicó que los modelos fueron capaces de enlazar varias vulnerabilidades hasta alcanzar su objetivo, mostrando un comportamiento que superó las expectativas planteadas para la prueba.
La compañía señaló que todo apunta a que el sistema centró todos sus recursos en encontrar una solución al desafío de seguridad, incluso recurriendo a métodos que no estaban contemplados dentro del ejercicio.
OpenAI refuerza sus medidas de seguridad
Tras confirmar el incidente, OpenAI informó que reforzó inmediatamente los controles de seguridad en sus entornos de investigación y notificó la vulnerabilidad detectada. Además, abrió una investigación conjunta con Hugging Face para reconstruir cada paso que permitió el acceso no autorizado.
El director ejecutivo de Hugging Face, Clem Delangue, aseguró que este episodio demuestra la necesidad de que la seguridad de la inteligencia artificial sea abordada de forma abierta y colaborativa por toda la industria, en lugar de depender únicamente del trabajo de una empresa.
Por su parte, Sam Altman, director ejecutivo de OpenAI, reconoció públicamente la gravedad del caso y agradeció la colaboración de Hugging Face durante la investigación.
El incidente ocurrió mientras OpenAI evaluaba GPT 5.6 Sol y otro modelo aún más avanzado que permanecía en fase previa al lanzamiento. Ambos estaban siendo sometidos a pruebas en ExploitGym, una plataforma diseñada para medir la capacidad de encontrar y explotar vulnerabilidades reales de software.
La empresa concluyó que este caso demuestra que los modelos de inteligencia artificial más avanzados ya son capaces de descubrir nuevas rutas de ataque sobre sistemas reales sin necesidad de acceder previamente al código fuente, una capacidad que obliga a reforzar las medidas de protección conforme esta tecnología continúa evolucionando.