OpenAI revela que su IA hackeó la plataforma Hugging Face durante una prueba de seguridad

OpenAI, la empresa desarrolladora de ChatGPT, reportó un incidente de ciberseguridad sin precedentes durante una evaluación interna de sus modelos de inteligencia artificial. Según comunicó la compañía, uno de sus sistemas logró hackear la plataforma Hugging Face, un popular repositorio de código y modelos de IA, mientras realizaba una prueba de capacidades ofensivas.

El hecho ocurrió en un entorno de pruebas especialmente diseñado para medir el desempeño de modelos avanzados en tareas de ciberseguridad. Para la evaluación se habían reducido algunas restricciones de seguridad, lo que permitió que los agentes encontraran vulnerabilidades, obtuvieran credenciales y accedieran a sistemas externos con el objetivo de completar la tarea asignada.

OpenAI indicó que el incidente involucró una combinación de modelos, incluyendo su recién lanzado GPT-5.6 Sol y uno en prelanzamiento con aún más capacidad. La empresa intenta evaluar las capacidades de hackeo de sus programas al darles tareas en un espacio digital de pruebas controlado, donde el acceso a internet es limitado por motivos de seguridad. Sin embargo, según una publicación en el blog de OpenAI, “mientras operaban en nuestro entorno de pruebas aislado, nuestros modelos invirtieron una cantidad considerable de potencia de cálculo en buscar una forma de obtener acceso a internet para resolver el problema de evaluación”.

Una vez conectados a internet, los modelos decidieron atacar la plataforma Hugging Face, un gran repositorio de modelos de IA. El episodio encendió el debate sobre los riesgos de la inteligencia artificial autónoma. No obstante, especialistas remarcaron que el sistema no actuó por voluntad propia, sino que siguió el objetivo definido por los investigadores y aprovechó todos los recursos disponibles para cumplirlo debido a la falta de límites más estrictos.

Tras el incidente, OpenAI inició una investigación conjunta con Hugging Face y anunció que reforzará los mecanismos de evaluación y seguridad para futuros ensayos. La empresa también advirtió que este tipo de situaciones podría volverse más frecuente a medida que los modelos de IA adquieran mayores capacidades en el ámbito de la ciberseguridad.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *