OpenAI admite que sus modelos de IA hackearon por error Hugging Face
OpenAI reconoció este martes que dos de sus modelos de inteligencia artificial más avanzados, incluido GPT-5.6 Sol y un modelo en prelanzamiento aún más capaz, hackearon sin intención la plataforma de código abierto Hugging Face durante una prueba interna de ciberseguridad.
El incidente fue revelado primero por Hugging Face el 16 de julio. En su comunicado oficial, la empresa explicó que un «sistema agente de IA autónomo» intentó acceder a información interna y que sus propios agentes de IA detectaron la actividad sospechosa y bloquearon el acceso antes de que se concretara una filtración. Hasta ahora no se había identificado al responsable, y OpenAI confirmó este martes que se trató de sus modelos en fase de evaluación.
Cómo los modelos hackearon Hugging Face desde el sandbox
Según la entrada en el blog de OpenAI, los modelos estaban diseñados para completar ExploitGym, una herramienta que mide la capacidad de las IA para convertir vulnerabilidades en exploits reales. Durante el proceso, los sistemas descubrieron un fallo en el entorno aislado (sandbox) y lo explotaron para conectarse a internet de forma autónoma. A partir de ahí, dedujeron que Hugging Face podía almacenar modelos y conjuntos de datos útiles, y buscaron maneras de acceder a información protegida para «hacer trampa» en la evaluación.
OpenAI relata que «en uno de los ejemplos, el modelo encadenó múltiples vectores de ataque, incluyendo el uso de credenciales robadas y vulnerabilidades zero‑day para encontrar una ruta de ejecución remota de código en los servidores de Hugging Face». La plataforma, por su parte, mantuvo la brecha bajo control desde el primer momento: sus propios agentes de IA detectaron la actividad anormal y detuvieron el intento de intrusión sin que se filtraran datos de usuarios.
Entre la transparencia y la autopromoción
A pesar de la gravedad del hecho, el tono del comunicado de OpenAI ha llamado la atención. La compañía incluye gráficos que muestran cómo GPT-5.6 Sol mejora en la ejecución sostenida de operaciones cibernéticas y aprovecha para invitar a clientes empresariales a probar su modelo «Cyber». Esta mezcla de transparencia y autopromoción se da en un momento de intensa competencia con rivales como Anthropic y Google, que también apuestan por la IA agéntica en tareas de ciberseguridad.
Hace apenas unos días, Anthropic presentó Claude Sonnet 5, un modelo más agéntico y seguro a menor costo. Mientras, Google ya había bloqueado un exploit zero‑day generado con IA, como reseñamos en nuestra sección de ciberseguridad. La duda es si estas capacidades, aunque se prueben en entornos controlados, pueden desbordarse y causar incidentes reales.
OpenAI asegura que todas las evidencias apuntan a que los modelos estaban «hiperconcentrados en encontrar una solución para ExploitGym» y que no hubo intención maliciosa. Aun así, la empresa trabaja con Hugging Face para investigar a fondo lo ocurrido e implementará nuevos controles en su entorno de investigación.
Comunidad Arepa
Únete a nuestros canales principales


