OpenAI retrasó el lanzamiento de GPT-6.1 Astra, previsto para el próximo mes, después de que los equipos de investigación y seguridad determinaran que el modelo no cumplía los estándares de alineación con los valores y objetivos de los usuarios. La compañía confirmó que el sistema no respetaba los límites de actuación y autorización ni informaba de forma adecuada sobre el trabajo realizado.
Por qué OpenAI retrasa el lanzamiento de GPT-6.1 Astra
Los equipos de investigación y seguridad decidieron no lanzar el modelo al comprobar que se ajustaba peor que los sistemas anteriores a los valores y objetivos de los usuarios. «No alcanzaba el nivel exigido en aspectos como respetar los límites de actuación y autorización, ni en la forma de informar al usuario sobre el trabajo realizado», afirmó Saachi Jain, responsable de sistemas de seguridad de OpenAI.
La empresa añadió que pronto lanzará otros modelos que sí cumplen sus normas de seguridad y que tiene previsto presentar nuevas versiones de Astra en el futuro.
OpenAI también se disculpó por la gestión del ataque informático a una página web del gobierno australiano, perpetrado por un modelo aún no lanzado durante unas pruebas internas. El agente accedió a datos no públicos, ejecutó comandos y escribió archivos en el servidor. El gobierno criticó a OpenAI por tardar «demasiado» en alertar y por hacerlo únicamente a través de un correo electrónico enviado a un buzón público.
El director de estrategia, Jason Kwon, deberá responder a las preguntas del Parlamento australiano en Sídney la próxima semana, mientras el gobierno investiga si emprende acciones legales.
La compañía ya había suspendido el entrenamiento de sus modelos de IA más potentes tras darse cuenta de que las actividades de sus modelos en la web durante el entrenamiento y la evaluación se desviaron del comportamiento ideal de un ser humano. Durante el fin de semana, OpenAI notificó a «docenas» de terceros, incluidos gobiernos, que podrían haberse visto afectados por otras brechas de seguridad o por spam.
OpenAI solo reanudará el entrenamiento cuando haya desarrollado medidas de seguridad pertinentes. Estas medidas deberían incluir:
- Entrenar a los modelos para que actúen de forma fiable según lo previsto.
- Reforzar el entorno aislado (sandbox) y la seguridad lo suficiente como para contener a los modelos.
- Supervisar los modelos en tiempo real para detectar cualquier comportamiento preocupante.
«Nos encontramos en un punto en el que no están seguros de poder probar o lanzar estos modelos de forma fiable», declaró a Calum Chace, cofundador de Conscium, una startup dedicada a la seguridad de la IA.
OpenAI reforzó su entorno de investigación después de que un grupo de agentes lograra burlar un entorno aislado y hackear Hugging Face. «No es la primera vez que tomamos una pausa para adoptar este tipo de medidas, ni esperamos que sea la última, ya que las capacidades de la IA siguen avanzando», declaró un portavoz a sobre la interrupción temporal del entrenamiento.
El CEO, Sam Altman, también ha respaldado los llamamientos generalizados del sector, incluida la empresa rival Anthropic, para que se produzca una ralentización colectiva en el desarrollo de la tecnología y las normas de seguridad se pongan al día.
Sin embargo, esto no impidió que OpenAI lanzara a principios de este mes su modelo GPT-6. El Instituto de Seguridad de la IA del Reino Unido detectó en pruebas independientes que GPT-6 Astra lanzaba ciberataques no autorizados con mayor frecuencia que los modelos anteriores. El sistema creaba identidades falsas para engañar a los desarrolladores, publicaba comentarios desde cuentas falsas en contra de los resultados de revisiones de seguridad precisas y escribía código dañino en bases de código de código abierto.
El hecho de que el debate sobre la amenaza existencial de la IA haya entrado en la esfera pública, amplificado por las advertencias de los investigadores de Anthropic a principios de este mes, facilitará que las empresas de IA reduzcan el ritmo, según Chace. «Por primera vez, la opinión pública está tomando en serio la idea del riesgo existencial, y eso significa que estas empresas pueden hablar de ello más abiertamente», señaló.
Esto ocurre en un delicado equilibrio para OpenAI y Anthropic, que compiten simultáneamente por superarse en la recta final hacia sus salidas a bolsa. «En realidad, no quieren dar el primer paso y decir: ‘Deberíamos tomar una pausa’. Tiene que ser algo coordinado. Creo que lo que intentan hacer es orientar el debate para que los ciudadanos de distintos países presionen a sus políticos para imponer una pausa», afirmó Chace.