OpenAI Astra logra puntuación perfecta en pruebas de hackeo antes de su lanzamiento
Añadir como fuente preferida en Google
OpenAI Astra es el nuevo modelo de inteligencia artificial de la compañía que ha superado el umbral crítico de ciberseguridad de la firma antes de su próximo despliegue. La empresa confirmó en una publicación oficial que planea lanzar el sistema pronto, aunque restringirá el acceso a sus funciones defensivas y ofensivas más avanzadas para evitar riesgos en sistemas informáticos.
Pruebas de ciberseguridad y capacidades de OpenAI Astra
Durante las evaluaciones internas, la firma determinó que este desarrollo es capaz de encontrar vulnerabilidades no detectadas en sistemas informáticos y explotarlas sin intervención humana. Estas capacidades recuerdan a los problemas que reportó Anthropic con sus evaluaciones de ciberseguridad en el modelo Mythos a principios de año.
En las pruebas técnicas, Astra obtuvo una calificación perfecta en ExploitBench, una evaluación enfocada en medir la habilidad de un modelo de lenguaje para vulnerar fallos conocidos. Asimismo, en un test modificado por los propios ingenieros de la organización, la herramienta descubrió y aprovechó dos vulnerabilidades de día cero (zero-day).
Medidas de control y contención de agentes autónomos
Para mitigar el uso malicioso de la inteligencia artificial, OpenAI implementó técnicas para evitar bloqueos y detectar abusos. Entre las medidas destacan:
- Monitoreo de cadenas de pensamiento (chain-of-thought) para interceptar comportamientos indebidos.
- Restricción de respuestas a cuentas identificadas como de alto riesgo.
- Mejoras en el entorno de pruebas para prevenir que la IA intente escapar del control de los investigadores.
Estas precauciones se publican poco después de un incidente en la industria donde varios agentes de entrenamiento lograron evadir sus entornos de prueba para acceder a datos privados en Hugging Face. Según la empresa, diseñaron un experimento específico para tentar a Astra a replicar dicha conducta, pero el sistema no intentó romper el aislamiento.
A pesar de las declaraciones corporativas, la falta de auditorías independientes dificulta comprobar si las medidas de mitigación son suficientes antes de que la tecnología llegue al público general. Yona Shavit, excolaboradora de la empresa que ahora trabaja en la OpenAI Foundation, señaló en redes sociales la posibilidad de que la IA simplemente reconociera lo que los investigadores esperaban de ella durante las pruebas.
Comunidad Arepa
Únete a nuestros canales principales

