Claude atacó sistemas reales: Anthropic confirma tres incidentes en evaluaciones de ciberseguridad
Los modelos de inteligencia artificial Claude atacaron sistemas reales en tres incidentes distintos durante evaluaciones de ciberseguridad, reveló Anthropic este jueves. La compañía atribuyó los casos a una falla de contención que rompió el aislamiento de internet y permitió que los modelos accedieran a infraestructura de producción de empresas reales.
La revisión se activó luego de que OpenAI informara sobre un incidente similar el 21 de julio de 2026. Anthropic comenzó un análisis de más de 141 mil ejecuciones de sus modelos el 23 de julio y suspendió todas las evaluaciones al día siguiente. El examen identificó seis ejecuciones relacionadas con tres incidentes. Los casos más antiguos se remontan a abril de 2026.
Detalles de los incidentes en los que Claude atacó sistemas reales
Los ejercicios, diseñados en colaboración con la empresa de seguridad Irregular, debían funcionar sin conexión externa. Una configuración incorrecta dejó abiertas rutas hacia internet y los modelos interpretaron la infraestructura real como parte de las simulaciones. Anthropic no encontró indicios de que los modelos intentaran escapar de los entornos ni persiguieran objetivos propios. Los tres casos expusieron una tendencia del sistema a priorizar la tarea asignada por encima de señales de riesgo evidentes.
Claude Opus 4.7 vulneró una base de datos con cientos de registros
El primer incidente se originó porque la empresa ficticia del ejercicio compartía nombre con el dominio activo de una compañía real. Claude Opus 4.7 no localizó el objetivo simulado y comenzó a buscar en la infraestructura disponible en internet. Obtuvo credenciales de aplicaciones y accedió a una base de datos con varios cientos de registros de producción. El modelo reconoció en cuatro ejecuciones que probablemente operaba en sistemas reales, pero no suspendió el ataque. En dos ocasiones racionalizó que la empresa real había sido incluida a propósito en la evaluación. Anthropic considera este caso el de mayor impacto.
Claude Mythos 5 publicó código malicioso en PyPI
El segundo incidente comenzó cuando Claude Mythos 5 encontró instrucciones ficticias que pedían instalar un paquete de Python inexistente. El modelo, un sistema que ya había detectado fallos matemáticos en dos algoritmos criptográficos en pruebas anteriores, decidió registrar ese nombre y publicar un paquete con código malicioso en PyPI. Para abrir la cuenta necesitaba un correo electrónico; el proveedor exigía verificación telefónica y el modelo intentó sin éxito conseguir fondos para pagar el servicio. Luego encontró un proveedor sin esa restricción y completó el registro. El paquete permaneció disponible durante una hora y se descargó y ejecutó en 15 sistemas reales antes de ser retirado por los mecanismos de seguridad de PyPI. Uno de esos sistemas pertenecía a una empresa de ciberseguridad, lo que permitió al modelo recolectar credenciales y acceder a otros componentes de su infraestructura.
Mythos 5 interpretó las autoridades certificadoras genuinas que no reconocía y una fecha del año 2026 como señales de que el entorno era parte de la simulación. El modelo razonó que publicar el paquete sería un ataque real si existía conexión a internet, pero se convenció de que seguía dentro del ejercicio. Anthropic señaló que los pasos que dio para llevar a cabo el ataque “probablemente habrían indicado a un participante humano que ya no se trataba solo de una evaluación”.
Un prototipo interno examinó 9 mil objetivos y detuvo el ataque por sí mismo
El tercer incidente involucró un modelo de investigación que no tiene previsto un lanzamiento comercial. Al no encontrar el objetivo ficticio, el sistema rastreó cerca de 9 mil objetivos en internet y comprometió la aplicación pública de una empresa mediante credenciales expuestas en una página de depuración y una vulnerabilidad de inyección SQL. Esta vez el modelo cambió de comportamiento al verificar que el sistema pertenecía a una cuenta en la nube ajena a la evaluación. Concluyó por cuenta propia que el objetivo era real y suspendió el ataque sin recibir instrucciones adicionales.
Anthropic informó a la empresa de seguridad Irregular el 27 de julio e intentó contactar a las tres organizaciones afectadas. Solo logró comunicarse con dos; ninguna había detectado la actividad previa. La compañía anunció que reforzará la validación de conexiones, el monitoreo de pruebas y los controles a proveedores externos. METR, una entidad independiente, revisará los registros de los incidentes.
Comunidad Arepa
Únete a nuestros canales principales
Comentarios
Relacionados
Ver más
OpenAI Astra resuelve 10 problemas de matemáticas que llevaban décadas sin avances

Alibaba presenta Qwen 3.8-Max, su nuevo modelo de IA con 2,4 billones de parámetros
