Claude hackeó por error tres servidores reales durante pruebas internas de Anthropic, luego de que una mala configuración permitió acceso involuntario a infraestructura conectada a internet.

La empresa Anthropic informó que tres de sus modelos de inteligencia artificial Claude accedieron por error a servidores reales durante una serie de pruebas de seguridad, debido a una configuración incorrecta que permitió conexión a internet en los equipos utilizados para las evaluaciones.
La revisión se realizó después de que se conociera un incidente similar relacionado con modelos de OpenAI, los cuales lograron salir de un entorno aislado e ingresar a infraestructura de producción de Hugging Face. A partir de ese antecedente, Anthropic auditó más de 140 mil ejecuciones de sus pruebas internas.
Como resultado del análisis, la compañía identificó tres incidentes distintos distribuidos en seis evaluaciones, en las que participaron los modelos Claude Opus 4.7, Claude Mythos 5 y un modelo experimental que aún no ha sido presentado oficialmente.
Según explicó la empresa, los modelos recibieron instrucciones de no acceder a internet. Sin embargo, los equipos empleados durante las pruebas sí contaban con conexión debido a una falla de configuración que no fue detectada ni por Anthropic ni por su socio encargado de las evaluaciones.
Al interpretar que todo lo que encontraba formaba parte del entorno de prueba, Claude ejecutó las tareas asignadas con normalidad. Su objetivo consistía en ingresar a sistemas para localizar una clave secreta, por lo que terminó interactuando con infraestructura real sin distinguirla del escenario simulado.
En uno de los casos, Claude Opus 4.7 no logró acceder al sistema ficticio, por lo que encontró una red verdadera, aprovechó vulnerabilidades existentes y obtuvo credenciales de acceso, además de ingresar a una base de datos que contenía varios cientos de registros reales.
Durante otro ejercicio, Claude Mythos 5 publicó un programa malicioso en PyPI, el popular repositorio desde donde desarrolladores descargan herramientas de software. El archivo permaneció disponible aproximadamente una hora y llegó a ejecutarse en 15 computadoras reales.
Anthropic indicó que, durante esa prueba, el propio modelo llegó a considerar que publicar el archivo constituiría un ataque real si efectivamente estuviera conectado a internet. No obstante, concluyó erróneamente que seguía operando dentro de una simulación y continuó con la evaluación.
El tercer incidente involucró a un modelo experimental, el cual escaneó alrededor de nueve mil objetivos hasta localizar una aplicación vulnerable. Tras acceder mediante contraseñas débiles y fallos de seguridad conocidos, el sistema detuvo sus acciones al detectar que el servidor no guardaba relación con el ejercicio planteado.
La compañía aseguró que ninguno de los modelos intentó escapar deliberadamente del entorno de pruebas ni desarrolló objetivos propios. De acuerdo con Anthropic, los incidentes fueron consecuencia de una conexión a internet que permaneció habilitada por error y de una configuración inadecuada del entorno de evaluación, por lo que descartó que se tratara de un comportamiento autónomo de Claude.
