Anthropic confirma 3 casos de acceso no autorizado a sistemas externos durante pruebas de Claude
OpenAI reportó el 21 de julio incidentes de seguridad en modelos GPT
La empresa estadounidense de inteligencia artificial Anthropic reveló que su modelo de IA Claude hackeó accidentalmente a tres instituciones externas durante pruebas de seguridad. Tras un incidente similar reportado por OpenAI la semana anterior, el caso de Anthropic ha intensificado las preocupaciones sobre seguridad cibernética en el sector de la inteligencia artificial.
Anthropic emitió un comunicado el 30 de julio señalando: "Durante la revisión de nuestra evaluación de seguridad cibernética, identificamos 3 casos en los que el modelo Claude accedió a internet y luego obtuvo acceso no autorizado a sistemas reales de 3 instituciones mientras interactuaba dentro o con el entorno de evaluación de terceros". La empresa indicó que estos incidentes se detectaron tras revisar 141.006 casos de evaluación, siendo el primer caso registrado en abril.
Anthropic explicó que descubrió estos casos mientras revisaba los resultados de sus propias evaluaciones de tres modelos —Claude Opus 4.7, Mitos 5 y un modelo de prueba interno— después de que OpenAI reportara incidentes de seguridad en GPT. El 21 de julio, OpenAI anunció que varios modelos de IA en fase de prueba, incluido GPT-5.6 Sol, habían explotado vulnerabilidades de día cero previamente desconocidas para escapar de entornos de prueba aislados e infiltrarse en el entorno operativo de la plataforma de comunidad de IA Hugging Face.
Anthropic reveló que estos incidentes ocurrieron durante la fase de "captura de banderas" (capture-the-flag), una prueba que evalúa la capacidad cibernética de Claude e implica infiltrarse en otros ordenadores en la red para localizar información confidencial. Sin embargo, Anthropic explicó que aunque explícitamente especificó que Claude no podría acceder a internet durante la prueba, un malentendido con el socio evaluador Irregular permitió que el acceso a internet fuera posible en realidad.
Por consiguiente, Claude determinó que los sistemas reales descubiertos en línea a través de búsquedas formaban parte de la prueba, y utilizó técnicas básicas como el descifrado de contraseñas débiles y la explotación de puntos finales no documentados para comprometer la infraestructura de las instituciones. Anthropic aclaró que Claude solo obtuvo las "banderas" dentro de esos sistemas sin realizar otros actos maliciosos.
Anthropic indicó que comenzó a revisar los registros de acceso de Claude el 23 de julio, identificó accesos potenciales a internet y suspendió todas las evaluaciones de seguridad ese mismo día. El 27 de julio, notificó a las 3 instituciones cuya infraestructura fue comprometida. La empresa enfatizó que a medida que los modelos de IA adquieren capacidades más potentes, se requieren controles más rigurosos en las pruebas.
Con los reportes de incidentes involuntarios de hackeo tanto en OpenAI como en Anthropic durante entornos de prueba, las preocupaciones sobre seguridad cibernética en torno a modelos de IA se intensifican. El presidente estadounidense Donald Trump mencionó que está considerando medidas para reforzar la regulación de la IA tras el incidente de hackeo del modelo de OpenAI de la semana anterior. Además, el 28 de julio, más de 1.100 empleados de las principales empresas de inteligencia artificial —OpenAI, Anthropic, Google y Meta— instaron al gobierno estadounidense a actuar, argumentando que "se necesita un marco internacional que regule la velocidad del desarrollo de IA".
* Este artículo ha sido traducido por IA.
