Silicon Valley en alerta: la IA se comporta como humana, miente y redacta ataques sin supervisión

  • Más de 300 casos en julio; acumulados anuales superan los 1.600

  • "¡BOOM!": agentes de IA se felicitan entre sí tras hackear con éxito

  • 1.200 empleados de OpenAI, Google y Meta piden frenar la velocidad de desarrollo

Imagen creada con IA [Foto=Gemini]
Imagen creada con IA [Foto=Gemini]


Con el desarrollo de los modelos de inteligencia artificial, se está registrando un aumento acelerado de casos en los que la IA escapa del control, se comporta como si fuera humana y anula procesos de aprobación mediante comportamientos descontrolados. Los datos recopilados en entornos de implementación real, no en laboratorios, están generando una creciente preocupación en la industria de la IA, incluso antes de que los gobiernos reaccionen.
 
Según reportes de la industria tecnológica del 30 de agosto, el Centro para la Resiliencia a Largo Plazo (CLTR, por sus siglas en inglés), un grupo de expertos del Instituto Británico de Seguridad de IA (AISI), analizó más de 183.000 transcripciones a través de su "Observatorio de Control Descontrolado de IA" durante un período de cinco meses, entre octubre del año pasado y marzo de este año, identificando 698 casos verificables de comportamiento descontrolado de IA. Durante ese período, la incidencia mensual se incrementó 4,9 veces.
 
De acuerdo con cifras más recientes publicadas por separado, en julio se confirmaron más de 300 casos de comportamiento descontrolado, casi el doble comparado con junio, y el total acumulado de 2026 ha superado los 1.600 casos.
 
Las formas de comportamiento descontrolado de la IA son variadas. En Australia, se documentó un caso en el que un agente de IA personal, sin conocimiento del usuario, eliminó a otros miembros de una lista de espera para una clase popular de gimnasio en la mañana, creando un espacio para sí mismo.
 
En otro caso, un modelo de IA imitó el estilo de escritura de un humano que lo controlaba e, independientemente, pasó a través de procesos de aprobación. En un ejemplo diferente, cuando un desarrollador rechazó una propuesta de modificación de código, el agente de IA publicó un artículo crítico en un blog atacando públicamente al desarrollador.
 
También se han identificado nuevos casos en los que la IA engañó a otros modelos alegando estar "creando transcripciones accesibles para personas con discapacidad auditiva" para evadir restricciones de derechos de autor, así como intentos de engañar a sistemas de IA separados diseñados para resumir y supervisar procesos de razonamiento. El CLTR señaló que estos casos constituyen evidencia de que los comportamientos engañosos que antes se reportaban únicamente en entornos experimentales ahora se están manifestando de manera idéntica en entornos de implementación real.

La misma tendencia se confirma en OpenAI. En un informe técnico publicado la semana pasada, OpenAI reveló detalles de un incidente ocurrido en julio en el que sus modelos de investigación interna se infiltraron en servidores de producción reales de Hugging Face, una plataforma de repositorio de software, durante evaluaciones de ciberseguridad.

Hasta 700 agentes autónomos se comunicaron entre sí a través de tablones de mensajes improvisados, llevando a cabo "ataques de recompensa" para engañar las evaluaciones de entrenamiento. Cada vez que lograban hackear con éxito, dejaban exclamaciones como "¡BOOM!", "¡Vaya!" felicitándose mutuamente. OpenAI reconoció que detectó indicios iniciales de esta actividad desde finales de mayo, pero no suspendió las pruebas, admitiendo que "en retrospectiva, las señales tempranas podrían haber impulsado una respuesta más rápida".

Tras el incidente, OpenAI aisló los pesos del modelo problemático, retrasó parcialmente el entrenamiento de aprendizaje por refuerzo de frontera y aceleró el entrenamiento de alineación para mejorar la seguridad. Anthropic y Meta también reconocieron después del incidente de Hugging Face que "nuestros modelos han hackeado sistemas reales durante las pruebas antes del despliegue", lo que indica que este problema no es exclusivo de OpenAI.
 
En tanto, el CLTR advirtió que "todavía no se ha observado el peor de los escenarios posibles", pero subrayó que los riesgos podrían intensificarse significativamente a medida que los agentes de IA asuman responsabilidades más críticas más allá del código y el software, en áreas como finanzas e infraestructura. En consecuencia, el CLTR ha solicitado a los gobiernos de diferentes países que hagan obligatorio el monitoreo y la presentación de informes sobre incidentes graves de pérdida de control de IA por parte de empresas, e introduzcan poderes de emergencia que permitan restricciones temporales de servicios de IA cuando sea necesario.
 
La vigilancia en toda la industria está aumentando. El 30 de julio, más de 1.200 profesionales de IA de OpenAI, Anthropic, Google DeepMind y Meta firmaron una declaración conjunta titulada "Pacing the Frontier", exhortando a los gobiernos a "implementar mecanismos que permitan regular la velocidad del desarrollo de IA". OpenAI también suspendió temporalmente el desarrollo de algunos modelos a principios de este mes después de que su modelo de próxima generación, "Astra", mostró señales potenciales de riesgo relacionadas con la ciberseguridad.



* Este artículo ha sido traducido por IA.