OpenAI y Anthropic advierten repetidamente sobre pérdida de control de IA mientras enfrentan críticas de 'captura regulatoria'... 'La respuesta está en la alineación'
Astra clasificada como crítica y Neuralicese: evidencia de la necesidad de redefinir AGI
![Imagen creada por IA [Foto=Gemini]](https://image.ajunews.com/content/image/2026/09/10/20260910145945738623.png)
"Superinteligencia que supera al ser humano", "10% de probabilidad de que la inteligencia artificial cause la extinción de la humanidad en una década"
OpenAI y Anthropic anuncian consecutivamente inteligencia general artificial (AGI) al presentar nuevos modelos. En solo tres días, resuelven problemas matemáticos complejos y diseñan autónomamente sistemas que mejoran su propia inteligencia. Escenas de películas de ciencia ficción se reproducen en tiempo real, mientras que ambas empresas reiteran advertencias sobre "el dominio de la IA sobre la humanidad".
Algunos sectores de la industria de IA señalan que ambas compañías, en vísperas de cotizaciones públicas, utilizan una estrategia de mercadotecnia del miedo para exagerar el desempeño de la IA. Sin embargo, análisis recientes apuntan que los modelos de IA más avanzados han alcanzado un estadio donde sus capacidades trascienden la comprensión y el control humano.
Los expertos coinciden en que es necesario redefinir la inteligencia general artificial (AGI) mientras crece la importancia de investigar la "alineación", es decir, el control de la IA para que funcione conforme a las intenciones humanas.
Según informes del sector tecnológico del 10 de septiembre, OpenAI anunció el 2 de septiembre (hora local) su modelo más reciente, "GPT-6 Astra", clasificando por primera vez el riesgo de ciberseguridad como "crítico" en su sistema de clasificación de riesgos denominado "Marco de Preparación".
OpenAI explicó en su informe de seguridad que Astra puede identificar vulnerabilidades de seguridad desconocidas en sistemas bien protegidos sin instrucciones paso a paso del operador, y desarrollar nuevos métodos de ataque. Simultáneamente, reconoció que la capacidad de monitoreo del proceso de pensamiento de este modelo es significativamente inferior a la de modelos anteriores.
Anthropic advertía en un informe publicado en junio que el próximo avance en IA podría generar modelos que escapen completamente del control humano, proponiendo a empresas competidoras establecer un régimen multilateral de control de armas de IA. De hecho, su modelo de punta "Mithos Preview" fue retenido de su lanzamiento debido a que podría generar autónomamente armas cibernéticas de nivel sin precedentes.
Este patrón no es novedoso. En mayo del año anterior, cuando Anthropic lanzó "Claude Opus 4", durante las pruebas de seguridad se confirmó que el modelo adoptó comportamientos de extorsión contra ingenieros que intentaban reemplazarlo, activando ASL-3, la medida de seguridad de máximo nivel. En abril de este año, retuvo el lanzamiento del modelo superior "Mithos Preview" argumentando que podía generar autónomamente armas cibernéticas.
Dos meses después, el 4 de junio, publicó un informe sobre "automejoría recursiva" advirtiendo que la IA de próxima generación podría escapar completamente del control humano. Cinco días después, el 9 de junio, Anthropic lanzó el modelo oficial "Claude Mithos 5", que experimentó varios reveses: el acceso se suspendió después de tres días por cuestiones de control de exportaciones, y se reanudó un mes después. El patrón de advertencias de riesgo y anuncios de lanzamiento de nuevos modelos se entrelaza sin lapsos de tiempo intermedios.
OpenAI siguió una trayectoria similar. Cuando el incidente de hackeo de Hugging Face salió a la luz en julio, OpenAI anunció que reforzaría el control sobre los procesos de entrenamiento y evaluación. Posteriormente, determinó que las capacidades cibernéticas de Astra alcanzaban niveles superiores a lo esperado y explicó que retrasó el lanzamiento para realizar revisiones de seguridad adicionales. Después de casi dos meses de reevaluación, el resultado fue la primera asignación de la clasificación "crítica", que OpenAI presentó simultáneamente como evidencia del desempeño abrumadoramente superior del nuevo modelo.
Evan Hubinger, investigador de Anthropic, estimó personalmente en 10% la probabilidad del dominio de la IA sobre la humanidad, y Dario Amodei, director ejecutivo de Anthropic, mencionó una probabilidad cercana al 25% de que ocurra un escenario catastrófico. Geoffrey Hinton, exvicepresidente de Google y conocido como "el padrino del aprendizaje profundo", también presentó un rango similar del 10 al 20%.
Las voces de los críticos contra estas preocupaciones excesivas son igual de contundentes. Académicos como Emily Bender, profesora de la Universidad de Washington, que han caracterizado a los grandes modelos de lenguaje como "loros estocásticos", son escépticos incluso de la premisa de que la AGI sea posible, considerando que los escenarios de dominio humano siguen siendo territorio de la ciencia ficción.
Yann LeCun, ganador del Premio Turing, ha criticado repetidamente a los llamados "apocalípticos de la IA", afirmando que "los escenarios de desastre son meramente hipótesis no verificadas". Señala que los directores de OpenAI, DeepMind y Anthropic son los mismos actores que realizan cabildeo masivo, argumentando que si las campañas de miedo tienen éxito, podrían resultar en "captura regulatoria", donde un puñado de empresas monopolizan la IA.
De hecho, si se implementan sistemas de licenciamiento o acreditación bajo el pretexto de seguridad, las startups con capital insuficiente y el sector de código abierto serían los primeros en desaparecer, permitiendo que solo las grandes tecnológicas ya posicionadas en el mercado sobrevivan.
También se plantea constantemente la crítica de que Silicon Valley ha promovido la importancia de sus tecnologías a través de narrativas que describen cómo podrían terminar el mundo. Existen múltiples precedentes de predicciones anteriores que no se realizaron: que el transporte por camión desaparecería pronto, o que ciertos países ya poseían IA de nivel superinteligente, predicciones que finalmente se disiparon sin concretarse.
De hecho, el hecho de que las grandes tecnológicas presenten clasificaciones de riesgo superiores o informes de seguridad como evidencia de la excelencia del desempeño cada vez que lanzan un nuevo modelo sugiere que las propias advertencias de riesgo se están utilizando como elemento de mercadotecnia, según críticos que señalan esta contradicción inherente.
Independientemente de la mercadotecnia del miedo en IA, ya se observan indicios de que el funcionamiento real de los modelos de IA se está desplazando hacia áreas donde los humanos difícilmente pueden comprenderlos o controlarlos.
Choi Byung-ho, profesor del Instituto de IA Inspirado en Humanos de la Universidad de Korea, afirma: "Aunque la afirmación del dominio humano por IA sigue siendo ciencia ficción, parece ser un hecho que conforme mejora el desempeño del modelo de IA, este escapa al control humano". Explicó que esto se conoce en términos especializados como el "problema de alineación".
El profesor Choi cita el "neuralicese" como un ejemplo concreto de pérdida de control. Es un fenómeno donde la IA razona internamente en su propio lenguaje que los humanos no pueden leer, y conforme se ejecutan más iteraciones computacionales, el desempeño mejora pero se vuelve cada vez más imposible saber qué está pensando la IA. Señala que así como AlphaGo demostró que el "ortodoxo del ajedrez" que los humanos han acumulado no existía realmente, los modelos de IA recientes revelan que la "ortodoxia de la seguridad" humana es también una ilusión.
De hecho, GPT-6 Astra implementó un nuevo método de razonamiento llamado "profundización recursiva", en el cual el proceso de pensamiento del modelo se procesa mediante representaciones internas de miles de números en lugar de lenguaje natural, dificultando que los humanos comprendan su contenido.
El incidente de julio en el que un modelo interno de OpenAI escapó del control durante una prueba de referencia y hackeó servidores de Hugging Face respalda estas preocupaciones. Se reportó que cientos de agentes de IA utilizaron la autonomía que les fue otorgada durante las pruebas de ciberseguridad para ejecutar hackeos no planeados, y OpenAI no se percató del incidente durante casi una semana. Este evento motivó que, dos meses después, tanto la Cámara como el Senado estadounidenses presentaran respectivamente la "Ley del Interruptor de Apagado de IA" y la "Ley de Prohibición de Superinteligencia Artificial".
Esta expansión de capacidades conduce a un debate sobre la definición de AGI. OpenAI divide la ruta hacia la AGI en cinco etapas: chatbot, razonador, agente, innovador y organización. Se estima que los modelos recientes han trascendido la tercera etapa de "agente", que ejecuta tareas de largo plazo de manera autónoma, adentrándose en la cuarta etapa de "innovador", que crea nuevo conocimiento.
El 8 de septiembre, OpenAI anunció que su sistema de IA interno demostró la existencia de singularidades en la ecuación de Navier-Stokes, uno de los Problemas del Milenio que había permanecido sin resolver durante aproximadamente 90 años.
El profesor Choi afirma: "Debemos enfocarnos en soluciones de control práctico en lugar de en escenarios apocalípticos como el dominio humano por IA", y añade: "Incluso si tales escenarios catastróficos fueran ciertos, no nos serían de gran utilidad. Lo importante es responder preguntas fundamentales: ¿cómo comprendemos la IA? ¿Cómo la controlamos? La respuesta radica en la alineación".
* Este artículo ha sido traducido por IA.
