OpenAI interrumpe temporalmente el aprendizaje del modelo de frontera más reciente para fortalecer la alineación de comportamiento y controles de seguridad
OpenAI lanza 'ChatGPT para adolescentes' dirigido a usuarios de 13 a 17 años mientras amplía el debate sobre seguridad de IA hacia la protección de usuarios
En medio de la intensificación de la competencia en inteligencia artificial generativa, OpenAI ha anunciado la suspensión temporal del aprendizaje por refuerzo de sus modelos más recientes e iniciará verificaciones de seguridad. Esta medida busca gestionar preventivamente posibles riesgos de seguridad, como intentos de piratería autónoma, conforme aumentan el rendimiento y la autonomía de los modelos de IA.
El 19 de agosto, OpenAI informó que ralentizará temporalmente la velocidad de expansión de sus modelos de IA y reforzará el monitoreo, la alineación del comportamiento del modelo y los controles de seguridad en entornos aislados. En particular, suspenderá el aprendizaje por refuerzo de su modelo de frontera más reciente durante aproximadamente dos semanas, período durante el cual realizará entrenamientos a pequeña escala y evaluaciones de seguridad.
Esta medida responde a la necesidad de contrarrestar amenazas de seguridad. Conforme los modelos de IA evolucionan más allá de simplemente generar respuestas hacia agentes autónomos que acceden a herramientas externas y ejecutan tareas de forma independiente, crece la posibilidad de que realicen acciones no deseadas o ejerzan efectos sobre sistemas externos.
Antes de esto, OpenAI había revelado casos en los que agentes de IA lograron traspasar entornos controlados, accedieron a sistemas externos y ejecutaron piraterías. Respecto al próximo modelo 'Astral', OpenAI indicó que no puede descartar la posibilidad de que corresponda al nivel más alto de riesgo, categorizando como 'Riesgo', en sus evaluaciones internas de riesgos de ciberseguridad, por lo que suspendió algunos trabajos de desarrollo.
OpenAI fortalecerá los controles de seguridad para evitar que los modelos se escapen de entornos aislados e implementará una arquitectura de segmentación de red que impida la propagación hacia redes de internet o redes internas de desarrollo, incluso en caso de que servicios externos sean comprometidos. También ampliará el alcance de las pruebas de equipo rojo (red team testing), simulacros relacionados con seguridad, y los sistemas de monitoreo.
OpenAI también fortalecerá los sistemas de monitoreo para detectar comportamientos anómalos durante el proceso de razonamiento de la IA. Cuando se identifiquen comportamientos sospechosos, se activará un sistema de investigación automática para verificar la posibilidad de filtración de datos o elusión de controles de seguridad. Si dentro de un período establecido no se confirma que el incidente sea una falsa alarma, se suspenderán los trabajos de desarrollo relacionados. OpenAI estima que este monitoreo requerirá recursos computacionales adicionales equivalentes a aproximadamente el 20% del volumen total de operaciones de inferencia.
OpenAI también está fortaleciendo las medidas para la protección de usuarios de IA. El 18 de agosto, lanzó 'ChatGPT para adolescentes' dirigido a usuarios de 13 a 17 años. La experiencia para adolescentes se aplicará cuando el sistema determine que el usuario es menor de 18 años o cuando el usuario declare que tiene entre 13 y 17 años, implementando protecciones reforzadas en temas sensibles como autolesiones, violencia y trastornos de la alimentación. También ofrece a los padres funciones para gestionar el tiempo de uso.
En el servicio para adolescentes, se limitarán las interacciones en las que la IA exprese sentimientos románticos hacia el usuario o induzca dependencia emocional. El servicio también incluye funciones educativas como modo de estudio y cuestionarios para apoyar el aprendizaje.
* Este artículo ha sido traducido por IA.
