Kanana-2 de Kakao supera a Gemma y Qwen en evaluación de seguridad de IA

Seguridad de la serie Kanana-2 [Foto=Kakao]
Seguridad de la serie Kanana-2 [Foto=Kakao]


Kakao anunció que su serie de modelos de lenguaje ligero (SLM) de código abierto "Kanana-2" ocupó el primer lugar en la evaluación integral de seguridad, superando a modelos internacionales principales de escala similar.
 
A través de su propia plataforma de evaluación de seguridad de IA, Kakao evaluó sistemáticamente "Kanana-2-1.3B-Instruct" y "Kanana-2-3B-Instruct", dos modelos publicados como código abierto en Hugging Face el 28 de julio, midiendo daños potenciales, sesgos y otros factores de riesgo.
 
La evaluación utilizó "AssurAI", un punto de referencia de seguridad especializado en coreano construido conjuntamente en noviembre del año pasado por la Asociación de Tecnología de Información y Comunicaciones de Corea (TTA), el Instituto de Ciencia y Tecnología de Corea (KAIST) y Kakao, como parte de una iniciativa del Ministerio de Ciencia y Tecnología de la Información y Comunicación. AssurAI fue diseñado para adaptarse al contexto social y cultural de Corea del Sur, permitiendo medir factores de riesgo de IA en diversas condiciones: desde contenido multimodal de texto, imágenes y audio, hasta escenarios de uso de servicios de IA y avisos maliciosos.
 
AssurAI incluye 9.560 elementos de evaluación dentro de 35 categorías de riesgo totales. Kakao reorganizó estos en cinco clasificaciones principales: riesgos sociales, contenido sexual y protección infantil, delitos y actividades ilegales, violencia e infracción de derechos. Además, aplicó el método "LLM-as-a-Judge", en el cual un modelo de lenguaje de gran tamaño evalúa las respuestas según criterios de puntuación predefinidos, minimizando la variabilidad subjetiva incluso en evaluaciones a gran escala.
 
Los modelos de comparación fueron "Gemma" de Google y "Qwen" de Alibaba, ambos de escala de parámetros similar. Kanana-2-1.3B-Instruct obtuvo una puntuación integral de 0,70, superando a Gemma (0,68) y Qwen (0,58), mientras que Kanana-2-3B-Instruct también alcanzó 0,70, logrando puntuaciones más altas que Gemma (0,66) y Qwen (0,62).
 
Por clasificación principal, el modelo Kanana 1.3B mostró ventaja en el área de delitos y actividades ilegales, mientras que el modelo 3B superó significativamente a los modelos comparados en las áreas de contenido sexual y protección infantil, así como en infracción de derechos.
 
Partiendo de esta evaluación, Kakao planea ampliar las evaluaciones previas de seguridad continua a sus propios modelos de IA desarrollados internamente en futuras publicaciones. La empresa adoptará un enfoque gradual para ampliar el alcance de la evaluación más allá de modelos de lenguaje basados en texto hacia modelos multimodales y áreas de evaluación de riesgos de IA agentica.
 
"Esta evaluación es un ejemplo de nuestro esfuerzo por verificar previamente la seguridad de modelos de código abierto a través de nuestro propio sistema de validación y dar a conocer los resultados públicamente", dijo Kim Kyung-hoon, líder de Seguridad de IA en Kakao. "Continuaremos estableciendo la verificación de seguridad como una fase central del proceso de lanzamiento de modelos, bajo el principio del desarrollo responsable de IA", agregó.
 
 



* Este artículo ha sido traducido por IA.