Modelos de IA coreanos obtienen puntuaciones globales ante evaluación de segundo fase del Proyecto Fundación de IA Independiente; Motif3 registra la calificación más alta

  • Motif3 alcanza 47 puntos…posicionado entre los 10 primeros a nivel mundial

Foto del índice de Inteligencia de AAII de la agencia evaluadora global AA
Índice de Inteligencia de AAII de la agencia evaluadora global AA [Foto=AAII]

Con la conclusión de la evaluación de segundo fase del proyecto "Modelo Fundación de Inteligencia Artificial (IA) Independiente" impulsado por el Ministerio de Ciencia y Tecnología de la Información y Comunicaciones, han salido a la luz las puntuaciones de benchmark global de los modelos de IA nacionales. En particular, Motif3, modelo desarrollado por Motif Technologies, que se unió al proyecto tras una convocatoria complementaria, ha registrado la puntuación más alta entre los modelos coreanos, lo que ha generado expectativa sobre los resultados de la evaluación de segundo fase.

Según el "Índice de Inteligencia de AAII" de la plataforma global de análisis de modelos de IA Artificial Analysis (AA) publicado el 13 de agosto, Motif3 de Motif Technologies obtuvo una puntuación de 47 puntos. Entre los grandes modelos de lenguaje (LLM) registrados en AAII, se posiciona dentro del top 10 global, siendo el modelo de más alto rango desarrollado por una empresa coreana.

A continuación, el modelo Solar Open2 de Upstage registró 37 puntos, A.X K2 de SK Telecom obtuvo 35 puntos, y K-Exaone 2.0 de LG AI Research logró 31 puntos. Considerando únicamente las puntuaciones AAII de los cuatro modelos participantes en el proyecto, la brecha entre el primero y el cuarto lugar es de 16 puntos.

Artificial Analysis es una plataforma que analiza de manera integral el desempeño, la calidad y el costo de los modelos de IA. Proporciona indicadores considerados en el proceso real de adopción de servicios, tales como precio, velocidad de salida, latencia y tamaño de ventana de contexto, más allá del rendimiento del modelo.

En particular, AAII es un indicador que evalúa las competencias integrales de los modelos de IA combinando resultados de benchmarks en múltiples áreas como matemáticas, ciencias e ingeniería informática. Una característica distintiva es que integra múltiples resultados de evaluación en lugar de basarse en un único benchmark. Sin embargo, presenta una limitación al no incluir un indicador específico de evaluación de la capacidad en idioma coreano, lo que restringe su capacidad de reflejar completamente el desempeño de los modelos en el entorno de uso nacional.

Otro aspecto notable es que el tamaño del modelo no mostró una correlación directa con las puntuaciones AAII. Entre los modelos que participaron en la evaluación de segundo fase, el más grande es K-Exaone 2.0 de LG AI Research, desarrollado con un tamaño total de 750 mil millones de parámetros. El modelo A.X K2 de SK Telecom le sigue con 688 mil millones de parámetros. En contraste, Motif3, que obtuvo la puntuación más alta en AAII, tiene un tamaño de 314 mil millones de parámetros. Solar Open2 de Upstage está compuesto por 250 mil millones de parámetros.

No obstante, la puntuación AAII no se traduce directamente en los resultados de la evaluación de segundo fase del proyecto. Esta evaluación se compone de benchmarks (40 puntos), evaluación de expertos (35 puntos) y evaluación de usuarios (25 puntos). En particular, en esta evaluación participó un panel de ciudadanía conformado por 200 ciudadanos que utilizaron directamente los cuatro modelos y evaluaron su desempeño.

La brecha con respecto a los modelos de máximo nivel global persiste. En AAII, Claude Opus 5 de Anthropic obtuvo 63 puntos, 16 puntos por encima de Motif3. GPT-5.6 Sol de OpenAI y Grok 4.6 de xAI registraron 61 puntos cada uno.

El avance de los modelos de IA chinos también es notable. Kimi K3 de Moonshot AI registró 60 puntos, apenas 1 punto por debajo de GPT-5.6 Sol. Qwen 3.8 Max de Alibaba alcanzó 58 puntos, GLM-5.2 de Z.ai obtuvo 53 puntos, y el último modelo V4 Flash de DeepSeek logró 52 puntos. En comparación con Motif3, el modelo coreano de más alto rango, estos registran entre 5 y 13 puntos superiores.

El Ministerio de Ciencia y Tecnología de la Información y Comunicaciones tiene previsto anunciar los resultados de la evaluación de segundo fase del proyecto en breve. A través de esta evaluación, 3 de los 4 equipos de élite actualmente participantes avanzarán a la siguiente fase.



* Este artículo ha sido traducido por IA.