La Biblioteca Nacional de Corea del Sur abre al público 38,33 millones de datos de aprendizaje de inteligencia artificial

  • La plataforma Buksangsil (Biblioteca Compartida) publica conjuntos de datos de texto, imagen y caracteres

Buksangsil (Biblioteca Compartida)
Buksangsil (Biblioteca Compartida)


Más de 38 millones de conjuntos de datos que incluyen libros, tablas, ilustraciones, publicidades y fotografías serán puestos a disposición del público en general.

La Biblioteca Nacional de Corea del Sur anunció el 17 de septiembre que abrirá al público por primera vez datos de aprendizaje de inteligencia artificial construidos a partir de documentos nacionales.

Los datos a publicar incluyen 3.974 conjuntos de datos de texto (PDF oculto, XML, TXT, JSON), 21.485 conjuntos de datos de imagen que comprenden tablas, ilustraciones, publicidades y fotografías, metadatos y 38,3 millones de conjuntos de datos de caracteres a nivel de carácter, sumando un total de 38,33 millones de conjuntos de datos.

Con esta apertura de datos, la plataforma existente de proyectos denominada "Buksangsil" (Biblioteca Compartida) ha sido rediseñada como una plataforma optimizada para el aprovechamiento de datos de aprendizaje de inteligencia artificial. Esta renovación se enfoca en mejorar la accesibilidad para que cualquier persona pueda utilizarla fácilmente con diversos propósitos, incluyendo aprendizaje de inteligencia artificial, investigación académica, desarrollo de servicios y aplicaciones, así como creación de contenidos.

Los datos abiertos provienen de textos digitalizados de la Biblioteca Nacional, específicamente de revistas modernas de los años treinta y cuarenta cuya autoría ha sido resuelta legalmente, publicaciones gubernamentales y libros de texto de los años cuarenta a sesenta, materiales publicados por la Biblioteca Nacional, y artículos académicos de acceso abierto con permiso para aprendizaje de inteligencia artificial. Cualquier persona puede consultar libremente estos materiales y descargarlos desde "Buksangsil" para su utilización.

Los datos de texto se proporcionan en formato de alta calidad, procesados para que la inteligencia artificial los reconozca fácilmente, permitiendo su aplicación inmediata en investigación y desarrollo de servicios. En el caso de los conjuntos de datos de caracteres, la amplia variedad de datos textuales puede utilizarse directamente en aprendizaje de inteligencia artificial, por lo que se espera que pequeñas y medianas empresas y nuevas empresas tecnológicas que enfrentan dificultades para obtener datos masivos puedan aprovecharlos de manera generalizada en el desarrollo de tecnologías relacionadas como reconocimiento óptico de caracteres (OCR) y procesamiento del lenguaje natural.

La plataforma rediseñada "Buksangsil" también ha reforzado sus funciones para apoyar la investigación en inteligencia artificial y humanidades digitales, así como para expandir la utilización de datos públicos. Al organizar y procesar el vasto acervo de conocimiento acumulado digitalmente en un formato que pueda ser aprendido por inteligencia artificial, ahora es posible realizar investigaciones en humanidades que se basaban en datos masivos, algo que anteriormente resultaba difícil. Se espera que los investigadores puedan realizar más fácilmente investigaciones en humanidades digitales, donde analicen diversos materiales como documentos, registros e imágenes utilizando inteligencia artificial y extraigan nuevos significados.

Asimismo, tiene relevancia el hecho de que documentos nacionales cuya autoría ha sido resuelta legalmente se abren en gran escala de manera que puedan utilizarse directamente en aprendizaje de inteligencia artificial. Se espera que esto alivie en cierta medida la carga que han enfrentado investigadores y pequeñas y medianas empresas y nuevas empresas tecnológicas en la adquisición de datos de aprendizaje debido a costos y problemas de derechos de autor.

El entorno de usuario de la plataforma también ha sido mejorado con una orientación más amigable. Se ha implementado una estructura de navegación intuitiva organizada por tipo de material e imagen, y dado que cualquier persona puede acceder a los datos sin necesidad de un procedimiento de registro previo, no solo investigadores especializados sino también usuarios generales pueden buscar y utilizar fácilmente los materiales.

La Biblioteca Nacional de Corea del Sur planea continuar expandiendo la construcción y apertura de datos a futuro, con planes de abrir datos de texto de aproximadamente 300 novelas en edición de características de hangul a finales de este año, además de perfeccionar servicios de aplicación de inteligencia artificial, con el objetivo de desarrollar "Buksangsil" como una plataforma de datos en constante crecimiento.

Yi Hyeon-ju, jefe del Departamento de Planificación de Información Digital de la Biblioteca Nacional de Corea del Sur, declaró: "Continuaremos ampliando el alcance de la apertura de datos para que cualquier ciudadano pueda beneficiarse de los recursos de conocimiento público en la era de la inteligencia artificial, creando así una biblioteca apropiada para esta nueva época".
 



* Este artículo ha sido traducido por IA.