Universidad ICESI: extracción automática de metadatos con MetaExtract API sobre su propia infraestructura
La Universidad ICESI incorporó MetaExtract API a su flujo de descripción documental para autollenar los metadatos de los documentos que ingresan a sus sistemas de información, sin cambiar de plataforma ni migrar contenidos. El servicio lleva vigencias consecutivas renovadas.
Contexto de la institución
La Universidad ICESI es una universidad privada de Cali, Colombia, con una trayectoria reconocida en investigación y con una biblioteca que sostiene tanto la docencia como la producción académica de sus centros y grupos. Su equipo de gestión de información ya operaba una infraestructura propia consolidada, con sistemas elegidos y en funcionamiento.
El reto
El problema no era de plataforma sino de capacidad. La descripción documental es un trabajo lineal: cada documento que entra exige que una persona lea, identifique los elementos descriptivos y los transcriba campo por campo. Cuando el volumen de documentos crece más rápido que el equipo, el resultado es previsible: una cola de material pendiente de describir que nunca se reduce, y un costo de oportunidad alto, porque quien transcribe es personal con formación bibliotecológica que podría estar haciendo control de autoridades, análisis de contenido o asesoría a investigadores.
La condición de la universidad fue clara desde el inicio: no cambiar de sistema, no migrar contenidos y no alterar los flujos de trabajo existentes. Lo que se buscaba era una pieza que se insertara en el flujo actual y quitara la transcripción del camino.
Qué implementamos
Implementamos MetaExtract API, nuestro servicio de extracción automática de metadatos de documentos PDF mediante inteligencia artificial. La API recibe el documento, lo analiza e identifica los elementos descriptivos (título, autoría, resumen, palabras clave, fecha, tipo documental, idioma y los campos adicionales que la institución defina) y los devuelve estructurados para autollenar el formulario de descripción.
Al tratarse de un servicio por interfaz de programación, no exigió infraestructura nueva ni sustitución de sistemas: se integra a lo que la institución ya tiene.
Cómo lo hicimos
- Diagnóstico del esquema de metadatos destino. Se revisaron los campos en uso, cuáles son obligatorios, qué vocabularios aplican y qué tipos documentales había que distinguir.
- Ajuste de la extracción. Se entrenó el modelo con documentos reales de la institución para que la salida correspondiera a su esquema y no a un esquema genérico.
- Integración. Se conectó la API al flujo de trabajo, coordinando con el equipo técnico de la universidad las credenciales, las cuotas de uso y el manejo de errores.
- Validación con lote de control. Se procesó un conjunto representativo y se comparó campo a campo contra la descripción hecha por el equipo antes de abrir el uso general.
- Puesta en producción y acompañamiento. Se definió el procedimiento de revisión humana previo a la aprobación de cada registro y se abrió el servicio al equipo.
Resultado
El trabajo de descripción pasó de transcribir a revisar: el bibliotecólogo recibe un registro ya propuesto y aplica su criterio sobre la normalización de nombres, los descriptores y las decisiones de licencia, que es donde su formación agrega valor. El indicador más significativo del resultado, y el único que podemos afirmar sin que la universidad publique cifras, es que el servicio ha sido renovado en vigencias consecutivas: la institución evaluó su continuidad y decidió mantenerla.
Tecnologías
MetaExtract API, extracción de metadatos con modelos de lenguaje, integración por API REST, esquemas de metadatos Dublin Core y campos locales de la institución.
¿Tu biblioteca está en una situación parecida?
Empezamos por un diagnóstico del sistema actual y del estado de los datos, sin compromiso.
Hablar con nosotros