Catalogación con IA: guía paso a paso
Qué pasa desde que tomas la foto de un libro hasta que el registro MARC21 queda listo en tu catálogo, y qué parte sigue siendo del bibliotecario.
Entre que se toma la foto de un libro y que el registro queda listo en el catálogo hay cinco pasos, no uno. "Catalogar con IA" suena a un proceso mágico de un solo clic, pero en la práctica es una cadena bastante concreta: captura, reconocimiento, mapeo al estándar bibliográfico, autollenado en el sistema y revisión humana. Entender esa cadena es lo que te permite calcular en serio cuánto tiempo te vas a ahorrar y qué le vas a seguir pidiendo a tu equipo de catalogación.
Ya explicamos qué es la catalogación con inteligencia artificial y cómo se compara con el trabajo manual en BiblioScan AI frente a la catalogación manual. Esta guía va un nivel más abajo: paso a paso, qué ocurre técnicamente en cada etapa y dónde entra el criterio del catalogador.
Paso 1: la captura
Todo empieza con una imagen o un documento. Para material físico —el caso de BiblioScan AI— basta una fotografía tomada con el celular: la portada, la contraportada o la página de créditos, que es donde suele estar la ficha catalográfica con ISBN, editorial y año. No hace falta un escáner dedicado ni un puesto de trabajo especial; cualquier persona del equipo puede capturar el material desde su propio teléfono.
Para material que ya nace digital —un PDF de tesis, un artículo, un informe institucional— el punto de partida es distinto y lo cubre nuestra otra herramienta, MetaExtract API, que trabaja directamente sobre el documento en lugar de una foto. Esta guía se concentra en el flujo desde imagen, que es el que más preguntas genera porque parece el más difícil de automatizar.
Paso 2: reconocimiento y extracción
La fotografía entra a un proceso que combina OCR (reconocimiento óptico de caracteres) con modelos de visión y de lenguaje. El OCR convierte el texto de la imagen en texto plano; los modelos de visión y lenguaje son los que interpretan ese texto y lo relacionan con lo que se espera encontrar en una ficha bibliográfica: dónde suele ir el título, cómo se distingue un ISBN de un año de edición, qué cadena de texto es probablemente el nombre del autor.
Esta es la parte que hace que la herramienta sea más que un OCR genérico: no solo lee el texto, lo clasifica según el rol que cumple en el registro. Es la misma diferencia que hay entre transcribir una página y catalogarla.
Paso 3: mapeo al estándar bibliográfico
Con los datos ya identificados —título, autor, editorial, ISBN, año, materia, entre otros— el siguiente paso es traducirlos a la estructura que tu sistema espera. Para catálogos como Koha eso es MARC21, con sus campos y subcampos numerados; para repositorios como DSpace suele ser Dublin Core. No es lo mismo extraer "González, Ana" que saber que ese dato va en el campo 100 como autor personal principal y no en una nota. Este mapeo es el que decide si el registro que llega al catálogo es utilizable o si va a generar más trabajo de corrección del que ahorra.
Paso 4: autollenado en tu sistema
Con el registro ya estructurado en el estándar correcto, los campos se insertan directamente en tu sistema de gestión bibliotecaria. BiblioScan AI se integra con Koha, DSpace y Alma, así que el catalogador no tiene que copiar y pegar nada entre una herramienta externa y el sistema: el registro aparece ya cargado, con sus campos MARC21 llenos, en el mismo lugar donde siempre ha catalogado.
En los proyectos que hacemos, esta es la parte que más sorprende a los equipos que llevan años catalogando a mano: no cambia el sistema que usan, solo cambia quién hace el trabajo de digitación.
Paso 5: qué revisa el bibliotecario
Aquí está el punto que más se malinterpreta: la IA no reemplaza al catalogador, cambia en qué parte del proceso interviene. En lugar de transcribir cada campo desde cero, el bibliotecario revisa un registro ya propuesto y aplica el criterio que un modelo no tiene: normalización de nombres de autor según las autoridades ya usadas en el catálogo, asignación de materias y clasificación temática, decisiones sobre ediciones y ejemplares múltiples, y casos donde la foto salió borrosa o el libro no tiene ISBN.
| Tarea | Qué hace la IA | Qué revisa el bibliotecario |
|---|---|---|
| Lectura del libro | Extrae título, autor, editorial, ISBN y año de la fotografía | Confirma que el dato leído corresponde al ejemplar real, no a una edición distinta |
| Estructura MARC21 | Mapea cada dato al campo y subcampo correspondiente | Revisa casos atípicos: obras anónimas, varios autores, series |
| Autoridades de nombre | Propone la forma del nombre tal como aparece en el libro | Normaliza contra el catálogo de autoridades ya existente |
| Materias y clasificación | Puede sugerir materias a partir del contenido detectado | Decide la clasificación temática definitiva según la política del catálogo |
| Casos difíciles | Señala baja confianza cuando la foto es de mala calidad o el dato no está claro | Completa o corrige a mano ese registro puntual |
En su ficha de servicio, BiblioScan AI publica una cifra de precisión del 99,9%, con un esquema de 95% automático y 5% de revisión humana. Es una cifra de marketing sobre el propio producto y conviene tratarla como referencia, no como una garantía cerrada de proyecto: el porcentaje real de revisión depende de la calidad de las fotos, del estado del material y de qué tan exigente sea la política de catalogación de tu biblioteca. Lo que sí es consistente en todos los proyectos que hemos hecho es el cambio de rol: el catalogador pasa de teclear a decidir.
Con qué formatos y fuentes funciona
BiblioScan AI trabaja a partir de fotografías tomadas con cualquier celular o cámara, sin necesidad de escáner especializado ni de un formato de imagen particular. Funciona sobre libros impresos, y en general sobre cualquier material que traiga una página con datos editoriales identificables: portada, contraportada, página de créditos o ficha catalográfica. Se integra con DSpace, Koha y Alma, así que no importa si tu catálogo es de código abierto o comercial.
Si el material ya está en PDF —tesis, artículos, informes que van a un repositorio— el proceso equivalente no parte de una foto sino del documento mismo, y es el trabajo de MetaExtract API. Cuando implementamos ambas herramientas juntas para una biblioteca, normalmente BiblioScan AI cubre la colección física y MetaExtract API el repositorio digital, sobre la misma infraestructura.
Qué pasa con las series, las colecciones y los ejemplares múltiples
Un caso que conviene aclarar porque genera dudas en la práctica: cuando una biblioteca tiene varios ejemplares del mismo título, la IA no cataloga cada foto como si fuera un libro nuevo desde cero. El flujo habitual es catalogar el título una sola vez —con su registro bibliográfico completo— y después dar de alta cada ejemplar adicional como copia de ese mismo registro, con su propio código de barras y su propia ubicación. Fotografiar cada ejemplar solo tiene sentido cuando hay diferencias reales entre copias: una edición distinta, un estado de conservación que hay que anotar, o un donativo con procedencia propia.
Con las series y colecciones pasa algo parecido: la IA identifica el título de la obra y, cuando el libro lo indica explícitamente en portada o contraportada, la serie a la que pertenece. Pero decidir si esa serie se cataloga como un registro de nivel superior con volúmenes asociados, o como notas dentro de cada registro individual, es una decisión de política catalográfica que le corresponde a la biblioteca, no al modelo. Aquí es donde, otra vez, entra el criterio del catalogador y no la automatización.
Qué cambia en el tiempo de catalogación real
No vamos a repetir aquí la comparación completa de tiempos y costos frente al proceso manual —ya está en BiblioScan AI frente a la catalogación manual—, pero vale la pena decir con qué gana tiempo exactamente cada paso de este flujo. La captura no ahorra tiempo frente a tomar una foto de referencia, que muchas bibliotecas ya hacían de todos modos. El ahorro real está en los pasos 2, 3 y 4: reconocimiento, mapeo a MARC21 y autollenado, que en el proceso manual son minutos de digitación por cada campo y en el proceso con IA ocurren en segundos, de forma simultánea. El paso 5, la revisión, sigue tomando el tiempo que tomaba antes decidir esos casos —solo que ahora es la única parte del proceso que consume tiempo humano.
Un ejemplo real: catalogación e IA sobre la misma plataforma
En la Escuela Colombiana de Ingeniería Julio Garavito trabajamos exactamente este flujo: Koha con catalogación asistida por BiblioScan AI para la colección física y DSpace con MetaExtract API para el repositorio, con revisión humana obligatoria antes de guardar cada registro en ambos casos. El resultado, según describe la propia institución, fue que las tareas de descripción documental pasaron de transcripción a revisión, que es justo el cambio de rol que describe esta guía.
Cómo se pone en marcha en tu biblioteca
Cuando lo implementamos para una biblioteca, el orden suele ser: primero se conecta BiblioScan AI a tu sistema (Koha, DSpace o Alma) y se define el perfil de catalogación —qué campos son obligatorios, qué vocabularios de materia usas—; después se corre un lote de prueba con material real de tu colección para calibrar la extracción contra tus propios criterios; y solo cuando ese lote se valida se abre el flujo al equipo completo, con el procedimiento de revisión ya acordado. No hay migración de tu catálogo actual: la herramienta se conecta a lo que ya tienes.
Si quieres ver el proceso completo funcionando en tu biblioteca, lo siguiente es una conversación sobre tu colección y tu sistema actual, no una demo genérica.
Hagámoslo realidad en tu biblioteca
Cuéntanos tu caso y en menos de 48 horas te decimos exactamente qué implica para tu institución: alcance, tiempos y costo.
O escríbenos directo: contacto@bibliolabtech.com · +57 302 364 8842
¿Te sirvió esta edición?
Suscríbete y recibe las próximas guías y comparativas en tu correo.