BiblioLabTech· Boletín de recursosEdición · 21 de septiembre de 2026
IA para bibliotecas

Catalogación con IA: guía paso a paso

Qué pasa desde que tomas la foto de un libro hasta que el registro MARC21 queda listo en tu catálogo, y qué parte sigue siendo del bibliotecario.

Entre que se toma la foto de un libro y que el registro queda listo en el catálogo hay cinco pasos, no uno. "Catalogar con IA" suena a un proceso mágico de un solo clic, pero en la práctica es una cadena bastante concreta: captura, reconocimiento, mapeo al estándar bibliográfico, autollenado en el sistema y revisión humana. Entender esa cadena es lo que te permite calcular en serio cuánto tiempo te vas a ahorrar y qué le vas a seguir pidiendo a tu equipo de catalogación.

Ya explicamos qué es la catalogación con inteligencia artificial y cómo se compara con el trabajo manual en BiblioScan AI frente a la catalogación manual. Esta guía va un nivel más abajo: paso a paso, qué ocurre técnicamente en cada etapa y dónde entra el criterio del catalogador.

¿Quieres esto en tu biblioteca?
Lo implementamos nosotros, de principio a fin.
Poner BiblioScan AI a catalogar tu colección

Paso 1: la captura

Todo empieza con una imagen o un documento. Para material físico —el caso de BiblioScan AI— basta una fotografía tomada con el celular: la portada, la contraportada o la página de créditos, que es donde suele estar la ficha catalográfica con ISBN, editorial y año. No hace falta un escáner dedicado ni un puesto de trabajo especial; cualquier persona del equipo puede capturar el material desde su propio teléfono.

Para material que ya nace digital —un PDF de tesis, un artículo, un informe institucional— el punto de partida es distinto y lo cubre nuestra otra herramienta, MetaExtract API, que trabaja directamente sobre el documento en lugar de una foto. Esta guía se concentra en el flujo desde imagen, que es el que más preguntas genera porque parece el más difícil de automatizar.

Paso 2: reconocimiento y extracción

La fotografía entra a un proceso que combina OCR (reconocimiento óptico de caracteres) con modelos de visión y de lenguaje. El OCR convierte el texto de la imagen en texto plano; los modelos de visión y lenguaje son los que interpretan ese texto y lo relacionan con lo que se espera encontrar en una ficha bibliográfica: dónde suele ir el título, cómo se distingue un ISBN de un año de edición, qué cadena de texto es probablemente el nombre del autor.

Esta es la parte que hace que la herramienta sea más que un OCR genérico: no solo lee el texto, lo clasifica según el rol que cumple en el registro. Es la misma diferencia que hay entre transcribir una página y catalogarla.

Paso 3: mapeo al estándar bibliográfico

Con los datos ya identificados —título, autor, editorial, ISBN, año, materia, entre otros— el siguiente paso es traducirlos a la estructura que tu sistema espera. Para catálogos como Koha eso es MARC21, con sus campos y subcampos numerados; para repositorios como DSpace suele ser Dublin Core. No es lo mismo extraer "González, Ana" que saber que ese dato va en el campo 100 como autor personal principal y no en una nota. Este mapeo es el que decide si el registro que llega al catálogo es utilizable o si va a generar más trabajo de corrección del que ahorra.

Paso 4: autollenado en tu sistema

Con el registro ya estructurado en el estándar correcto, los campos se insertan directamente en tu sistema de gestión bibliotecaria. BiblioScan AI se integra con Koha, DSpace y Alma, así que el catalogador no tiene que copiar y pegar nada entre una herramienta externa y el sistema: el registro aparece ya cargado, con sus campos MARC21 llenos, en el mismo lugar donde siempre ha catalogado.

En los proyectos que hacemos, esta es la parte que más sorprende a los equipos que llevan años catalogando a mano: no cambia el sistema que usan, solo cambia quién hace el trabajo de digitación.

Paso 5: qué revisa el bibliotecario

Aquí está el punto que más se malinterpreta: la IA no reemplaza al catalogador, cambia en qué parte del proceso interviene. En lugar de transcribir cada campo desde cero, el bibliotecario revisa un registro ya propuesto y aplica el criterio que un modelo no tiene: normalización de nombres de autor según las autoridades ya usadas en el catálogo, asignación de materias y clasificación temática, decisiones sobre ediciones y ejemplares múltiples, y casos donde la foto salió borrosa o el libro no tiene ISBN.

Tarea Qué hace la IA Qué revisa el bibliotecario
Lectura del libroExtrae título, autor, editorial, ISBN y año de la fotografíaConfirma que el dato leído corresponde al ejemplar real, no a una edición distinta
Estructura MARC21Mapea cada dato al campo y subcampo correspondienteRevisa casos atípicos: obras anónimas, varios autores, series
Autoridades de nombrePropone la forma del nombre tal como aparece en el libroNormaliza contra el catálogo de autoridades ya existente
Materias y clasificaciónPuede sugerir materias a partir del contenido detectadoDecide la clasificación temática definitiva según la política del catálogo
Casos difícilesSeñala baja confianza cuando la foto es de mala calidad o el dato no está claroCompleta o corrige a mano ese registro puntual

En su ficha de servicio, BiblioScan AI publica una cifra de precisión del 99,9%, con un esquema de 95% automático y 5% de revisión humana. Es una cifra de marketing sobre el propio producto y conviene tratarla como referencia, no como una garantía cerrada de proyecto: el porcentaje real de revisión depende de la calidad de las fotos, del estado del material y de qué tan exigente sea la política de catalogación de tu biblioteca. Lo que sí es consistente en todos los proyectos que hemos hecho es el cambio de rol: el catalogador pasa de teclear a decidir.

Con qué formatos y fuentes funciona

BiblioScan AI trabaja a partir de fotografías tomadas con cualquier celular o cámara, sin necesidad de escáner especializado ni de un formato de imagen particular. Funciona sobre libros impresos, y en general sobre cualquier material que traiga una página con datos editoriales identificables: portada, contraportada, página de créditos o ficha catalográfica. Se integra con DSpace, Koha y Alma, así que no importa si tu catálogo es de código abierto o comercial.

Si el material ya está en PDF —tesis, artículos, informes que van a un repositorio— el proceso equivalente no parte de una foto sino del documento mismo, y es el trabajo de MetaExtract API. Cuando implementamos ambas herramientas juntas para una biblioteca, normalmente BiblioScan AI cubre la colección física y MetaExtract API el repositorio digital, sobre la misma infraestructura.

Qué pasa con las series, las colecciones y los ejemplares múltiples

Un caso que conviene aclarar porque genera dudas en la práctica: cuando una biblioteca tiene varios ejemplares del mismo título, la IA no cataloga cada foto como si fuera un libro nuevo desde cero. El flujo habitual es catalogar el título una sola vez —con su registro bibliográfico completo— y después dar de alta cada ejemplar adicional como copia de ese mismo registro, con su propio código de barras y su propia ubicación. Fotografiar cada ejemplar solo tiene sentido cuando hay diferencias reales entre copias: una edición distinta, un estado de conservación que hay que anotar, o un donativo con procedencia propia.

Con las series y colecciones pasa algo parecido: la IA identifica el título de la obra y, cuando el libro lo indica explícitamente en portada o contraportada, la serie a la que pertenece. Pero decidir si esa serie se cataloga como un registro de nivel superior con volúmenes asociados, o como notas dentro de cada registro individual, es una decisión de política catalográfica que le corresponde a la biblioteca, no al modelo. Aquí es donde, otra vez, entra el criterio del catalogador y no la automatización.

Qué cambia en el tiempo de catalogación real

No vamos a repetir aquí la comparación completa de tiempos y costos frente al proceso manual —ya está en BiblioScan AI frente a la catalogación manual—, pero vale la pena decir con qué gana tiempo exactamente cada paso de este flujo. La captura no ahorra tiempo frente a tomar una foto de referencia, que muchas bibliotecas ya hacían de todos modos. El ahorro real está en los pasos 2, 3 y 4: reconocimiento, mapeo a MARC21 y autollenado, que en el proceso manual son minutos de digitación por cada campo y en el proceso con IA ocurren en segundos, de forma simultánea. El paso 5, la revisión, sigue tomando el tiempo que tomaba antes decidir esos casos —solo que ahora es la única parte del proceso que consume tiempo humano.

Un ejemplo real: catalogación e IA sobre la misma plataforma

En la Escuela Colombiana de Ingeniería Julio Garavito trabajamos exactamente este flujo: Koha con catalogación asistida por BiblioScan AI para la colección física y DSpace con MetaExtract API para el repositorio, con revisión humana obligatoria antes de guardar cada registro en ambos casos. El resultado, según describe la propia institución, fue que las tareas de descripción documental pasaron de transcripción a revisión, que es justo el cambio de rol que describe esta guía.

Cómo se pone en marcha en tu biblioteca

Cuando lo implementamos para una biblioteca, el orden suele ser: primero se conecta BiblioScan AI a tu sistema (Koha, DSpace o Alma) y se define el perfil de catalogación —qué campos son obligatorios, qué vocabularios de materia usas—; después se corre un lote de prueba con material real de tu colección para calibrar la extracción contra tus propios criterios; y solo cuando ese lote se valida se abre el flujo al equipo completo, con el procedimiento de revisión ya acordado. No hay migración de tu catálogo actual: la herramienta se conecta a lo que ya tienes.

Si quieres ver el proceso completo funcionando en tu biblioteca, lo siguiente es una conversación sobre tu colección y tu sistema actual, no una demo genérica.

Hagámoslo realidad en tu biblioteca

Cuéntanos tu caso y en menos de 48 horas te decimos exactamente qué implica para tu institución: alcance, tiempos y costo.

O escríbenos directo: contacto@bibliolabtech.com · +57 302 364 8842

Boletín

¿Te sirvió esta edición?

Suscríbete y recibe las próximas guías y comparativas en tu correo.

Preguntas frecuentes sobre IA para bibliotecas

¿Cuánto tarda catalogar un libro con IA?+

El proceso de captura y extracción toma segundos, no minutos: se toma la foto y la IA propone el registro casi de inmediato. Lo que varía es el tiempo de revisión humana, que depende de qué tan estándar sea el material; un libro común con buena foto requiere muy poca revisión, y un caso atípico —obra sin ISBN, edición rara— puede tomar más.

¿Qué pasa si la foto del libro sale borrosa o incompleta?+

El sistema señala esos casos como de baja confianza en lugar de inventar un dato. El catalogador completa o corrige el registro a mano, igual que lo haría si el ejemplar no tuviera ficha catalográfica clara. La revisión humana existe precisamente para estos casos.

¿La IA reemplaza al catalogador?+

No. La IA asume el trabajo repetitivo de transcripción y estructuración del registro; el catalogador se concentra en lo que exige criterio profesional: normalización de autoridades, clasificación temática y resolución de casos atípicos. Cambia el rol, no la necesidad del bibliotecario.

¿Con qué estándares bibliográficos trabaja?+

Genera registros en MARC21 para sistemas como Koha o Alma, y en Dublin Core para repositorios como DSpace, mapeando cada dato extraído al campo correspondiente del estándar, no solo transcribiendo texto suelto.

¿Necesito un escáner especial para catalogar con IA?+

No. BiblioScan AI trabaja a partir de fotografías tomadas con un celular común. No se requiere equipo dedicado ni un puesto de trabajo especial para la captura.

¿Sirve para libros antiguos o sin ISBN?+

Puede extraer datos de libros sin ISBN si la página de créditos trae otra información identificable, pero la confianza de la extracción baja y esos casos suelen requerir más revisión manual. No es la situación ideal de uso, pero tampoco queda fuera del flujo.

¿Qué diferencia hay entre catalogar con BiblioScan AI y con MetaExtract API?+

BiblioScan AI parte de una fotografía de material físico y autollena campos MARC21 en Koha, DSpace o Alma. MetaExtract API parte de un documento PDF y extrae sus metadatos (autor, título, resumen, palabras clave) para repositorios y sistemas de gestión documental. Muchas bibliotecas usan las dos: una para la colección física y otra para el contenido digital.