Inventario
Antes de indexar nada levantamos el mapa real del corpus: qué repositorios existen, quién puede ver qué y en qué estado está la documentación. Marcamos los documentos obsoletos, los duplicados con dos versiones vivas y los PDF escaneados que necesitan OCR para poder leerse. De ahí sale la lista de fuentes que entran en la primera fase, las que se quedan fuera y el trabajo de limpieza previo, que es lo que más condiciona el resultado final.