Historical Data Manager

📚 施工历史档案智能迁移与造价平准化

将数十年的施工档案从纸张、旧数据库及专有格式中提取、清洗并标准化,为成本对标、生产率分析与风险评估建立可信的历史数据资产。

收藏
6.3k
安装
2.1k
版本
2.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Historical Data Manager 是一套面向建筑工程领域的遗留数据迁移与治理工具,主要解决施工企业历史档案"沉睡"问题。其核心流程为:

1. 档案扫描:递归遍历指定目录,按扩展名自动分类识别 PDF、MDB/ACCDB、XLS/XLSX、CSV、XER 等格式;
2. 智能提取

3. 类型识别:基于列名关键词(cost/amount/price、budget、start/finish/duration、labor/crew、material/quantity)自动判定数据类别;
4. 标准化清洗:正则映射列名(proj.*id → project_id、qty → quantity 等)、统一单位换算(M/C/LF/SF/CY)、多格式日期解析;

5. 质量评分:综合完整度、列名可读性、数据量三维度输出 0-1 质量分,低于 0.5 标记为低质量记录;

6. 成本平准化:内置 RSMeans 历史造价指数(2015-2026),支持将历史成本折算至指定基准年美元;

7. 迁移报告:自动生成 Markdown 报告,汇总按类型/年份分布、平均质量分及低质量记录清单。

  • Excel:自动尝试 openpyxl 与 xlrd 双引擎,适配新旧格式;
  • CSV:多编码回退(utf-8 → latin-1 → cp1252 → iso-8859-1);
  • Access:通过 pyodbc 直连提取多表结构;
  • Primavera XER:解析 %T/%F/%R 标记的分段文本格式;
  • Timberline:映射 JOB/PHASE/CATEGORY 等字段到标准成本科目;

显著优点

  • 格式覆盖广:从纸质扫描件元数据到 Lotus 1-2-3、FoxPro、Sage Timberline、Primavera P6 等垂类系统导出格式均有对应读取策略;
  • 工程语义深:内置施工行业特有的成本码(Cost Code)、WBS 结构、造价指数对标,非通用 ETL 工具可比拟;
  • 防御性编码:编码探测、引擎回退、异常捕获三层容错,降低批量处理中断概率;
  • 可追溯性强:保留 original_format、escalation_factor、quality_score 等元数据,满足审计与复现需求。

潜在局限

  • 商业数据库依赖:Sage Timberline、MC2 ICE 等部分系统需官方 ODBC 驱动或导出模块,未开源;
  • OCR 空白:对纯图像型 PDF(扫描件)仅做路径枚举,未集成 OCR 提取,需前置处理;
  • 指数时效性:内置造价指数仅到 2026 预估值,实际使用需对接 RSMeans/ENR API 或手动更新;
  • 并发与事务:示例代码为单线程顺序处理,TB 级档案需自行扩展并行或流式读取;
  • 编码硬编码:pyodbc 连接字符串中的 Access 驱动名称为 Windows 英文环境默认值,跨平台可能需适配。

适合人群

  • 大型承包商(GC)的数据管理团队,需整合 10-30 年历史项目成本库;
  • 造价咨询公司与业主方 PMO,建立企业级历史指标(Historical Metrics)用于前期估算校准;
  • 工程数字化顾问,执行 legacy system migration 或 ERP 替换(如从 Timberline 迁移至现代云 ERP)。

常规风险

  • PII 与商业敏感信息:历史记录可能含分包商报价、员工工时等,迁移过程需脱敏或加密存储;
  • 数据质量误导:低质量记录若未过滤直接入仓,可能导致造价对标偏差;
  • 汇率与地区指数误用:RSMeans 指数分美国城市与建筑类型,直接套用全局系数会引入系统性误差;
  • 依赖库许可:xlrd 2.0+ 已移除 .xlsx 支持,需确认 openpyxl 与 xlrd 版本搭配,避免生产环境读取失败。

Historical Data Manager 内容

手动下载zip · 7.4 kB
claw.jsonapplication/json
请选择文件