Data Type Classifier

🏷️ 智能识别工程数据 · 一键推荐存储方案

基于DDC方法论的建筑数据分类器,自动识别结构化/半结构化/非结构化数据,智能推荐存储方案与处理工具,适用于IFC、Excel、PDF等20+工程格式

收藏
5.2k
安装
1.5k
版本
2.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

data-type-classifier 是基于 Data-Driven Construction (DDC) 方法论第2.1章开发的智能数据分类引擎。它通过分析文件扩展名、数据源类型和样本数据,将建筑工程领域的多元数据自动归类为六大结构类型:结构化(表格数据库)、半结构化(JSON/XML/IFC)、非结构化(文档图像视频)、几何数据(CAD/BIM)、时序数据(进度计划)和空间数据(GIS坐标)。

使用流程简洁:实例化 DataTypeClassifier 类后,调用 classify_source() 对单一数据源进行分类,或调用 classify_multiple() 批量处理多个来源。系统支持从文件扩展名、MIME类型、样本内容等多维度智能识别格式,内置20+常见工程文件格式的签名数据库(.ifc/.rvt/.xer/.bcf等)。

显著优点

1. 领域专业化:专为建筑工程场景设计,原生支持IFC、BCF、XER、NWD等行业专属格式,识别精度远超通用数据分类工具
2. 智能存储推荐:基于数据特征自动推荐最优存储方案——结构化数据→关系型数据库,BIM几何→文件系统+IFC标准,合同文档→对象存储+向量数据库用于语义检索

3. 工具链集成:内置每个格式对应的开源处理工具推荐(如IfcOpenShell处理IFC、pyRevit处理RVT、pdfplumber处理PDF),降低技术选型成本

4. 批量报告生成:可输出完整的Markdown分类报告,含结构分布统计、存储策略矩阵、集成方案建议,便于团队协作与决策

潜在局限

  • 依赖扩展名准确性:若文件扩展名被修改或缺失,分类置信度下降,需依赖样本内容分析作为备用
  • 二进制格式深度有限:对.rvt/.nwd等私有二进制格式仅能识别容器类型,无法解析内部schema版本
  • OCR依赖外部工具:PDF/DOCX等文档的文本提取需要Tesseract等外部二进制依赖,未内嵌
  • 单平台限制:目前仅支持Windows环境(win32),macOS/Linux需额外适配

适合人群

  • 建筑数据工程师:搭建企业级数据湖前进行资产盘点
  • BIM经理:制定多源BIM数据集成策略
  • 施工数字化顾问:为客户提供数据治理咨询服务
  • 科研团队:处理大规模异构工程数据集

常规风险

1. 数据泄露风险:处理含敏感信息的合同PDF或设计文件时,建议在本地环境运行
2. 格式版本兼容性:IFC2x3与IFC4的schema差异可能导致后续处理工具报错

3. 存储成本误判:对"huge"体积数据的自动推荐(对象存储)需结合实际访问频率验证

4. 依赖缺失:未安装IfcOpenShell或Tesseract时,部分功能降级为仅元数据识别

Data Type Classifier 内容

手动下载zip · 8.6 kB
claw.jsonapplication/json
请选择文件