Doc-Process — 企业级文档智能处理技能
Doc-Process 是一款面向复杂办公场景的多功能文档处理技能,覆盖从日常票据扫描到法律合同审查的完整工作流。其核心设计理念是隐私优先、本地优先——绝大多数功能依赖 Claude 原生多模态能力,无需安装任何外部依赖即可开箱即用。
核心能力矩阵
| 场景 | 功能亮点 | 实现方式 |
|------|---------|---------|
| **合同审查** | 风险条款识别、红旗标记、责任边界分析 | Claude 原生阅读+规则引擎 |
| **票据处理** | 自动提取商户、金额、日期、生成费用报表 | 视觉识别+`expense_logger.py`(纯标准库) |
| **银行账单** | 订阅服务检测、异常交易标记、税务抵扣识别 | PDF视觉分析/CSV解析双模式 |
| **证件扫描** | MRZ码读取、ICAO算法验证、信息结构化输出 | 纯视觉MRZ解码,无外部OCR |
| **敏感信息脱敏** | 轻/标准/完整三级模式,支持PII自动识别与人工复核 | Claude标记+`redactor.py`正则处理 |
| **表格提取** | PDF表格精准转CSV/JSON,保留复杂排版 | `pdfplumber`辅助(需单独安装) |
| **音频转写** | 会议录音自动转文字、说话人分离 | `openai-whisper`+ffmpeg(首次联网下载模型) |
显著优势
1. 隐私安全天花板:核心功能100%本地运行,文档内容不出会话;无遥测、无埋点、无云端API调用
2. 零依赖冷启动:14项功能中的11项无需任何Python包安装,3项脚本扩展均为可选
3. 智能意图路由:内置分类器自动识别文档类型,14种处理模式精准匹配
4. 渐进式功能扩展:基础用户零配置上手,高阶用户可按需安装pdfplumber、whisper等扩展
局限性与注意事项
- 表格提取依赖外部库:复杂PDF表格需安装
pdfplumber,纯视觉模式对极复杂排版识别有限 - 音频处理首次联网:
whisper模型约140MB,首次使用需从OpenAI/HuggingFace下载 - 无批量自动化接口:当前设计为交互式单文档处理,未暴露批量文件夹扫描API
- 医学/法律免责声明:所有输出需标注"辅助参考,非专业意见",重大决策需人工复核
适用人群
- 财务人员:自动化票据录入、银行账单订阅分析、费用报表生成
- 法务/合规:合同风险初筛、PII脱敏处理、敏感文档标准化审查
- HR/招聘:简历批量解析、候选人信息结构化提取
- 行政助理:会议记录转写、表格数据迁移、多语言文档翻译
- 个人用户:证件信息备份、医疗报告摘要、重要文档归档整理
安全等级与风险提示
- 核心功能:S级(纯本地,无网络依赖,无持久化存储)
- 脚本扩展功能:A级(
whisper首次联网后可离线,pdfplumber完全本地) - 隐私控制:时间线日志默认关闭,需显式授权;表单自动填充数据会话级销毁
- 主要风险:用户可能误将AI分析结果作为最终法律/医疗决策依据,需强调辅助定位