Doc Process

📄 本地文档智能中枢,零云端依赖

全能文档智能处理中枢:OCR识别、合同风险分析、表单自动填充、银行账单解析、简历提取、PII脱敏等14+场景,纯Claude视觉能力驱动,无需外部依赖

收藏
3.7k
安装
1k
版本
3.2.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心能力概览

Doc-Process 是一个功能完备的企业级文档智能处理技能,覆盖从基础 OCR 到高级风险分析的完整文档工作流。其最大技术亮点在于绝大多数功能完全依赖 Claude 原生多模态能力实现,无需调用任何外部 API 或安装第三方库,这在同类工具中极为罕见。

14 大处理模式详解

| 模式 | 典型场景 | 实现方式 |
|------|---------|---------|
| 文档自动分类 | 未知类型文件智能识别 | Claude 视觉分析前1-2页 |
| 表单自动填充 | PDF/图片表单字段识别与填充建议 | 纯 Claude 视觉+文本理解 |
| 合同风险分析 | 协议条款审查、红旗标记 | 规则引擎+Claude 推理 |
| 收据/发票扫描 | 费用报销、支出记录 | 纯视觉识别 |
| 银行账单分析 | 订阅检测、异常交易、税务抵扣项识别 | PDF视觉/CSV本地脚本解析 |
| 简历/CV解析 | 候选人信息结构化提取 | 纯 Claude 文档理解 |
| 身份证件扫描 | 护照/驾照 MRZ 码解码 | 视觉识别+ICAO算法 |
| 医疗记录摘要 | 化验单、处方、出院报告浓缩 | 纯 Claude 医学文本理解 |
| 敏感数据脱敏 | PII 分级红隐(轻/标准/完整模式) | 标注模式纯Claude;文件输出需 PyMuPDF |
| 会议纪要提取 | 会议记录、行动项识别 | 纯文本分析 |
| 表格提取转换 | PDF/图片表格转 CSV/JSON | 需 pdfplumber(可选依赖) |
| 文档翻译 | 多语言文档互译 | Claude 多语言能力 |
| 音频转录 | 会议录音文字化 | 需 openai-whisper+ffmpeg |
| 文档扫描优化 | 透视校正、去阴影、批量扫描 | 需 OpenCV+Pillow |

架构优势与局限

显著优点:

  • 零依赖核心体验:80% 功能开箱即用,无网络调用、无 API key 配置、无隐私外泄风险
  • 企业级隐私设计:文档内容仅会话内处理,无持久化存储;时间线日志显式 opt-in 且脱敏
  • 模块化脚本设计:纯 Python stdlib 实现基础工具,第三方库仅用于特定增强功能
  • 渐进式功能解锁:基础用户无感使用,高级用户按需安装依赖

潜在局限:

  • 重型功能(表格提取、音频转录、PDF红隐)需额外安装依赖链,首次配置门槛较高
  • Whisper 模型首次下载需网络连接(~140MB),离线场景需提前准备
  • 大规模 PDF(>10页)需分页读取,处理效率受限
  • 无批量异步处理能力,适合个人/小团队而非企业级高并发场景

安全与可信度

| 维度 | 评估 |
|------|------|
| 数据驻留 | 完全本地,无云端传输 |
| 敏感操作确认 | 文件写入、时间线记录均需用户显式确认路径 |
| 第三方信任 | 仅 PyMuPDF、pdfplumber 等成熟开源库,无闭源服务 |
| 审计能力 | 所有脚本源码可审,支持 `show me the source` 指令 |

适合人群

  • 个人效率用户:需要快速处理合同、账单、收据,注重隐私不愿上传云端
  • 小型企业/工作室:法务初步审查、财务票据管理、招聘简历筛选
  • 合规敏感行业:医疗、法律、金融领域的轻量级文档预处理(非替代专业审核)
  • 开发者/技术用户:希望理解纯 LLM 视觉能力边界,或基于此扩展定制工作流

使用建议

1. 首次使用:直接尝试合同分析、收据扫描等零依赖功能验证体验
2. 进阶解锁:按需求逐个安装 pdfplumber(表格)、pymupdf(PDF红隐)、whisper(音频)

3. 敏感场景:优先使用「标注模式」脱敏而非「文件输出模式」,避免第三方库接触原始数据

4. 批量场景:配合 Bash 工具编写简单循环,但需注意 Claude 的上下文窗口限制

Doc Process 内容

evals文件夹
references文件夹
scripts文件夹
手动下载zip · 119.1 kB
evals.jsonapplication/json
请选择文件