Doc Process

📄 14合1智能文档处理中枢 · 纯本地隐私优先

全能文档智能处理中枢:支持合同风险审查、票据自动录入、银行账单分析、简历解析、证件扫描、医疗报告摘要、敏感信息脱敏等14种文档场景,纯本地运行无需联网,可选Python脚本扩展。

收藏
3.9k
安装
1k
版本
3.1.0
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

Doc-Process — 企业级文档智能处理技能

Doc-Process 是一款面向复杂办公场景的多功能文档处理技能,覆盖从日常票据扫描到法律合同审查的完整工作流。其核心设计理念是隐私优先、本地优先——绝大多数功能依赖 Claude 原生多模态能力,无需安装任何外部依赖即可开箱即用。

核心能力矩阵

| 场景 | 功能亮点 | 实现方式 |
|------|---------|---------|
| **合同审查** | 风险条款识别、红旗标记、责任边界分析 | Claude 原生阅读+规则引擎 |
| **票据处理** | 自动提取商户、金额、日期、生成费用报表 | 视觉识别+`expense_logger.py`(纯标准库) |
| **银行账单** | 订阅服务检测、异常交易标记、税务抵扣识别 | PDF视觉分析/CSV解析双模式 |
| **证件扫描** | MRZ码读取、ICAO算法验证、信息结构化输出 | 纯视觉MRZ解码,无外部OCR |
| **敏感信息脱敏** | 轻/标准/完整三级模式,支持PII自动识别与人工复核 | Claude标记+`redactor.py`正则处理 |
| **表格提取** | PDF表格精准转CSV/JSON,保留复杂排版 | `pdfplumber`辅助(需单独安装) |
| **音频转写** | 会议录音自动转文字、说话人分离 | `openai-whisper`+ffmpeg(首次联网下载模型) |

显著优势

1. 隐私安全天花板:核心功能100%本地运行,文档内容不出会话;无遥测、无埋点、无云端API调用
2. 零依赖冷启动:14项功能中的11项无需任何Python包安装,3项脚本扩展均为可选

3. 智能意图路由:内置分类器自动识别文档类型,14种处理模式精准匹配

4. 渐进式功能扩展:基础用户零配置上手,高阶用户可按需安装pdfplumberwhisper等扩展

局限性与注意事项

  • 表格提取依赖外部库:复杂PDF表格需安装pdfplumber,纯视觉模式对极复杂排版识别有限
  • 音频处理首次联网whisper模型约140MB,首次使用需从OpenAI/HuggingFace下载
  • 无批量自动化接口:当前设计为交互式单文档处理,未暴露批量文件夹扫描API
  • 医学/法律免责声明:所有输出需标注"辅助参考,非专业意见",重大决策需人工复核

适用人群

  • 财务人员:自动化票据录入、银行账单订阅分析、费用报表生成
  • 法务/合规:合同风险初筛、PII脱敏处理、敏感文档标准化审查
  • HR/招聘:简历批量解析、候选人信息结构化提取
  • 行政助理:会议记录转写、表格数据迁移、多语言文档翻译
  • 个人用户:证件信息备份、医疗报告摘要、重要文档归档整理

安全等级与风险提示

  • 核心功能:S级(纯本地,无网络依赖,无持久化存储)
  • 脚本扩展功能:A级(whisper首次联网后可离线,pdfplumber完全本地)
  • 隐私控制:时间线日志默认关闭,需显式授权;表单自动填充数据会话级销毁
  • 主要风险:用户可能误将AI分析结果作为最终法律/医疗决策依据,需强调辅助定位

安全解读

核心用法

Doc-Process 是一款面向个人和团队的文档智能处理技能,采用"Claude原生能力为主、可选脚本增强"的架构设计。用户通过自然语言触发特定模式,如"填写这个表单""分析这份合同风险""扫描这张收据"等,系统自动识别文档类型并执行对应处理流程。

该技能支持14种处理模式:文档自动分类、表单自动填写、合同风险分析、收据/发票扫描、银行对账单分析(订阅追踪、异常检测、税务抵扣识别)、简历/CV解析、身份证和护照扫描(含MRZ解码)、医疗记录摘要、PII脱敏(轻度/标准/完全三档)、会议纪要与行动项提取、表格提取转CSV/JSON、文档翻译、照片透视校正与扫描优化,以及可选的时间线日志功能。

核心工作流程为:识别模式→读取文档→加载参考指南→执行处理→交付结构化输出。大部分模式直接调用Claude的多模态能力完成,无需任何外部依赖;仅表格提取、音频转录、文档扫描三个功能需要安装声明的第三方库。

显著优点

隐私优先架构:该技能最大亮点在于将隐私保护融入设计基因。核心文档处理(OCR、PDF阅读、表单填写、合同分析等)完全依赖Claude原生能力,文档内容仅在当前会话本地读取,不存储、不索引、不外传。PII脱敏脚本使用纯标准库实现,敏感数据处理全程本地化。

透明可控的依赖管理:与常见"黑箱"工具不同,该技能对第三方依赖采用"白名单+显式声明"策略。仅3个可选功能需要外部库(pdfplumber用于表格提取、openai-whisper+ffmpeg用于音频转录、opencv+Pillow+numpy用于文档扫描),且均在运行前进行导入检查并提示安装指令,无隐藏依赖。

Opt-in隐私机制:时间线日志功能默认关闭,首次使用后明确征求用户同意才启用。日志仅记录文档类型和分类级摘要,排除任何原始内容或个人标识数据。用户可随时查看、编辑或清除本地时间线文件。

多场景覆盖与专业深度:从日常报销 receipt 扫描到合同法律风险审查,从简历信息提取到医疗报告摘要,覆盖个人财务管理、HR招聘、法务合规、医疗健康等多个垂直场景。各模式配备详细的参考指南(reference files),确保输出质量稳定可控。

潜在缺点与局限性

功能边界依赖Claude能力:核心OCR和文档理解完全基于Claude视觉模型,对极端复杂版式(如手写体混杂、严重扫描畸变、多栏混排古籍)的识别准确率可能低于专用OCR引擎。合同风险分析基于通用法律常识,不构成专业法律意见。

可选功能的依赖门槛:表格提取需安装pdfplumber,音频转录需openai-whisper和ffmpeg(首次运行还需下载约140MB模型文件),文档扫描需opencv等图像处理库。这些依赖在部分受限环境(如无网络容器、无root权限系统)可能难以部署。

无持久化数据库支持:银行对账单分析、费用记录等功能基于CSV/JSON文件存储,不适合企业级高并发场景或需要跨设备同步的用例。时间线日志为本地单用户文件,无多用户协作或云端备份能力。

医疗/法律场景的责任边界:技能明确标注医疗摘要仅供个人参考、合同分析不构成法律建议,但用户可能过度依赖自动化输出。复杂医疗诊断解读、具有法律效力的合同审查仍需专业人工复核。

适合的目标群体

个人效率用户:需要批量处理报销单据、整理银行流水、快速提取证件信息、管理个人文档的职场人士。特别适合对隐私敏感、不愿将个人财务/医疗文档上传至云端服务的用户。

小型团队与初创公司:HR从业者批量解析简历、运营人员整理会议纪要与行动项、财务人员处理发票与对账单。无订阅费用、可私有化部署的特性对预算有限的团队友好。

隐私合规敏感行业:法律、医疗、金融领域的个人从业者,需要本地处理含敏感信息的文档,满足GDPR、HIPAA等合规要求的数据最小化原则。

开发者与技术用户:需要文档处理管道组件进行集成,或希望基于该技能进行二次开发的技术人员。代码结构清晰、参考指南完整,具备良好的可扩展性。

使用风险

依赖维护风险:pdfplumber、openai-whisper等第三方库若出现安全漏洞或破坏性更新,可能影响相关功能。建议锁定版本号(如pdfplumber==0.11.0)并定期审计。

音频转录的数据出境:Whisper模型首次下载来自OpenAI/HuggingFace服务器(美国/欧洲),虽后续完全离线运行,但在强数据本地化要求的场景下需预下载模型并断网使用。

本地文件安全风险:时间线日志和脱敏输出文件以明文JSON/文本形式存储于本地文件系统,若设备丢失或遭入侵存在泄露风险。建议存储于加密磁盘或定期清理。

误识别与幻觉风险:尽管技能设计保守标记策略("存疑则标注"),Claude对复杂表格、手写内容、低质量扫描件的识别仍可能出现错误。关键业务决策前需人工复核输出。

功能误用风险:用户可能将合同分析输出用于正式法律决策,或将医疗摘要替代专业诊断。各模式参考文件已包含免责声明,但用户教育仍是必要环节。

Doc Process 内容

evals文件夹
references文件夹
scripts文件夹
手动下载zip · 117.1 kB
evals.jsonapplication/json
请选择文件