核心用法
WiseOCR 是一款基于 WiseDiag 云端 OCR API 的文档解析工具,可将单份 PDF 或图片(jpg/png/webp/gif/bmp/tiff)转换为结构化 Markdown。核心流程为:设置 WISEDIAG_API_KEY 环境变量后,通过 python3 wiseocr.py -i <文件路径> 调用脚本,结果自动保存至 ~/.openclaw/workspace/WiseOCR/ 目录,无需手动另存。支持通过 -n 参数指定原始文件名(避免因临时路径导致命名混乱),以及 --dpi 调节 PDF 渲染精度(72-600,默认 200)。
显著优点
1. 高精度识别:支持表格结构还原与多栏复杂版式,适用于学术论文、财务报表等专业场景。
2. 零配置输出:结果自动落盘,减少用户操作步骤。
3. 多格式兼容:覆盖主流图片格式及 PDF,满足日常文档数字化需求。
潜在缺点与局限性
- 强云端依赖:文件必须上传至 WiseDiag 服务器处理,无法离线使用,网络波动或 API 限流将影响体验。
- 隐私合规风险:官方明确警示不得上传含身份证号、银行卡号、生物特征、账户凭证、未成年人信息等敏感数据的文档,用户需自行承担数据跨境传输的合规责任。
- 单文件限制:仅支持单次处理单个文件,批量场景需自行循环调用。
- 黑盒可信度:OCR 引擎为第三方闭源服务,识别质量与数据留存政策依赖厂商自律,无开源可审计性。
适合人群
- 需要快速将扫描件、截图或 PDF 转为可编辑 Markdown 的办公用户;
- 处理公开资料、学术论文等非敏感文档的研究人员;
- 能接受云端处理模式、且已阅读并同意 WiseDiag 隐私条款的技术用户。
常规风险
1. 数据泄露:传输链路若未强制 TLS 或证书配置不当,存在中间人攻击风险;文件在第三方服务器处理期间的理论留存窗口亦不可控。
2. 合规违规:误传含 PII(个人身份信息)或 GDPR 管辖数据的文档,可能导致法律责任。
3. API 密钥泄露:WISEDIAG_API_KEY 以环境变量形式管理,若多人共用主机或日志配置不当,存在密钥暴露风险。
4. 服务中断:依赖单一云服务商,API 变更、停机或计费策略调整将直接影响可用性。
> 建议:处理敏感文档时优先选用本地 OCR(如 Tesseract、PaddleOCR);使用前务必审查 WiseDiag 最新隐私政策与数据处理协议(DPA)。