核心用法
doc-processor 是 OpenClaw 生态中的专用文档处理 Skill,采用「职责分离」架构设计——v2.7.11 起完全移除 AI 功能,专注提供纯本地、高可靠的文档 I/O 能力。
主要能力矩阵
| 能力 | 支持格式 | 典型场景 |
|------|---------|---------|
| 读取 | PDF/Word/Excel/CSV/TXT/Markdown | 内容解析、数据入库 |
| 写入 | Word/Excel/CSV/TXT/Markdown | 报告生成、模板填充 |
| 转换 | 跨格式互转(PDF 仅出) | 格式标准化、数据迁移 |
| 合并 | Word/Excel | 多文件汇总、报表整合 |
| 提取 | 全格式 | 表格提取、结构化数据获取 |
调用方式
- CLI 脚本:
doc-read.sh,doc-write.sh,doc-convert.sh,doc-merge.sh - Python API:
DocumentProcessor类,支持流式处理与批量操作 - 模板支持: Excel/Word 模板缓存与智能匹配
v2.7.11 架构调整
AI 摘要/分析功能已剥离至 OpenClaw 主程序统一处理,本 Skill 仅保留文档处理核心,消除了 LLM 网络依赖和相关安全风险。
显著优点
1. 安全合规:零外部网络请求,无 API Key 配置,通过 ClawHub 安全标记审查
2. 格式覆盖全:现代 Office 格式(docx/xlsx)原生支持,PDF 借助系统级 poppler 工具链
3. 性能优化:v2.7 起内置性能监控,模板缓存、批量处理机制成熟
4. 跨平台:Linux/macOS 自动依赖安装,支持国内镜像源加速
5. 开源透明:MIT 许可,setup.sh 完全开源可审计
潜在局限
- PDF 只读:无法直接生成 PDF,需借助外部工具转换
- 旧格式不支持:.doc/.xls 需预先用 LibreOffice 转换
- 系统依赖:poppler-utils 必须预装,Windows 支持未明确
- 无实时协作:纯本地处理,无云端同步或并发编辑能力
适合人群
- 企业数据工程师:需要批量处理报表、合同、发票的标准化 pipeline
- 本地优先用户:对数据不出本地有强要求的金融、医疗、政务场景
- 自动化开发者:构建文档工作流(RPA、ETL、归档系统)
- OpenClaw 生态用户:需要与主程序 LLM 能力解耦、分层调用的架构
常规风险
| 风险类别 | 说明 | 缓解措施 |
|---------|------|---------|
| 依赖失效 | poppler 未安装或版本不兼容 | 提供自动安装脚本与检测工具 `check_deps.py` |
| 路径解析 | 相对路径/特殊字符导致文件找不到 | v2.7.5 已修复,建议使用绝对路径 |
| 大文件处理 | 内存占用高、处理慢 | 使用 `pages` 等选项限制读取范围 |
| 格式兼容性 | 复杂排版可能丢失样式 | 优先使用简单表格结构,关键文档人工校验 |
---
评估基于 v2.7.13 版本文档,最后更新 2026-03-25