核心用法
PDF Reader是一款面向服务器环境的PDF文本提取技能,采用双层处理架构:首先尝试通过pdftotext快速提取文本层PDF内容,若检测到稀疏文本或纯扫描图像,则自动降级至tesseract OCR引擎。用户通过bash <skill-dir>/scripts/pdf-extract.sh调用,支持--output保存文件、--lang指定语言(默认chi_sim+eng)、--dpi调节OCR分辨率等参数。
显著优点
- 智能降级策略:无需用户判断PDF类型,自动选择最优提取路径,兼顾速度与精度
- 多语言原生支持:内置中文简体+英语双引擎,可通过
--lang扩展日韩等语种 - 零配置友好:
--auto-install自动适配apt/yum/brew安装依赖,降低运维门槛 - 安全沙箱设计:语言参数严格校验白名单,防止命令注入
潜在局限
- OCR质量绑定扫描质量:低分辨率、手写体或复杂排版PDF识别率下降
- 加密文档不支持:密码保护PDF直接拒绝处理
- 大文件性能瓶颈:50页以上扫描PDF耗时1-2分钟,阻塞式执行
- 纯图像噪声:图表、照片页会产生无意义OCR输出
适合人群
- 需要批量处理历史扫描档案的开发者/运维人员
- 构建RAG知识库、需提取PDF正文作为上下文的大模型应用
- 多语言混合文档(合同、论文、票据)的自动化处理场景
常规风险
- 依赖外部二进制工具(poppler/tesseract),若
--auto-install启用需警惕供应链污染 - 临时文件(
/tmp/pdf-text.txt)默认权限依赖系统umask,敏感文档需额外加固 - OCR过程内存占用随
--dpi线性增长,高分辨率大批量任务可能触发OOM