核心功能
HWP Reader 是一款专门处理韩国 Hangul Word Processor 格式文档的技能,支持读取传统 HWP 二进制格式和现代 HWPX(基于 ZIP 的 XML)格式。该技能通过 pyhwp 库解析遗留 HWP 文件,并利用 Python 标准库的 zipfile 和 xml.etree.ElementTree 处理 HWPX 格式。
显著优点:
- 针对韩国政府文书场景深度优化,可处理 정부지원사업 신청서 等官方表格
- 双格式支持覆盖新旧文档标准,HWPX 支持表格检测和图片提取(BinData/)
- 无需依赖 Microsoft Office 或 Hancom Office 原生软件
- 支持批量文档对比、模板内容填充等进阶工作流
潜在局限:
- HWP 格式的表格结构会丢失,仅以
<표>占位符显示 - HWPX 的 Preview/PrvText.txt 被截断至约 1KB,需遍历 section XML 获取完整内容
- 复杂格式(颜色、字体、页面布局)在纯文本模式下不保留
- 加密或密码保护的文档无法处理
- 依赖 pyhwp 第三方库,若未预装则功能受限
适合人群:
- 需要处理韩国政府申请文件、商业合同的用户
- AI 辅助填写韩文表格、对比文档版本的研究者
- 无 Hancom Office 环境但需要解析韩文文档的开发者
常规风险:
- 提取内容可能与原始排版存在偏差,关键数据需人工复核
- 执行外部 Python 脚本存在潜在代码注入风险(虽当前实现为硬编码模板)
- 依赖库版本兼容性可能影响 HWP 解析稳定性