核心用法
html-markdown 是一个封装了 MinerU 开源能力的 CLI 工具,提供两条主要命令路径:
- `extract`:处理本地
.html文件或远程 HTML URL,直接解析静态 HTML 结构并输出 Markdown - `crawl`:针对需要 JavaScript 渲染的动态网页(如 SPA、懒加载内容),提供完整的浏览器级抓取能力
用户需先通过 mineru-open-api auth 配置 Token,或通过环境变量 MINERU_TOKEN 注入。支持语言参数 --language(默认中文 ch,英文场景用 en)。输出默认流向 stdout,可用 -o 指定目录保存文件。
显著优点
1. 开源背书:MinerU 由上海人工智能实验室(OpenDataLab)开源维护,技术栈透明,社区活跃度较高
2. 动态渲染支持:crawl 模式可处理现代 Web 应用的 JS 依赖内容,优于传统静态 HTML 解析器
3. 格式保真度:专为文档场景优化,能较好保留标题层级、列表、表格等结构
4. 双语优化:内置中英文语言提示,对中文文档排版友好
潜在缺点与局限性
- Token 强制依赖:所有 HTML 相关功能均需 API Token,无法离线使用,存在服务可用性依赖
- 非本地优先:
flash-extract模式不支持 HTML,意味着无法零配置快速体验 - Token 获取门槛:需注册 https://mineru.net 并手动创建 Token,流程较繁琐
- 平台限制:Go 安装方式仅支持 macOS/Linux,Windows 用户需依赖 npm
适合人群
- 需要批量将网页/电子书 HTML 转为 Markdown 的知识管理用户
- 构建 RAG/LLM 知识库的开发者,需清洗结构化网页内容
- 技术写作者处理在线文档、API 文档等场景
常规风险
- Token 泄露风险:
MINERU_TOKEN若写入 shell history 或误提交代码,可能导致配额被盗用 - 服务连续性:MinerU 云服务若调整策略或限流,可能影响工作流
- 隐私合规:通过
crawl抓取第三方网站时,需遵守目标站点的 robots.txt 及版权政策 - 输出质量波动:复杂 CSS 布局或嵌套表格的解析效果可能不及预期,需人工校验