核心用法
baoyu-url-to-markdown 是一个 CLI 工具,通过 Chrome DevTools Protocol (CDP) 驱动浏览器获取任意网页并转换为干净的 Markdown 格式。核心命令为 ${READER} <url>,支持多种输出模式(stdout/文件/JSON)、媒体下载、交互等待等功能。
显著优点
1. 站点专属适配器:内置 X/Twitter、YouTube 字幕、Hacker News 讨论串等专用解析器,比通用爬虫提取质量更高
2. 交互式登录支持:--wait-for interaction 模式可暂停等待用户完成登录或 CAPTCHA,解决反爬限制
3. 媒体本地化:--download-media 自动下载图片视频到本地,避免外链失效
4. 灵活配置:通过 EXTEND.md 支持项目级/用户级偏好设置(媒体处理方式、默认输出目录)
潜在缺点与局限性
- 依赖 Bun 运行时:需预装 Bun,对 Node.js 用户增加环境负担
- Chrome 依赖:必须安装 Chrome/Chromium,容器/服务器部署复杂
- Headless 质量风险:文档明确警告默认无头模式可能返回低质量内容,需人工检查
- 路径构造复杂:输出路径需 Agent 自行组装,非 CLI 自动生成
- 首次设置阻塞:缺少 EXTEND.md 时必须完成三道问题的交互配置,无法静默运行
适合人群
- 需要保存网页内容的开发者、研究人员、知识管理用户
- 对 X/Twitter、YouTube 等内容有结构化存档需求的用户
- 能接受 Bun + Chrome 环境配置的技术用户
常规风险
1. 执行安全风险:调用外部 Chrome 进程并执行 CDP 指令,需信任 baoyu-fetch 脚本来源
2. 隐私泄露风险:使用 --wait-for interaction 时,浏览器访问用户登录态页面,可能残留会话 Cookie
3. 网络请求风险:自动下载媒体文件可能获取恶意内容,建议审查来源
4. 存储占用风险:媒体下载模式可能产生大量本地文件,需关注磁盘空间