核心用法
URL Reader 是一款面向中国主流内容平台的智能网页抓取工具,采用三层自动降级策略确保高成功率:首选 Firecrawl AI 抓取(500页/月免费),备选 Jina Reader(完全免费无需Key),兜底 Playwright 浏览器自动化(支持登录态)。用户直接粘贴链接或输入 /url-reader <URL> 即可一键获取结构化内容,自动保存为 Markdown 并下载图片至 /Users/ys/laoyang知识库/nickys/素材/ 目录,按日期+标题归档。
显著优点
1. 平台适配广泛:覆盖微信公众号、小红书、今日头条、抖音、淘宝/天猫/京东、知乎、B站等中国主流平台,自动识别平台类型并选择最优策略
2. 容错性强:三层降级机制确保即使单一服务故障仍能工作;Firecrawl 自动处理 JavaScript 渲染和反爬
3. 本地知识沉淀:自动归档内容和图片,便于构建个人知识库,支持后续 AI 处理
4. 成本可控:免费额度充足,付费方案按量计费灵活
潜在缺点与局限
- 微信公众号限制:反爬最严格,Playwright 需首次手动登录且登录态可能过期
- Firecrawl 额度:高频使用者(>500页/月)需付费或依赖降级策略
- 动态内容风险:短视频平台(抖音)主要提取文字描述,视频下载需额外处理
- 电商页面:淘宝/天猫商品页可能需要登录,且价格信息实时变动
适合人群
- 知识管理用户:构建个人/团队内容知识库
- 研究人员:批量收集行业报告、公众号文章
- 内容创作者:监控竞品动态、整理素材
- AI 工作流用户:为 RAG 系统准备结构化训练数据
常规风险
- 隐私合规:抓取含个人信息的内容需遵守《个人信息保护法》
- 平台 ToS:部分平台(微信、小红书)明确禁止自动化抓取,存在账号封禁风险
- 内容版权:商业使用需确认原文授权,自动下载不等于获得使用权
- 数据安全:本地存储路径需妥善管理,避免敏感内容泄露