Url Reader

🔗 一键抓取全网内容,自动归档知识库

智能抓取微信、小红书、抖音等中国主流平台内容,三层降级策略保障成功率,自动保存Markdown与图片到本地知识库。

收藏
7.6k
安装
2.2k
版本
0.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

URL Reader 是一款面向中国主流内容平台的智能网页抓取工具,采用三层自动降级策略确保高成功率:首选 Firecrawl AI 抓取(500页/月免费),备选 Jina Reader(完全免费无需Key),兜底 Playwright 浏览器自动化(支持登录态)。用户直接粘贴链接或输入 /url-reader <URL> 即可一键获取结构化内容,自动保存为 Markdown 并下载图片至 /Users/ys/laoyang知识库/nickys/素材/ 目录,按日期+标题归档。

显著优点

1. 平台适配广泛:覆盖微信公众号、小红书、今日头条、抖音、淘宝/天猫/京东、知乎、B站等中国主流平台,自动识别平台类型并选择最优策略
2. 容错性强:三层降级机制确保即使单一服务故障仍能工作;Firecrawl 自动处理 JavaScript 渲染和反爬

3. 本地知识沉淀:自动归档内容和图片,便于构建个人知识库,支持后续 AI 处理

4. 成本可控:免费额度充足,付费方案按量计费灵活

潜在缺点与局限

  • 微信公众号限制:反爬最严格,Playwright 需首次手动登录且登录态可能过期
  • Firecrawl 额度:高频使用者(>500页/月)需付费或依赖降级策略
  • 动态内容风险:短视频平台(抖音)主要提取文字描述,视频下载需额外处理
  • 电商页面:淘宝/天猫商品页可能需要登录,且价格信息实时变动

适合人群

  • 知识管理用户:构建个人/团队内容知识库
  • 研究人员:批量收集行业报告、公众号文章
  • 内容创作者:监控竞品动态、整理素材
  • AI 工作流用户:为 RAG 系统准备结构化训练数据

常规风险

  • 隐私合规:抓取含个人信息的内容需遵守《个人信息保护法》
  • 平台 ToS:部分平台(微信、小红书)明确禁止自动化抓取,存在账号封禁风险
  • 内容版权:商业使用需确认原文授权,自动下载不等于获得使用权
  • 数据安全:本地存储路径需妥善管理,避免敏感内容泄露

Url Reader 内容

手动下载zip · 3.1 kB
skill.mdtext/markdown
请选择文件