Fetch

🌐 公开网页一键抓取,数据本地安全归档

本地运行的公开网页内容获取与清洗工具,无需认证,数据仅本地存储,适合快速提取网页正文。

收藏
11.3k
安装
2.4k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Fetch 是一款专注于公开网页内容获取与本地化的工具类 skill。用户通过简单的命令行脚本即可抓取公开 URL 的网页内容,自动提取标题、正文文本及链接结构,并将原始 HTML 与清洗后的结构化数据一并保存至本地存储目录。主要工作流程包括:初始化存储空间(init_storage.py)、执行抓取(fetch_url.py)、保存带标题的清洗结果(save_output.py),以及通过任务历史进行检索(list_jobs.pyshow_job.py)。

显著优点

1. 零依赖轻量设计:仅依赖系统自带的 Python 3,无需安装额外 Python 包,部署极简。
2. 数据主权保障:所有抓取数据严格本地存储于 ~/.openclaw/workspace/memory/fetch/,无云端同步、无外部上传,符合隐私敏感场景需求。

3. 安全边界清晰:明确限定为公开网页,禁止登录态、Cookie、浏览器自动化及任何形式的凭证传递,大幅降低安全风险。

4. 结构化输出:优先输出清洗后的纯文本与元数据,而非原始 HTML 噪音,便于后续文本分析或知识库构建。

潜在缺点与局限性

  • 功能范围受限:不支持需要身份验证的页面(如付费墙、会员专区)、动态渲染页面(JavaScript 密集型 SPA)及反爬机制复杂的站点。
  • 无并发与速率控制:文档未提及请求频率限制、重试机制或并发控制,高频使用可能触发目标站点封禁。
  • 本地存储管理:长期运行可能累积大量本地文件,需用户手动清理,缺乏自动归档或过期策略。

适合人群

  • 研究人员、知识管理用户需批量抓取公开文章、文档进行本地归档
  • 隐私敏感用户希望避免在线剪藏工具的数据上传
  • 自动化工作流开发者需要轻量、无依赖的网页抓取组件

常规风险

  • 目标站点合规性:用户需自行确保抓取行为符合目标网站的 robots.txt 及服务条款,工具本身不提供合规检查。
  • 内容溯源缺失:清洗后的纯文本可能丢失原始 URL 上下文,需配合 save_output.py 的标题标注功能维护来源信息。
  • 本地数据安全:存储目录无加密说明,多用户系统需注意文件权限配置。

Fetch 内容

references文件夹
scripts文件夹
lib文件夹
手动下载zip · 7.3 kB
philosophy.mdtext/markdown
请选择文件