Fetch

🌐 公开网页一键抓取,数据本地安全归档

本地运行的公开网页内容获取与清洗工具,无需认证,数据仅本地存储,适合快速提取网页正文。

收藏
11.3k
安装
2.4k
版本
1.0.0
CLS 安全性认证2026-08-10
点击查看完整报告 >

使用说明

核心用法

Fetch 是一款专注于公开网页内容获取与本地化的工具类 skill。用户通过简单的命令行脚本即可抓取公开 URL 的网页内容,自动提取标题、正文文本及链接结构,并将原始 HTML 与清洗后的结构化数据一并保存至本地存储目录。主要工作流程包括:初始化存储空间(init_storage.py)、执行抓取(fetch_url.py)、保存带标题的清洗结果(save_output.py),以及通过任务历史进行检索(list_jobs.pyshow_job.py)。

显著优点

1. 零依赖轻量设计:仅依赖系统自带的 Python 3,无需安装额外 Python 包,部署极简。
2. 数据主权保障:所有抓取数据严格本地存储于 ~/.openclaw/workspace/memory/fetch/,无云端同步、无外部上传,符合隐私敏感场景需求。

3. 安全边界清晰:明确限定为公开网页,禁止登录态、Cookie、浏览器自动化及任何形式的凭证传递,大幅降低安全风险。

4. 结构化输出:优先输出清洗后的纯文本与元数据,而非原始 HTML 噪音,便于后续文本分析或知识库构建。

潜在缺点与局限性

  • 功能范围受限:不支持需要身份验证的页面(如付费墙、会员专区)、动态渲染页面(JavaScript 密集型 SPA)及反爬机制复杂的站点。
  • 无并发与速率控制:文档未提及请求频率限制、重试机制或并发控制,高频使用可能触发目标站点封禁。
  • 本地存储管理:长期运行可能累积大量本地文件,需用户手动清理,缺乏自动归档或过期策略。

适合人群

  • 研究人员、知识管理用户需批量抓取公开文章、文档进行本地归档
  • 隐私敏感用户希望避免在线剪藏工具的数据上传
  • 自动化工作流开发者需要轻量、无依赖的网页抓取组件

常规风险

  • 目标站点合规性:用户需自行确保抓取行为符合目标网站的 robots.txt 及服务条款,工具本身不提供合规检查。
  • 内容溯源缺失:清洗后的纯文本可能丢失原始 URL 上下文,需配合 save_output.py 的标题标注功能维护来源信息。
  • 本地数据安全:存储目录无加密说明,多用户系统需注意文件权限配置。

安全解读

核心用法

Fetch是一款专注于公开网页内容获取与清洗的本地工具,通过命令行脚本完成完整的抓取工作流。用户仅需提供目标URL,即可自动完成网页下载、HTML解析、内容提取和本地归档。主要操作包括:使用fetch_url.py发起抓取请求,系统自动提取页面标题、正文文本和链接结构;通过save_output.py将清洗后的内容以自定义标题保存;借助list_jobs.pyshow_job.py随时查阅历史任务详情。所有数据持久化存储于~/.openclaw/workspace/memory/fetch/目录,采用原子写入机制确保文件完整性。

显著优点

极致轻量与零依赖:完全基于Python 3标准库实现,不引入任何第三方包,彻底规避供应链攻击风险,部署成本趋近于零。安全边界清晰明确:严格限定公开URL访问,自动拒绝非HTTP/HTTPS协议,无登录态、无Cookie管理、无浏览器自动化,攻击面大幅收缩。隐私优先设计:数据仅落地本地磁盘,禁止任何形式的外部上传或云端同步,符合GDPR数据最小化原则。结构化的内容输出:智能区分原始HTML与清洗后纯文本,保留关键元数据(标题、链接、抓取时间),便于后续自动化处理。可追溯的作业历史:自动维护JSON格式的任务日志,支持按ID快速回溯任意历史抓取记录。

潜在缺点与局限性

功能单一性:不支持JavaScript动态渲染页面,对现代SPA应用(单页应用)或重度Ajax依赖站点的抓取效果受限。反爬对抗缺失:未内置请求频率控制、IP轮换、验证码识别等对抗机制,面对严格反爬策略的网站易触发封禁。内容提取鲁棒性:基于规则的HTML解析可能在非标准网页结构或极度复杂的DOM场景下出现提取不全或噪声残留。无增量更新机制:每次抓取均为全量请求,不支持ETag校验、条件请求等缓存优化策略。管理界面缺失:纯命令行交互,无图形化历史浏览、搜索筛选或批量导出功能,大规模任务管理效率偏低。

适合的目标群体

技术研究人员:需要快速获取公开论文页面、技术文档、开源项目Readme等静态内容的开发者与学者。数据合规敏感型用户:对数据出境、第三方托管有严格限制的企业法务、政府或医疗行业从业者。轻量化自动化场景:构建本地知识库、离线阅读归档、简单的竞品信息监控等低频次、小批量需求。安全审计与渗透测试:作为可控的网络请求组件,用于验证目标站点的公开接口暴露情况。

使用风险说明

网络层面:用户输入的URL直接决定请求目标,若误信恶意链接可能暴露客户端IP或下载有害内容,建议结合URL来源白名单机制使用。存储层面:历史文件持续累积可能占用磁盘空间,敏感内容残留于本地存在泄露风险,需建立定期清理策略。内容层面:提取的网页文本可能包含钓鱼诱导、社会工程学 payload 或版权受限材料,二次分发前务必进行合规审查。性能层面:单线程同步请求模式,大规模批量任务执行效率有限,超大数据包或慢响应站点可能导致单次任务超时(默认20秒)。

Fetch 内容

references文件夹
scripts文件夹
lib文件夹
手动下载zip · 7.3 kB
philosophy.mdtext/markdown
请选择文件