核心用法
Fetch 是一款专注于公开网页内容获取与本地化的工具类 skill。用户通过简单的命令行脚本即可抓取公开 URL 的网页内容,自动提取标题、正文文本及链接结构,并将原始 HTML 与清洗后的结构化数据一并保存至本地存储目录。主要工作流程包括:初始化存储空间(init_storage.py)、执行抓取(fetch_url.py)、保存带标题的清洗结果(save_output.py),以及通过任务历史进行检索(list_jobs.py、show_job.py)。
显著优点
1. 零依赖轻量设计:仅依赖系统自带的 Python 3,无需安装额外 Python 包,部署极简。
2. 数据主权保障:所有抓取数据严格本地存储于 ~/.openclaw/workspace/memory/fetch/,无云端同步、无外部上传,符合隐私敏感场景需求。
3. 安全边界清晰:明确限定为公开网页,禁止登录态、Cookie、浏览器自动化及任何形式的凭证传递,大幅降低安全风险。
4. 结构化输出:优先输出清洗后的纯文本与元数据,而非原始 HTML 噪音,便于后续文本分析或知识库构建。
潜在缺点与局限性
- 功能范围受限:不支持需要身份验证的页面(如付费墙、会员专区)、动态渲染页面(JavaScript 密集型 SPA)及反爬机制复杂的站点。
- 无并发与速率控制:文档未提及请求频率限制、重试机制或并发控制,高频使用可能触发目标站点封禁。
- 本地存储管理:长期运行可能累积大量本地文件,需用户手动清理,缺乏自动归档或过期策略。
适合人群
- 研究人员、知识管理用户需批量抓取公开文章、文档进行本地归档
- 隐私敏感用户希望避免在线剪藏工具的数据上传
- 自动化工作流开发者需要轻量、无依赖的网页抓取组件
常规风险
- 目标站点合规性:用户需自行确保抓取行为符合目标网站的 robots.txt 及服务条款,工具本身不提供合规检查。
- 内容溯源缺失:清洗后的纯文本可能丢失原始 URL 上下文,需配合
save_output.py的标题标注功能维护来源信息。 - 本地数据安全:存储目录无加密说明,多用户系统需注意文件权限配置。