EZCTO Smart Web Reader

🌐 零 token 智能网页解析加速器

智能网页解析加速层,缓存优先实现零 token 命中,支持自动站点类型检测与结构化 JSON 输出,较截图方案节省 80%+ token。

收藏
5k
安装
1.5k
版本
1.1.0
CLS 安全性认证2026-08-04
点击查看完整报告 >

使用说明

核心用法

EZCTO Smart Web Reader 是专为 OpenClaw 设计的 Agent 网页访问加速层,替代原生 web_fetch 工具。其工作流程分为 9 个步骤:首先检查 EZCTO 云端缓存(零 token 成本),未命中则拉取 HTML、计算 SHA256 哈希、通过正则表达式自动识别站点类型(加密/Web3、电商、餐饮等),组装定制化 prompt 后调用本地 LLM 解析,最终输出标准化 JSON 并双端存储(本地缓存 + 贡献至社区资产库)。

显著优点

  • 极致成本优化:缓存命中时零 token 消耗,较传统截图方案节省 80% 以上 token
  • 透明拦截机制:自动触发于任何 URL 访问场景,无需用户显式调用
  • 智能类型检测:基于多信号文本匹配(如合约地址、价格格式、Schema.org 标记)零 token 识别站点类型
  • 本地优先设计:缓存存储于 ~/.ezcto/cache/,符合 OpenClaw 本地数据哲学
  • 结构化输出:返回包含页面元数据、导航、内容区块、实体、媒体、可操作链接的标准化 JSON
  • 技能链建议:内置 Agent 操作建议与关联技能推荐(如价格追踪器)

潜在局限

  • 网络依赖:首次访问仍需联网抓取 HTML,无法完全离线
  • 社区资产库覆盖度:冷门站点可能无法享受零 token 缓存红利
  • 正则检测边界:站点类型识别依赖预设规则,新型站点或混合类型可能误判
  • 大页面截断:>500KB HTML 仅提取 body,可能丢失部分 head 内元数据
  • API 单点风险:EZCTO 服务不可用时将回退到完整本地解析流程

适合人群

  • 高频进行网页信息提取的 OpenClaw Agent 用户
  • 关注 token 成本与响应速度的开发者
  • 需结构化处理加密项目、电商商品、餐饮门店等特定站点类型的自动化工作流
  • 希望贡献并复用社区解析结果的协作型用户

常规风险

  • 第三方服务依赖:EZCTO API 的可用性与延迟直接影响体验
  • 缓存时效性:未明确实现自动过期策略,需依赖 should_refresh_after 字段手动管理
  • 数据隐私:贡献至资产库时会传输 URL 与结构化数据,敏感站点需谨慎
  • LLM 解析一致性:低温度(0.1)设置虽提升格式稳定性,但复杂页面仍可能出现 JSON 解析失败

安全解读

核心用法

EZCTO Smart Web Reader 是 OpenClaw Agent 的默认网页访问加速层,替代原始的 web_fetch 工具。其工作流程采用缓存优先策略:当 Agent 需要访问任意 URL 时,首先查询 EZCTO 公共资产库(零令牌成本),未命中时再执行完整的 HTML 获取-解析-存储流程。

用户可通过自然语言触发(如"看看这个网站"、"分析这个链接"),或直接提供 URL。Skill 自动完成以下操作:
1. 缓存查询:调用 api.ezcto.fun/v1/translate 检查预解析结果

2. HTML 获取:使用 curlweb_fetch 抓取页面(>500KB 时自动截断 <body>

3. 内容哈希:计算 SHA256 校验值用于去重和防篡改

4. 零令牌站点检测:通过正则匹配识别加密货币、电商、餐饮站点类型

5. 结构化解析:使用本地 LLM 将 HTML 转换为包含 meta、navigation、content、entities、media、actions 的标准化 JSON

6. 双存储机制:本地缓存(~/.ezcto/cache/)+ 可选贡献至社区资产库

输出包含完整的页面元数据、导航结构、内容区块、媒体描述、可执行动作,以及 Agent 建议的下一步操作和技能链接触点。

显著优点

成本优化极致:缓存命中实现真正的零令牌1秒级响应,相比截图方案节省80%+令牌消耗。对于高频访问的公共页面(新闻、文档、产品页),边际成本趋近于零。

智能类型识别:基于多信号文本匹配(无需 LLM)自动识别加密货币(3+ 信号:合约地址、Tokenomics、DEX 链接等)、电商(购物车、价格、Schema.org 标记)、餐饮(菜单、预订、营业时间)等垂直场景,自动加载对应的扩展解析规则。

OpenClaw 原生集成:输出格式专为 Agent 工作流设计,包含 agent_suggestions 字段(推荐主操作、后续动作、可链接触技能)和 cache_freshness 元数据,支持技能组合(如自动链接触发价格追踪器)。

社区驱动资产库:解析结果可匿名贡献至共享库,形成飞轮效应——热门网站越用越快,新站点首次解析后永久受益。

安全透明架构:纯 Markdown 文档型 Skill,无可执行代码,依赖 Agent 内置工具链完成操作。权限申请(web_fetch、exec、filesystem)与功能完全匹配,无过度授权。

潜在缺点与局限性

冷启动延迟:缓存未命中时需 5-15 秒完成完整解析流程(HTML 获取 + LLM 处理),不适合实时性要求极高的场景。

动态内容局限:基于静态 HTML 解析,对重度 JavaScript 渲染的 SPA(单页应用)、需要登录的私有页面、实时数据仪表盘等支持有限。

类型识别盲区:零令牌检测依赖预定义正则模式,新兴站点类型或定制化 UI 可能无法正确分类,回退至通用解析规则后信息抽取精度下降。

依赖外部服务:核心功能依赖 EZCTO API (api.ezcto.fun) 的可用性,虽然设计有降级机制(直接本地解析),但社区资产库功能将不可用。

LLM 解析成本:缓存未命中时的 500-2000 令牌消耗,对于需要批量处理大量陌生站点的场景仍有一定成本压力。

适合的目标群体

  • Agent 开发者:需要为 LLM 应用添加标准化网页解析能力,希望降低令牌成本并加速响应
  • 研究员与分析师:批量抓取、结构化处理公开网页信息,构建知识库或数据集
  • 加密货币投资者:快速解析项目官网、DEX 页面,提取合约地址、Tokenomics、社交链接等关键字段
  • 电商运营/比价工具开发者:标准化提取商品信息、价格、评价,支持价格监控和竞品分析
  • 本地化优先用户:重视数据本地存储(~/.ezcto/cache/),希望减少对云端 API 的依赖

常规使用风险

性能风险:首次访问大型页面(接近 500KB 截断阈值)或复杂 DOM 结构时,LLM 解析可能超时或生成不完整 JSON,需实现重试机制。

依赖项风险:依赖系统 curlsha256sum 命令可用,以及 ~/.ezcto/cache/ 目录可写权限。在受限环境(如某些容器化部署)中可能需要预配置。

数据新鲜度风险:缓存机制可能导致返回过期内容,尽管输出包含 cache_freshness 建议刷新时间,但实际刷新策略需 Agent 层自主实现。

API 速率限制:EZCTO API 在贡献数据时可能返回 429 状态码,Skill 内置 60 秒退避逻辑,但高频贡献场景下可能累积延迟。

引用文件完整性:运行时依赖多个 Markdown 参考文件(translate-prompt.md、output-schema.md、extensions/* 等),若部署时文件缺失将导致解析失败。

EZCTO Smart Web Reader 内容

examples文件夹
references文件夹
extensions文件夹
手动下载zip · 44.2 kB
openclaw-output-example.jsonapplication/json
请选择文件