Decodo Scraper

🕸️ 官方 API 驱动的智能网页采集

Decodo 官方 Web 爬虫 API 技能,支持 Google 搜索与任意网页抓取,输出结构化 JSON 或 Markdown,需配置 Basic Auth Token。

收藏
8.3k
安装
2.3k
版本
0.1.0
CLS 安全性认证2026-08-10
点击查看完整报告 >

使用说明

核心用法

Decodo Scraper 是一款基于 Decodo 官方 Web Scraping API 的 OpenClaw 技能,提供两大核心功能:

1. Google 搜索:通过 --target google_search 调用,支持 --query 参数输入搜索关键词,可选 --geo--locale 指定地理位置与语言,输出为结构化 JSON 数组,包含自然搜索结果、AI 概述、相关问题等。

2. 网页抓取:通过 --target universal 调用,使用 --url 参数指定目标网页,API 默认返回 Markdown 格式内容,便于 LLM 处理且降低 Token 消耗。

认证方式为 Basic Auth,需从 Decodo Dashboard → Scraping APIs 获取 DECODO_AUTH_TOKEN 并配置为环境变量或写入 .env 文件。

显著优点

  • 官方背书:直接调用 Decodo 官方 API,稳定性与数据质量有保障
  • 双模输出:搜索返回结构化 JSON,抓取返回干净 Markdown,适配不同场景
  • 地理/语言支持:可模拟不同地区搜索结果,满足本地化需求
  • LLM 友好:Markdown 输出减少噪声,降低后续处理成本
  • 错误规范:失败时向 stderr 输出 JSON 错误信息并返回退出码 1,便于程序集成

潜在缺点与局限性

  • 付费依赖:Decodo 为商业服务,需订阅套餐,存在用量成本
  • Token 管理:需手动获取并保管 API Token,增加配置复杂度
  • 功能边界:仅支持 Google 搜索与通用网页抓取,不支持其他搜索引擎或复杂交互页面
  • 网络依赖:完全依赖 Decodo 服务端,本地无缓存或离线能力
  • 错误透明度:文档未详述速率限制、IP 封禁等具体错误码处理

适合人群

  • 需要程序化获取 Google 搜索结果的开发者与数据分析师
  • 构建 RAG/知识库系统、需要批量抓取网页内容的 AI 应用开发者
  • 希望避免自建代理池、专注于业务逻辑的工程团队
  • 对数据清洗有需求、偏好 Markdown 而非原始 HTML 的内容处理者

常规风险

  • 凭证泄露DECODO_AUTH_TOKEN 若不慎提交至版本控制,可能导致账户被盗用或额度耗尽
  • 合规风险:大规模抓取需遵守目标网站的 robots.txt 及服务条款,避免法律纠纷
  • 成本失控:未设置用量上限可能导致 API 调用费用超预期
  • 数据时效性:搜索/抓取结果存在缓存延迟,非实时数据

安全解读

核心用法

Decodo Scraper 是一款专注于网页数据获取的 OpenClaw Skill,提供两大核心功能:Google 搜索与网页内容抓取。用户通过简单的命令行接口,即可调用 Decodo 商业级 Web Scraping API 完成复杂的数据采集任务。

Google 搜索功能支持结构化检索,返回包含自然搜索结果、AI 概览、相关问题等在内的 JSON 格式数据,并可通过 --geo--locale 参数实现地理位置与语言的精确定位。网页抓取功能则能将任意 URL 转换为干净的 Markdown 格式,显著降低 LLM 处理的 token 消耗,提升后续分析效率。

使用流程简洁明了:在 Decodo Dashboard 获取 Basic Auth Token 后,配置 DECODO_AUTH_TOKEN 环境变量即可启用全部功能。

显著优点

该 Skill 的核心优势在于专业化与易用性的平衡。相较于自建爬虫方案,Decodo 提供了成熟的反爬虫规避、IP 轮换和请求管理基础设施,用户无需处理验证码、速率限制等复杂问题。输出格式专为 LLM 场景优化,Markdown 格式比原始 HTML 减少 60% 以上的冗余内容,大幅提升 Agent 处理效率。

代码质量方面,96 行的精简实现展现了良好的工程素养:无危险函数、无硬编码密钥、依赖均为成熟开源库(requests、python-dotenv)。环境变量管理机制符合安全最佳实践,支持 .env 文件与系统环境变量双重配置方式。

潜在缺点与局限性

首要限制在于服务依赖锁定。Skill 完全依赖 Decodo 商业 API,一旦服务中断、API 变更或账户额度耗尽,功能即刻失效。这与本地爬虫方案相比,存在显著的单点故障风险。

其次,成本与隐私权衡不可忽视。虽然 Skill 本身开源免费,但 Decodo API 为按量计费服务,高频使用可能产生可观费用。更重要的是,所有搜索查询和目标 URL 均需经过第三方服务器,不适合处理敏感或机密信息。

功能层面,当前版本仅支持 Google 搜索与通用网页抓取,缺乏对 JavaScript 动态渲染页面的深度处理能力,复杂单页应用(SPA)的内容提取可能存在局限。

适合的目标群体

  • 数据分析师与研究员:需要快速获取结构化网络数据,用于市场研究、竞品分析或学术调研
  • AI 应用开发者:构建需要实时网络信息增强的 RAG 系统或智能问答 Agent
  • 内容运营团队:批量监控品牌舆情、追踪热点话题或采集公开内容资源
  • 自动化工作流设计者:将网络数据获取集成到 n8n、Make 等自动化平台的企业用户

使用风险与注意事项

网络传输风险:虽然采用 TLS 1.2+ 加密,但数据需流经 Decodo 服务器,建议严格遵循"敏感信息不上云"原则。成本失控风险:API 按请求计费,缺乏使用上限设置可能导致账单激增,建议启用 Decodo Dashboard 的消费预警。合规边界风险:网页抓取需遵守目标网站的 robots.txt 及服务条款,禁止用于非公开数据、版权内容的大规模爬取。

Decodo Scraper 内容

tools文件夹
手动下载zip · 4.2 kB
scrape.pytext/plain
请选择文件