Clawpod

✨ 智能绕过反爬,一键提取纯净网页内容

专业级网页抓取服务,绕过反爬虫、CAPTCHA和付费墙,自动渲染JS并返回结构化Markdown,适用于数据提取与内容聚合场景。

收藏
10k
安装
2.2k
版本
0.1.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

clawpod(Massive Unblocker)是一款面向复杂网络环境的智能网页抓取工具,通过单一REST API端点解决传统HTTP请求被拦截的痛点。其核心能力包括:

  • 全场景反爬虫对抗:内置浏览器引擎自动处理JavaScript渲染、CAPTCHA验证、地理限制及付费墙检测
  • 智能内容提取:原始HTML经node-html-markdown转换为干净Markdown,保留标题层级、链接、列表、表格和代码块结构
  • 弹性请求策略:单请求最长2分钟超时,支持自动重试和验证码破解,确保高成功率

使用方式

采用标准curl调用模式,需配置MASSIVE_UNBLOCKER_TOKEN环境变量:

curl -s -G --data-urlencode "url=TARGET_URL" \
  -H "Authorization: Bearer $MASSIVE_UNBLOCKER_TOKEN" \
  "https://unblocker.joinmassive.com/browser"

支持5个精细调控参数:format(渲染/原始模式切换)、expiration(缓存控制)、delay(动态内容等待)、device(设备模拟)、ip(住宅/ISP IP选择)。

显著优势

1. 零基础设施负担:无需自建浏览器集群或代理池,Massive平台托管全部计算资源
2. 开发者友好:纯bash+node工具链,无复杂SDK依赖,输出格式直接适配LLM处理流程

3. 合规性设计:通过waitlist机制控制API访问,避免公开滥用导致的法律风险

局限性与风险

| 维度 | 说明 |
|------|------|
| 成本不透明 | 未公开定价模型,waitlist机制暗示可能的付费层级或配额限制 |
| 单点依赖 | 服务可用性完全依赖Massive平台,无开源替代方案 |
| 延迟成本 | 单页2分钟上限设计虽提升成功率,但大规模抓取吞吐量受限 |
| 法律边界 | "unblocker"命名暗示突破付费墙能力,实际使用需评估目标网站ToS合规性 |

适用人群

  • 数据分析师:需要抓取反爬保护的公开数据集
  • AI训练工程师:构建需要实时网页内容的RAG/Agent系统
  • 新闻聚合开发者:绕过付费墙获取文章内容(需法律评估)

安全风险等级:S

该工具本身无本地代码执行风险,但输出内容的可信度使用的合规性需用户自行把控。token泄露可能导致API配额被盗用。

Clawpod 内容

手动下载zip · 3.8 kB
README.mdtext/markdown
请选择文件