Playwright Scraper Skill 1.2.0

🕷️ 智能反爬虫网页抓取专家

Playwright驱动的智能网页抓取工具,内置多级反爬虫策略,已通过香港讨论区等高防护站点实战验证。

收藏
7.7k
安装
1.6k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

本技能提供三层递进式网页抓取方案:

1. 常规站点 - 直接调用 OpenClaw 内置 web_fetch 工具,零依赖、极速响应
2. 动态渲染站点 - 使用 playwright-simple.js 脚本,等待 JavaScript 执行完成(3-5秒)

3. 高防护站点 - 启用 playwright-stealth.js ⭐核心方案,通过隐藏 navigator.webdriver、注入真实设备 UA、模拟人类行为延迟,成功穿透 Cloudflare 等反爬系统

显著优点

  • 实战验证可靠性:2026-02-07 实测数据显示,Discuss.com.hk(香港最大论坛)抓取成功率达 100%,而 Crawlee、Puppeteer 标准版、Chaser(Rust) 等方案均告失败
  • 策略矩阵清晰:按站点防护等级智能匹配工具,避免过度消耗资源
  • 高度可定制:支持环境变量控制截图路径、等待时长、可视化模式、自定义 UA 等
  • 输出格式丰富:除 JSON 结构化数据外,可生成截图与完整 HTML 用于调试

潜在局限

  • 速度代价:Stealth 模式需 5-20 秒,远高于简单请求的秒级响应
  • 依赖 Chromium:首次安装需下载浏览器内核(约 100MB+)
  • CAPTCHA 盲区:当前版本无法自动处理图形验证码,需依赖第三方服务(规划中)
  • 代理未内置:IP 轮换需手动配置,暂无原生代理池管理

适合人群

  • 需要抓取动态渲染内容的开发者
  • 遭遇 403/Cloudflare 拦截后寻求替代方案的数据工程师
  • 研究反爬对抗技术的安全从业者
  • 需批量获取 YouTube/Reddit 等平台内容的运营人员(需配合专用子技能)

常规风险

  • 法律合规:抓取行为需遵守目标站点 robots.txt 及服务条款
  • IP 封禁:高频请求可能触发防护策略,建议控制请求间隔
  • 数据隐私:截图与 HTML 本地存储可能包含敏感信息,需妥善管理
  • 版本漂移:站点反爬策略持续升级,需关注技能更新维护

Playwright Scraper Skill 1.2.0 内容

examples文件夹
scripts文件夹
手动下载zip · 19.3 kB
discuss-hk.shtext/x-shellscript
请选择文件