Scrapling - Stealth Web Scraper

🕸️ 智能反爬网页抓取框架

开源Python爬虫框架,内置Cloudflare绕过、浏览器指纹伪装和自适应元素追踪,支持HTTP/隐身/动态三种模式抓取现代网页。

收藏
5.8k
安装
2.3k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Scrapling 是一个专为对抗现代反爬机制设计的 Python 爬虫框架,提供三层抓取策略:

  • HTTP模式(默认):基于 curl_cffi 的高速请求,附带浏览器级 TLS 指纹伪装,适合常规站点
  • Stealth模式:基于 Patchright(Playwright 的隐身分支)的无头 Chromium,集成 Cloudflare Turnstile 绕过、指纹随机化、WebDriver 隐藏等反检测技术
  • Dynamic模式:完整 Playwright 浏览器实例,用于重度 JS 渲染的 SPA 单页应用

CLI 工具 scrape.py 封装了三种模式,支持 CSS/XPath 选择器提取、JSON 输出、静默模式。Python 内联用法支持自适应抓取(auto_save 持久化元素指纹)、会话 Cookie 管理、异步 API。

显著优点

  • 反爬对抗能力:Cloudflare 挑战自动绕过、浏览器指纹动态伪造、WebGL/Canvas 噪声注入,成功率显著高于传统 requests/scrapy
  • 多模式弹性:从极速 HTTP 到完整浏览器,按需降级,避免过度依赖重型浏览器
  • 自适应元素追踪find_similarauto_save 机制可应对 DOM 结构变化,降低维护成本
  • MCP 原生支持:内置 Model Context Protocol 服务器,便于 AI 工作流集成

潜在局限

  • 依赖体积scrapling[all] 约 200MB(含 Chromium),首次安装耗时
  • 法律与合规风险:隐身模式的能力边界模糊,易被滥用于绕过付费墙或 ToS 限制
  • Patchright 维护:作为 Playwright 的硬分叉,长期同步更新存在不确定性
  • MCP 暴露面:启动 MCP 服务器会开放本地 HTTP 端口,需可信环境

适合人群

  • 数据工程师、爬虫开发者需稳定抓取受 Cloudflare/DataDome 保护的站点
  • 研究人员需结构化提取动态渲染内容(价格监控、新闻聚合、学术数据)
  • AI Agent 开发者需通过 MCP 协议集成网页抓取能力

常规风险

  • 法律风险:未授权抓取可能违反 CFAA(美国)、GDPR(欧盟)或站点 ToS
  • IP/账号封禁:即使隐身模式,高频请求仍可能触发速率限制
  • 指纹关联auto_save 的本地状态文件若复用于多账号场景,可能导致行为关联
  • 供应链:Patchright 非官方 Playwright,安全更新延迟可能影响 Chromium 漏洞修复

Scrapling - Stealth Web Scraper 内容

references文件夹
scripts文件夹
手动下载zip · 4.2 kB
patterns.mdtext/markdown
请选择文件