FlowCrawl — Stealth Web Scraper That Bypasses Everything

🦞 穿透反爬的隐形网页爬虫

三级级联爬虫,自动穿透 Cloudflare 与 WAF 防护,无需代理/API 密钥,支持全站蜘蛛与 Markdown 提取。

收藏
3.1k
安装
1.1k
版本
1.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

FlowCrawl 是一款基于 Scrapling 的隐形网页爬虫工具,采用三级级联抓取策略(Plain HTTP → TLS 指纹伪装 → 完整 JS 执行),自动检测并绕过 Cloudflare、Imperva 等主流反爬机制。用户只需提供目标 URL,无需配置代理、API 密钥或 Chrome DevTools Protocol。

主要功能:

  • 单页快速抓取:输出干净 Markdown 或 JSON
  • 全站蜘蛛模式:--deep 自动追踪内链,支持深度/数量限制
  • 智能降级:遇 403/503/"Just a moment..." 自动升级对抗策略
  • 零依赖管理:Scrapling 自动安装 Playwright,开箱即用

显著优点

1. 反爬穿透力强:三级级联 + TLS 指纹伪装,实测可绕过多数商业 WAF
2. 使用极简:单条命令运行,支持 shell 别名快速调用

3. 输出友好:原生 Markdown 格式,便于接入 RAG/LLM 工作流

4. 成本控制:完全本地执行,无按量计费 API

潜在局限

  • 法律合规风险:未内置 robots.txt 遵守机制,需用户自行判断爬取合法性
  • 资源占用:第三级 JS 执行依赖 Playwright,内存占用较高
  • 动态内容极限:极端复杂的 SPA(如重度混淆 React)可能仍需人工干预
  • 维护依赖:Scrapling/Playwright 版本更新可能导致兼容性问题

适合人群

数据分析师、AI 训练数据收集者、安全研究员、需要快速构建知识库的技术团队。

常规风险

  • IP 封禁:高频爬取仍可能触发目标站点封禁
  • 法律纠纷:抓取受版权保护或 ToS 禁止的内容存在诉讼风险
  • 恶意代码:JS 执行环境可能暴露于目标页面的恶意脚本(Playwright 沙箱提供基础隔离)

FlowCrawl — Stealth Web Scraper That Bypasses Everything 内容

scripts文件夹
手动下载zip · 10.9 kB
flowcrawl.pytext/plain
请选择文件