FlowCrawl — Stealth Web Scraper That Bypasses Everything

🦞 隐形爬虫·三层穿透·零配置反检测

智能网页爬虫,三层自动降级对抗反爬,零配置绕过Cloudflare,免费开源。

收藏
4.6k
安装
1.1k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

FlowCrawl 是一款零配置的隐蔽式网页爬取工具,采用三层级联抓取策略自动应对各类反爬虫机制。用户仅需提供目标 URL,无需 API 密钥、代理服务器或 Chrome 浏览器,即可获取干净的 Markdown 或 JSON 格式内容。

基础命令

  • 单页抓取:flowcrawl https://example.com
  • 全站爬取:flowcrawl https://example.com --deep
  • 结构化输出:flowcrawl https://example.com --json

显著优点

1. 零依赖部署:仅依赖 scrapling 及其自动安装的 Playwright,无需额外配置
2. 智能级联策略:从纯 HTTP → TLS 指纹伪造 → 完整 JS 渲染,自动检测拦截并静默升级

3. 广泛兼容性:针对 Cloudflare、Imperva 等主流 WAF 及单页应用(SPA)优化

4. 多格式输出:原生支持 Markdown、纯文本、结构化 JSON

5. 深度爬取能力:内置站点爬虫,支持深度限制、页面数量限制与结果合并

潜在局限

  • 依赖 Playwright 首次运行自动安装,可能增加初始启动时间
  • 深度爬取模式下无内置去重机制说明,大规模站点可能产生冗余
  • 未明确声明速率限制控制,高频请求仍存在 IP 封禁风险
  • 作为命令行工具,无图形界面或 API 服务模式

适合人群

  • 需要快速获取网页内容的开发者与数据分析师
  • 绕过基础反爬机制进行合法数据采集的研究人员
  • 构建知识库、RAG 系统的 AI 应用开发者
  • 不愿维护代理池和浏览器集群的技术团队

常规风险

  • 合规风险:自动绕过反爬机制可能违反目标网站 ToS
  • 法律边界:需确保爬取行为符合《网络安全法》及 robots.txt 规范
  • 责任归属:Flow 团队免责声明明确,用户需自行承担使用后果
  • 数据安全:输出文件默认保存在本地目录,敏感内容需额外加密处理

FlowCrawl — Stealth Web Scraper That Bypasses Everything 内容

scripts文件夹
手动下载zip · 9.5 kB
flowcrawl.pytext/plain
请选择文件