核心用法
FlowCrawl 是一款基于 Scrapling 的隐形网页爬虫工具,采用三级级联抓取策略(Plain HTTP → TLS 指纹伪装 → 完整 JS 执行),自动检测并绕过 Cloudflare、Imperva 等主流反爬机制。用户只需提供目标 URL,无需配置代理、API 密钥或 Chrome DevTools Protocol。
主要功能:
- 单页快速抓取:输出干净 Markdown 或 JSON
- 全站蜘蛛模式:
--deep自动追踪内链,支持深度/数量限制 - 智能降级:遇 403/503/"Just a moment..." 自动升级对抗策略
- 零依赖管理:Scrapling 自动安装 Playwright,开箱即用
显著优点
1. 反爬穿透力强:三级级联 + TLS 指纹伪装,实测可绕过多数商业 WAF
2. 使用极简:单条命令运行,支持 shell 别名快速调用
3. 输出友好:原生 Markdown 格式,便于接入 RAG/LLM 工作流
4. 成本控制:完全本地执行,无按量计费 API
潜在局限
- 法律合规风险:未内置 robots.txt 遵守机制,需用户自行判断爬取合法性
- 资源占用:第三级 JS 执行依赖 Playwright,内存占用较高
- 动态内容极限:极端复杂的 SPA(如重度混淆 React)可能仍需人工干预
- 维护依赖:Scrapling/Playwright 版本更新可能导致兼容性问题
适合人群
数据分析师、AI 训练数据收集者、安全研究员、需要快速构建知识库的技术团队。
常规风险
- IP 封禁:高频爬取仍可能触发目标站点封禁
- 法律纠纷:抓取受版权保护或 ToS 禁止的内容存在诉讼风险
- 恶意代码:JS 执行环境可能暴露于目标页面的恶意脚本(Playwright 沙箱提供基础隔离)