核心用法
Scrapling Fetch 是一款专为复杂反爬环境设计的网页抓取工具,提供两种运行模式:
免费模式:基于 Scrapling 引擎 + Jina Reader 双轨策略,自动检测网站类型并选择最优抓取方案。微信公众号、Medium、Substack 等反爬平台使用 StealthyFetcher 模拟真实浏览器;普通技术博客则调用 Jina Reader API(1.4秒极速响应)。
付费模式(SkillPay):通过 $0.01 USDT/次 的计费模型提供稳定服务,支持余额查询、自动扣费、充值链接生成等完整商业化能力。
命令行接口简洁直观:
# 微信公众号(自动反爬) python3 fetch.py "https://mp.weixin.qq.com/s/xxxxx" # 普通网页快速模式 python3 fetch.py "https://example.com" --fast
输出默认为结构化 JSON(标题、作者、Markdown 正文、字数统计),支持 --text 纯文本模式和 --max-chars 长度限制。
显著优点
1. 反爬绕过能力强:基于 Playwright 无头浏览器 + 自适应选择器,对 Cloudflare Turnstile、微信验证等主流反爬机制成功率>95%
2. 智能工具切换:内置决策表自动匹配最优抓取策略,无需用户手动判断
3. 输出质量高:自动提取正文、过滤广告、保留图片链接,直接输出干净 Markdown
4. 商业化成熟:完整的 SkillPay 计费体系,支持 BNB Chain USDT 支付,最低 8 USDT 起充
5. 场景覆盖广:从个人 AI 内容创作到团队批量研究,再到公开 API 服务均可支撑
潜在缺点与局限性
1. 平台限制:推特、微博等需登录态的内容无法抓取;付费墙内容仅能获得公开部分
2. 频率敏感:虽内置 2-3 秒间隔建议,但高频调用仍有被封 IP 风险
3. 成本累积:Jina Reader 免费限额 200 次/天,超额或反爬场景需依赖付费模式
4. 依赖外部链:SkillPay 充值、Jina API 可用性受第三方服务稳定性影响
适合人群
- AI 内容创作者:需要稳定抓取公众号、Medium 文章作为 AI 输入源
- 研究员/分析师:批量收集行业资料,构建本地知识库
- 开发者/团队:希望将网页抓取能力封装为付费 API 对外服务
- 现有方案受挫者:web_fetch 频繁 403/Cloudflare 拦截时的可靠备选
常规风险
- 合规风险:抓取行为需遵守目标网站 Robots 协议及版权规定
- 账号风险:微信等平台可能因异常流量触发账号限制
- 资金风险:SkillPay 为加密货币支付,价格波动及链上转账不可逆
- 隐私泄露:抓取内容可能包含敏感信息,需妥善存储处理
来源可信度评估
技能基于成熟开源项目 Scrapling(GitHub 可查)和 Jina Reader 官方 API,技术原理透明。但 SkillPay 计费模块为第三方商业服务,未提供独立审计报告,资金托管机制待验证。