Scrapling Fetch

🕷️ 智能反爬网页抓取与付费 API

专业级网页抓取工具,自动绕过 Cloudflare、微信公众号等反爬机制,支持付费计费模式,成功率超95%。

收藏
3.2k
安装
1.1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Scrapling Fetch 是一款专为复杂反爬环境设计的网页抓取工具,提供两种运行模式:

免费模式:基于 Scrapling 引擎 + Jina Reader 双轨策略,自动检测网站类型并选择最优抓取方案。微信公众号、Medium、Substack 等反爬平台使用 StealthyFetcher 模拟真实浏览器;普通技术博客则调用 Jina Reader API(1.4秒极速响应)。

付费模式(SkillPay):通过 $0.01 USDT/次 的计费模型提供稳定服务,支持余额查询、自动扣费、充值链接生成等完整商业化能力。

命令行接口简洁直观:

# 微信公众号(自动反爬)
python3 fetch.py "https://mp.weixin.qq.com/s/xxxxx"

# 普通网页快速模式
python3 fetch.py "https://example.com" --fast

输出默认为结构化 JSON(标题、作者、Markdown 正文、字数统计),支持 --text 纯文本模式和 --max-chars 长度限制。

显著优点

1. 反爬绕过能力强:基于 Playwright 无头浏览器 + 自适应选择器,对 Cloudflare Turnstile、微信验证等主流反爬机制成功率>95%
2. 智能工具切换:内置决策表自动匹配最优抓取策略,无需用户手动判断

3. 输出质量高:自动提取正文、过滤广告、保留图片链接,直接输出干净 Markdown

4. 商业化成熟:完整的 SkillPay 计费体系,支持 BNB Chain USDT 支付,最低 8 USDT 起充

5. 场景覆盖广:从个人 AI 内容创作到团队批量研究,再到公开 API 服务均可支撑

潜在缺点与局限性

1. 平台限制:推特、微博等需登录态的内容无法抓取;付费墙内容仅能获得公开部分
2. 频率敏感:虽内置 2-3 秒间隔建议,但高频调用仍有被封 IP 风险

3. 成本累积:Jina Reader 免费限额 200 次/天,超额或反爬场景需依赖付费模式

4. 依赖外部链:SkillPay 充值、Jina API 可用性受第三方服务稳定性影响

适合人群

  • AI 内容创作者:需要稳定抓取公众号、Medium 文章作为 AI 输入源
  • 研究员/分析师:批量收集行业资料,构建本地知识库
  • 开发者/团队:希望将网页抓取能力封装为付费 API 对外服务
  • 现有方案受挫者:web_fetch 频繁 403/Cloudflare 拦截时的可靠备选

常规风险

  • 合规风险:抓取行为需遵守目标网站 Robots 协议及版权规定
  • 账号风险:微信等平台可能因异常流量触发账号限制
  • 资金风险:SkillPay 为加密货币支付,价格波动及链上转账不可逆
  • 隐私泄露:抓取内容可能包含敏感信息,需妥善存储处理

来源可信度评估

技能基于成熟开源项目 Scrapling(GitHub 可查)和 Jina Reader 官方 API,技术原理透明。但 SkillPay 计费模块为第三方商业服务,未提供独立审计报告,资金托管机制待验证。

Scrapling Fetch 内容

references文件夹
scripts文件夹
手动下载zip · 9.1 kB
antibot-sites.mdtext/markdown
请选择文件