Web Scraper Jina

🕷️ 穿透 Cloudflare 的免费网页抓取

利用免费 r.jina.ai API 绕过 Cloudflare 防护抓取网页,输出干净 Markdown,适用于 Truth Social 等高防护站点

收藏
11k
安装
3.7k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Web Scraper 通过调用 r.jina.ai 的免费 API,将目标 URL 前置于 https://r.jina.ai/ 即可获取网页内容。支持命令行 curl 或 Python requests 调用,返回结构化 Markdown 格式文本。

使用示例:

curl -s "https://r.jina.ai/https://truthsocial.com/@realDonaldTrump"
import requests
def scrape(url):
    return requests.get(f"https://r.jina.ai/{url}").text

显著优点

1. 绕过防护能力强:可穿透 Cloudflare Turnstile、5秒盾等常见反爬机制
2. 零成本使用:完全免费,无需注册 API 密钥

3. 输出格式友好:自动提取正文并转为 Markdown,省去 HTML 解析

4. 覆盖特殊站点:明确支持 Truth Social、Gab、Gettr 等受严格保护的社交平台

潜在缺点与局限性

  • 依赖第三方服务:r.jina.ai 的可用性与稳定性不受用户控制,存在服务中断风险
  • 速率限制未知:免费 API 通常存在隐形调用频率上限
  • 内容完整性:可能丢失 JavaScript 动态渲染内容、图片、视频等非文本元素
  • 隐私泄露风险:目标 URL 及内容流经第三方服务器,敏感信息可能外泄
  • 合规灰色地带:明确标注"bypass"用途,存在违反目标网站 ToS 及法律风险

适合人群

  • 开发者需快速提取受保护网站正文内容
  • 研究者进行公开社交媒体数据监测
  • 竞品分析需批量抓取新闻资讯
  • 不适合:企业级生产环境、敏感数据爬取、合规要求严格的场景

常规风险

| 风险类型 | 说明 |
|---------|------|
| 法律合规 | "Bypass"表述暗示可能违反 CFAA、DMCA 等法规及网站服务条款 |
| 隐私安全 | 目标 URL 及全部内容暴露给 jina.ai 服务端 |
| 服务依赖 | 单点故障,无 SLA 保障 |
| 内容准确性 | 动态加载内容可能缺失,返回结果非实时快照 |

Web Scraper Jina 内容

手动下载zip · 866 B
SKILL.mdtext/markdown
请选择文件