jina-ai-reader

📄 一键提取任意网页纯净内容

免费抓取任意网页的纯净Markdown内容,自动绕过付费墙,支持Twitter/X和JS渲染页面,无需API密钥

收藏
4.3k
安装
1.7k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

Jina.ai Reader 综合评估

核心用法

Jina.ai Reader 是一个基于 Node.js 的网页内容提取工具,通过封装 Jina.ai 的 Reader API 服务,将任意 URL 转换为干净、AI 友好的 Markdown 格式。用户只需执行简单的命令行指令即可获取结构化内容,支持通过 --wait-ms 参数等待 JavaScript 渲染完成,可选 --with-images--with-links 提取图片说明和链接信息。

显著优点

1. 零成本门槛:完全免费,无需注册或 API 密钥即可使用
2. 反付费墙能力:实测可绕过 Every.to、Medium 等平台的付费内容限制

3. 社交媒体支持:罕见的原生支持 Twitter/X 帖子及线程抓取的工具

4. 动态页面适配:通过等待机制处理 SPA(单页应用)和重度依赖 JavaScript 的现代网站

5. 输出友好:返回标准 Markdown 格式,包含标题和元数据,便于下游 AI 处理

潜在局限

  • 速率限制:高频使用可能触发服务端的请求限制
  • 分页需手动:不支持自动翻页,多页内容需逐条获取
  • 依赖外部服务:实际内容由 Jina.ai 云端处理,存在服务可用性风险
  • Node.js 环境依赖:运行环境要求已安装 Node.js

适合人群

  • 需要批量提取网页内容供 AI 分析的开发者与研究人员
  • 处理付费墙内容的资讯聚合与内容存档场景
  • 社交媒体监听和数据收集工作流
  • 与现代搜索工具(如 Tavily、desearch)配合使用的自动化链路

常规风险

  • 大规模爬取可能违反目标网站的服务条款
  • 外部 API 的隐私政策适用于所抓取的内容
  • 依赖第三方服务的持续性,建议关键业务准备降级方案

jina-ai-reader 内容

scripts文件夹
手动下载zip · 2.0 kB
jina-reader.mjstext/javascript
请选择文件