Jina Reader

📖 智能网页内容提取与核实

通过 Jina AI 将网页内容转换为干净 Markdown,支持搜索和事实核查,无需暴露服务器 IP,免费额度 1000 万 token。

收藏
32.7k
安装
7.2k
版本
0.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

Jina Reader 是基于 Jina AI API 的网页内容提取工具,提供三种工作模式:

  • read(阅读):将任意 URL 转换为干净 Markdown,支持 CSS 选择器精准提取、元素移除、区域代理和动态渲染
  • search(搜索):执行网络搜索并返回前 5 条结果的完整内容,适合快速调研
  • ground(核实):基于搜索结果对声明进行事实核查

显著优点

1. IP 隐匿性:请求经 Jina 基础设施转发,保护用户服务器真实 IP
2. 内容净化:自动去除广告、导航等干扰元素,输出标准 Markdown

3. 动态渲染:内置 Headless Chrome 支持 JavaScript 密集型页面

4. 灵活配置:支持 CSS 选择器提取、元素过滤、多地区代理、格式切换(Markdown/HTML/文本/截图)

5. 成本友好:免费 tier 提供 1000 万 token,阅读模式约 $0.005/页

潜在局限

  • API 依赖:完全依赖 Jina AI 服务可用性与定价策略
  • 核实延迟:ground 模式约 300K token/请求,延迟约 30 秒
  • 隐私边界:虽隐藏 IP,但网页内容仍需经第三方服务器处理
  • 选择器门槛:精准提取需要 CSS 选择器知识

适合人群

  • 需要批量采集网页内容的开发者与数据分析师
  • 希望隐藏爬虫来源 IP 的安全敏感用户
  • 需要快速事实核查的研究者与内容创作者
  • 构建 RAG 系统需清洗网页输入的 AI 应用开发者

常规风险

  • API key 泄露风险(支持环境变量或文件存储,建议设置 600 权限)
  • 目标网站反爬策略可能导致提取失败
  • 免费额度耗尽后的成本累积
  • 第三方服务的数据处理合规性需自行评估

Jina Reader 内容

scripts文件夹
手动下载zip · 4.5 kB
reader.shtext/x-shellscript
请选择文件