核心功能
Jina AI Skill 提供三合一的 Web 处理能力:
1. Reader API (`r.jina.ai`):将任意 URL 转换为干净的 LLM 友好型 Markdown,支持网页、PDF 和 JS 密集型站点。提供 CSS 选择器提取、图片/链接控制、截图生成、VLM 处理等高级功能。
2. Search API (`s.jina.ai`):执行网络搜索并返回完整页面内容,支持站点限定、新闻搜索、文件类型过滤等参数,结果自带 Reader 处理过的干净文本。
3. DeepSearch:多步骤研究代理,结合搜索、阅读和推理能力,通过 OpenAI 兼容的 Chat Completions API 处理复杂研究问题。
显著优点
- 输出质量高:专为 LLM 设计的干净 Markdown,自动去除广告、导航等干扰元素
- JS 站点支持:优于传统
web_fetch,能处理 React/Vue 等动态渲染页面 - 格式灵活:支持纯文本、JSON、HTML、截图等多种输出格式
- 参数丰富:20+ 个控制参数,精细调控内容提取行为
- PDF 原生支持:直接解析 URL 指向的 PDF 文档
- DeepSearch 集成:一站式解决复杂多源研究需求
- 免费额度:20 RPM 免费 tier,适合轻量使用
潜在局限
- 第三方依赖:所有请求发送至 Jina AI 服务器,存在数据外泄风险
- API 密钥必需:超出免费额度需付费,且必须配置
JINA_API_KEY - 隐私顾虑:URL 和查询内容被传输至第三方,敏感信息需谨慎
- Cookie 限制:默认不转发 Cookie,认证内容需显式配置
- 无本地缓存:每次请求均需网络往返
适合人群
- 需要为 LLM 提供干净网络内容的开发者
- 构建 RAG 系统的工程师(网页内容注入)
- 研究人员、分析师、内容策展人
- 需处理 JS 密集型站点的自动化工作流
常规风险
| 风险类型 | 等级 | 说明 |
|---------|------|------|
| 数据外泄 | 中 | URL/查询发送至第三方服务器 |
| API 密钥泄露 | 中 | 需妥善保管 `JINA_API_KEY` |
| 内容准确性 | 低 | 依赖 Jina 的提取算法,极端情况可能遗漏 |
| 服务可用性 | 低 | 依赖 Jina AI 服务稳定性 |
| 速率限制 | 低 | 免费版 20 RPM,高并发需付费 |