核心用法
web-fetch-markdown 技能利用 jina.ai 的代理服务(https://r.jina.ai/<URL>)抓取任意公开网页,自动提取正文并转换为精简的 Markdown 格式。用户只需提供目标 URL,系统会自动拼接 jina.ai 前缀并调用 web_fetch 工具获取处理后的内容。
典型场景:
- 抓取技术文档、博客长文、GitHub README 等高密度内容
- 在上下文长度受限时将网页内容压缩后再进行分析
- 需要快速获取网页结构化文本而非原始 HTML
显著优点
- Token 高效:jina.ai 会自动过滤广告、导航栏等噪音,仅保留核心内容,通常可减少 50%-80% 的 Token 消耗
- 格式统一:输出标准 Markdown,便于下游 LLM 处理或人工阅读
- 零配置:无需 API Key,直接拼接 URL 即可使用
- 兼容性强:支持绝大多数公开网页,对 GitHub、Medium、技术文档站点效果尤佳
潜在缺点与局限性
- 依赖第三方服务:jina.ai 为外部免费服务,存在速率限制、服务中断或策略变更风险
- 动态内容受限:无法渲染 JavaScript 生成的内容(如 SPA 应用、动态加载的评论区)
- 格式损失:部分复杂排版(表格、代码块嵌套、数学公式)可能出现解析偏差
- 隐私顾虑:请求需经过 jina.ai 服务器,敏感或内部 URL 不适合使用
适合人群
- 需要频繁引用外部网页内容的开发者、研究员、内容创作者
- 在 Token 预算紧张场景下工作的 LLM 应用用户
- 希望快速提取文章要点而无需完整浏览网页的阅读者
常规风险
- 服务可用性:jina.ai 作为免费服务,不承诺 SLA,高峰期可能出现 429 限流
- 内容准确性:自动提取可能遗漏关键信息或误删上下文,关键场景建议二次核对原文
- 链式依赖:若
web_fetch工具本身受限,本技能将级联失效 - 版权合规:抓取内容仍需遵守原网站的版权及使用条款