Tavily Crawl

🕷️ 智能网站爬虫,一键存档离线文档

基于 Tavily API 的网站爬虫工具,可将多页面文档转为本地 Markdown,支持智能内容提取与过滤。

收藏
2.7k
安装
1.1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Tavily Crawl 是一款面向开发者与知识工作者的网站内容抓取工具,通过 Node.js 脚本调用 Tavily API,实现从单页面到全站的多层级爬取。核心功能包括:

1. 基础爬取:指定起始 URL,自动提取页面内容并转为 Markdown
2. 深度控制:支持 1-5 级深度爬取,配合 --breadth--limit 控制规模

3. 智能过滤:通过 --select/--exclude 正则表达式精确筛选目标路径

4. 语义提取:使用 --instructions + --chunks 实现基于自然语言指令的内容摘要,专为 LLM 上下文优化

5. 本地存储:通过 --output 将结果保存为结构化 Markdown 文件

显著优点

  • API 驱动:依托 Tavily 成熟的基础设施,无需自建爬虫环境
  • 双重模式:兼顾全页归档(数据收集)与智能摘要(Agent 上下文注入)
  • 灵活过滤:正则路径匹配有效聚焦文档/API 等特定区域
  • 可控成本:显式参数(depth/limit/breadth)防止无限爬取导致的资源浪费
  • 语义理解:内置自然语言指令支持,降低非结构化数据清洗成本

潜在局限

  • API 依赖:功能与稳定性完全绑定 Tavily 服务可用性
  • 付费门槛:需 Tavily API Key,超出免费额度后产生费用
  • Node.js 限定:需本地 Node 环境,对纯 Python/Go 生态用户不够友好
  • 深度权衡:Depth ≥3 时耗时显著增加(数百至数千页面),需配合 limit 谨慎使用
  • 正则门槛:路径过滤依赖用户编写正则表达式,对非技术用户有一定学习成本

适合人群

  • 开发者文档维护者:批量拉取开源项目文档建立离线知识库
  • AI Agent 构建者:为 RAG 系统快速注入结构化网页内容
  • 技术写作者:竞品文档分析、资料归档与本地化备份
  • 研究者:学术论文站点、Wiki 等知识库的全站抓取

常规风险

  • API Key 泄露:需妥善保管 TAVILY_API_KEY,避免硬编码提交至版本控制
  • 爬取失控:未设置 --limit 可能导致请求量激增,产生意外费用
  • 法律合规:需遵守目标网站的 robots.txt 及服务条款,避免高频爬取被封禁
  • 数据质量:动态渲染站点(SPA)的抓取效果取决于 Tavily 后端渲染能力
  • 上下文溢出:Agent 场景下若误用全页模式(未加 --chunks),易导致 LLM 上下文窗口超载

Tavily Crawl 内容

scripts文件夹
手动下载zip · 4.8 kB
crawl.mjstext/javascript
请选择文件