核心功能
Firecrawl CLI 是一款面向 AI 工作流优化的网页抓取与浏览器自动化工具,核心能力覆盖四大场景:
1. 单页/批量抓取(scrape):将任意 URL 转为结构化的 Markdown 或 HTML,支持 --only-main-content 自动过滤导航栏/页脚,输出干净正文;多格式输出(markdown, links, screenshot)自动打包为 JSON。
2. 整站异步爬取(crawl):递归抓取全站内容,支持深度限制(--max-depth)、并发配额(--limit)及异步任务模式(返回 job ID,可轮询或 --wait 阻塞等待),适合构建文档站点知识库。
3. 网站 URL 发现(map):无需实际下载内容,快速获取站点全部可访问 URL 列表,用于 SEO 审计或爬虫种子采集。
4. 云端浏览器自动化(browser):提供隔离的沙盒浏览器会话,支持 40+ 种 bash 风格命令(open, click, scroll, type, scrape 等),AI Agent 可通过自然语言操控网页,无需本地安装浏览器。
5. AI Agent 自然语言查询(agent):直接以自然语言下达任务(如"找出 AI 领域融资最高的 5 家初创公司"),内置 spark-1-mini(成本较 Pro 版低 60%)自动规划浏览路径并返回结构化结果。
显著优点
- AI 原生设计:输出 Markdown 直接适配 RAG/LLM 输入,避免传统爬虫的 HTML 清洗成本
- 零浏览器环境依赖:云端浏览器自动化解决无头浏览器本地配置痛点
- 异步架构:整站爬取采用 job 队列模式,支持大规模任务的并发管理与状态轮询
- 成本可控:Agent 模式提供轻量模型选项,搜索+抓取一体化降低 API 调用链复杂度
局限与风险
- 依赖外部服务:所有功能需 Firecrawl 云端 API 支持,存在服务可用性与网络延迟风险;自托管需额外部署
--api-url - 成本累积:按 credits 计费,高频爬取或浏览器长会话可能产生意外消耗
- 内容边界:受目标网站反爬策略、robots.txt 及法律合规约束,大规模爬取需自行评估合法性
- 认证要求:必须配置
FIRECRAWL_API_KEY或执行firecrawl login,密钥泄露将导致账户 credits 被盗刷
适合人群
- AI 应用开发者:构建基于实时网页数据的 RAG、知识库或 Agent 工作流
- 自动化工程师:需云端浏览器执行网页测试、数据抓取任务
- 技术研究人员:快速采集特定领域站点内容用于分析
安全建议
- 将 API Key 配置为环境变量而非命令行参数,避免 shell history 泄露
- 生产环境优先使用自托管实例(
--api-url)降低数据出境风险 - 执行
firecrawl --status监控 credits 与并发配额,防止资源耗尽