核心用法
Firecrawl 技能通过 Maton 平台提供对 Firecrawl API 的完整访问能力,支持六大核心操作模式:
1. 单页提取(Scrape) — 提取单个网页内容,支持 markdown、HTML、JSON、截图、链接等多种输出格式,可选主内容提取、广告屏蔽、移动端模拟等
2. 全站爬取(Crawl) — 深度爬取网站,支持深度限制、路径过滤、子域名控制,返回异步作业 ID 供轮询状态
3. 站点地图(Map) — 快速获取网站全部 URL 结构而不抓取内容,支持语义搜索排序
4. 网页搜索(Search) — 集成搜索引擎,返回结果附带完整页面内容提取
5. 批量处理(Batch) — 并行处理多个 URL 的高效批量抓取
6. AI 提取(Extract/Agent) — 基于自然语言指令或 JSON Schema 的智能结构化数据提取,支持自主导航的 AI Agent
所有请求通过 https://api.maton.ai/firecrawl/{path} 代理转发,自动注入 API 密钥,统一使用 Authorization: Bearer $MATON_API_KEY 认证。
显著优点
- 统一认证管理:Maton 平台集中处理 Firecrawl API 密钥,无需直接暴露第三方凭证
- 多格式输出:原生支持 markdown 等 LLM 友好格式,大幅降低内容处理成本
- 浏览器自动化:支持点击、输入、滚动、执行 JavaScript 等预操作,可处理动态渲染页面
- 智能提取能力:AI Extract 和 Agent 功能支持零代码模式下的复杂数据提取
- 实时浏览器会话:CDP 协议支持实时交互式浏览器控制
- 连接管理:支持多 Firecrawl 账户切换,通过
Maton-Connection头指定
潜在缺点与局限性
- 信用消耗敏感:所有操作均消耗 Firecrawl 信用额度,大规模爬取成本较高(增强代理最高 5 信用/页)
- 结果有效期短:爬取结果 24 小时后过期,需及时消费
- 异步操作复杂度:Crawl、Batch、Extract、Agent 等均为异步作业,需轮询状态或配置 webhook
- 网络依赖严格:必须可访问 Maton 和 Firecrawl 服务,代理环境可能受限
- 浏览器动作风险:自定义 headers 和 actions 参数可能触发网站反爬机制或产生非预期交互
- 超时限制:最大 5 分钟,超大页面或复杂 JS 场景可能失败
适合人群
- 数据工程师/分析师:需要结构化提取竞品信息、文档站点内容的场景
- AI 应用开发者:为 RAG 系统、知识库构建提供高质量网页内容源
- 研究人员:需要批量采集学术资源、政策文件的学术工作者
- 市场情报团队:监控竞品动态、价格信息的商业分析场景
- 自动化工作流构建者:结合 n8n、Make 等工具搭建无代码数据管道
常规风险
| 风险类型 | 说明 |
|---------|------|
| 成本控制风险 | 未设置 `limit` 的大规模爬取可能导致信用额度快速耗尽(402 错误) |
| 合规风险 | 抓取受保护内容可能违反目标网站 ToS 或 robots.txt |
| 数据残留风险 | 爬取结果存储于 Firecrawl 云端 24 小时,含敏感信息的任务需注意 |
| 操作误用风险 | `actions` 中的点击、JS 执行可能触发订单提交、表单发送等不可逆操作 |
| 账户安全风险 | `MATON_API_KEY` 泄露可能导致 Firecrawl 信用被盗用 |