核心用法
firecrawl-scrape-cn 是一款基于 Firecrawl CLI 的网页抓取技能,专为大语言模型(LLM)优化内容提取而设计。用户只需提供目标 URL,即可获取干净、结构化的 Markdown 内容,无需处理复杂的 HTML 解析。
主要功能:
- JS 渲染支持:可抓取单页应用(SPA),支持
--wait-for参数等待 JavaScript 执行完成 - 多 URL 并发:支持同时抓取多个页面,自动保存到
.firecrawl/目录 - 智能内容过滤:
--only-main-content选项自动去除导航栏、页脚、侧边栏等干扰元素 - 灵活输出格式:支持 Markdown、HTML、原始 HTML、链接列表、截图、JSON 等多种格式
- 内容问答:
--query参数允许直接对页面内容提问(消耗额外积分)
显著优点:
1. LLM 原生优化:输出 Markdown 格式干净,减少 token 消耗,提升模型理解效果
2. 零配置开箱即用:无需编写爬虫代码,命令行一键抓取
3. 工作流集成:作为 ClawHub 技能生态的一环,可与搜索、浏览器交互、批量下载等技能衔接
4. 中文本地化:完整中文文档,降低使用门槛
潜在缺点与局限性:
1. 外部依赖依赖:本身不包含可执行代码,完全依赖用户环境已安装的 Firecrawl CLI,若未安装则需通过 npx 临时拉取
2. npx 供应链风险:使用 npx firecrawl 可能执行未固定版本的远程包,存在供应链攻击面
3. T3 来源可信度:由个人开发者维护,非知名组织背书,更新审查需谨慎
4. 功能边界明确:无法处理需要复杂交互(点击、表单填写、分页)的页面,此类场景需升级至 interact 技能
适合人群:
- 需要快速提取网页内容供 AI 分析的研究者、分析师
- 构建知识库、RAG 系统的开发者
- 处理批量网页数据的内容运营人员
- 希望避免编写爬虫代码的技术用户
常规风险:
- 抓取含敏感信息的私有/认证页面可能导致数据泄露
- 高频抓取可能触发目标站点的反爬机制
- 外部 CLI 版本不固定可能引入未预期的行为变更