核心功能
MrScraper 是一款面向开发者和数据工程师的云端网页采集服务,通过自然语言描述即可发起智能数据提取任务。核心能力包括:
- AI 智能提取:使用
general(通用页面)、listing(列表页)、map(站点爬图)三种专用 Agent,自动理解页面结构并返回结构化数据 - 反检测采集:Unblocker 端点集成隐身浏览器、IP 轮换、地理路由(
geoCode),可绕过验证码和反爬机制 - 灵活执行模式:支持单次 AI 采集、配置复用重跑、批量 URL 重跑、手动工作流重跑四种方式
- 全量结果管理:分页查询历史结果、按 ID 获取详情,支持时间范围筛选
显著优点
- 零代码门槛:自然语言指令替代传统 XPath/CSS 选择器,降低采集脚本编写成本
- 高可用基础设施:云端执行无需本地浏览器依赖,自动处理代理轮换和请求重试
- 多场景适配:产品页、列表页、整站地图爬取均有专用 Agent,深度与广度可配置(
maxDepth、maxPages、limit) - 安全合规设计:API Token 采用 Header/Query 双模式认证,文档明确禁止客户端暴露密钥
潜在局限与风险
| 维度 | 说明 |
|------|------|
| **成本不可控** | AI Agent 按 token 计费,复杂页面或大批量采集可能产生高额费用;未找到单价透明度说明 |
| **结果稳定性** | LLM 解析存在幻觉风险,关键字段建议人工校验;`map` Agent 的爬取边界依赖正则配置,配置不当易超爬 |
| **平台锁定** | 数据留存于 MrScraper 云端(`dataPath`、`htmlPath`),导出机制依赖 API 拉取,长期归档需自建管道 |
| **速率限制** | `429` 错误需指数退避重试,高并发场景需自行实现队列控制 |
| **地理覆盖盲区** | 文档仅提及 `SG` 等 geoCode 示例,实际支持区域需联系支持确认 |
适用人群
- 需要快速获取竞品价格、商品详情、招聘列表等结构化数据的分析师与运营团队
- 缺乏专用爬虫基础设施、希望外包反爬对抗的技术团队
- 需要周期性监控网站变更的合规风控与舆情监测场景
常规安全建议
- 将
MRSCRAPER_API_TOKEN存放于服务端环境变量,禁止注入前端或日志输出 - 对
mapAgent 的includePatterns/excludePatterns做严格正则测试,避免爬取敏感路径或无限循环 - 采集个人数据前确认目标站点的 robots.txt 及法律条款,防范合规风险
- 关键业务数据建议双写本地存储,避免云端结果过期或账号异常导致数据丢失