核心用法
MrScraper 提供两套 API 服务:Unblocker API 用于穿透反爬防护获取原始 HTML,Platform API 用于 AI 智能提取与任务管理。用户通过 MRSCRAPER_API_TOKEN 认证后,可用自然语言描述数据需求(如"提取商品标题、价格和评分"),系统自动解析页面结构并返回 JSON 格式结果。
主要工作模式包括:
- AI Scraper:三种专用 Agent(
general通用页面、listing列表页、map全站爬取)应对不同场景 - Rerun:复用已保存的配置对新 URL 执行批量抓取
- Manual Workflow:通过可视化编辑器预设点击、输入、滚动等交互步骤,适用于复杂动态页面
- Unblocker:独立端点绕过验证码和 IP 封锁,返回完整页面源码
显著优点
| 维度 | 表现 |
|------|------|
| **反检测能力** | 内置 stealth browser + IP rotation,有效应对 Cloudflare、DataDome 等防护 |
| **使用门槛** | 纯 API 调用,无需本地安装浏览器或维护爬虫框架 |
| **智能解析** | 自然语言指令替代 CSS/XPath 编写,降低技术门槛 |
| **灵活调度** | 支持地理定位(`geoCode`/`proxyCountry`)、资源拦截(`blockResources`)、深度爬取控制 |
| **可复现性** | 配置可保存复用,支持单 URL 重跑与批量 URL 并发 |
潜在缺点与局限性
1. 成本不透明:文档未明确说明按次计费、Token 消耗或并发限制,实际成本难以预估
2. 异步结果获取:AI Scraper 创建后需轮询状态或额外调用 /results 端点获取数据,非同步返回
3. 地图模式约束:map Agent 的 maxDepth 建议不超过 3,深层爬取可能触发目标站封禁或成本激增
4. 数据保留期未声明:提取结果的存储周期、导出格式限制未在文档中体现
5. 黑箱提取:AI 解析逻辑不可见,复杂页面可能出现字段识别偏差且难以调试
适合人群
- 数据采集需求方:市场情报、竞品价格监控、舆情分析等非技术背景业务人员
- 快速原型开发者:需绕过反爬、不愿维护 Playwright/Selenium 基础设施的工程团队
- 规模化运营:电商、旅游、招聘等需批量抓取列表页或全站数据的场景
常规风险
| 风险类型 | 具体表现 | 缓解建议 |
|----------|----------|----------|
| **合规风险** | 抓取受 ToS 限制的数据(如个人用户信息)可能触发法律争议 | 严格审查目标站 robots.txt 及用户协议,避免敏感数据 |
| **账号封禁** | 高频调用或突破 `maxPages` 限制可能导致 API 密钥被暂停 | 启用指数退避重试,监控 429 响应,分散请求时段 |
| **数据泄露** | Token 硬编码或日志泄露导致未授权访问 | 使用环境变量注入,禁止客户端暴露密钥,定期轮换 Token |
| **结果可靠性** | AI 解析错误导致字段缺失或格式异常 | 对关键业务数据启用 schema 校验,保留原始 HTML 备查 |
| **供应商锁定** | 提取逻辑存储于平台,迁移需重新配置 | 定期导出 scraper 配置 JSON,建立本地备份机制 |
综合评价
MrScraper 在"反爬对抗 + 低代码"维度表现突出,适合需要快速上线、不愿投入 infra 成本的团队。但对于数据精度要求高、需深层溯源或成本敏感的场景,建议与传统爬虫方案做 A/B 验证,并建立结果质量监控体系。