MrScraper

🕸️ AI驱动的无阻塞数据采集引擎

AI驱动的无阻塞网页数据采集工具,支持自然语言指令提取结构化数据,内置隐身浏览器与IP轮换绕过反爬机制

收藏
6.3k
安装
1.4k
版本
1.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

MrScraper 是一款面向开发者和数据工程师的云端网页采集服务,通过自然语言描述即可发起智能数据提取任务。核心能力包括:

  • AI 智能提取:使用 general(通用页面)、listing(列表页)、map(站点爬图)三种专用 Agent,自动理解页面结构并返回结构化数据
  • 反检测采集:Unblocker 端点集成隐身浏览器、IP 轮换、地理路由(geoCode),可绕过验证码和反爬机制
  • 灵活执行模式:支持单次 AI 采集、配置复用重跑、批量 URL 重跑、手动工作流重跑四种方式
  • 全量结果管理:分页查询历史结果、按 ID 获取详情,支持时间范围筛选

显著优点

  • 零代码门槛:自然语言指令替代传统 XPath/CSS 选择器,降低采集脚本编写成本
  • 高可用基础设施:云端执行无需本地浏览器依赖,自动处理代理轮换和请求重试
  • 多场景适配:产品页、列表页、整站地图爬取均有专用 Agent,深度与广度可配置(maxDepthmaxPageslimit
  • 安全合规设计:API Token 采用 Header/Query 双模式认证,文档明确禁止客户端暴露密钥

潜在局限与风险

| 维度 | 说明 |
|------|------|
| **成本不可控** | AI Agent 按 token 计费,复杂页面或大批量采集可能产生高额费用;未找到单价透明度说明 |
| **结果稳定性** | LLM 解析存在幻觉风险,关键字段建议人工校验;`map` Agent 的爬取边界依赖正则配置,配置不当易超爬 |
| **平台锁定** | 数据留存于 MrScraper 云端(`dataPath`、`htmlPath`),导出机制依赖 API 拉取,长期归档需自建管道 |
| **速率限制** | `429` 错误需指数退避重试,高并发场景需自行实现队列控制 |
| **地理覆盖盲区** | 文档仅提及 `SG` 等 geoCode 示例,实际支持区域需联系支持确认 |

适用人群

  • 需要快速获取竞品价格、商品详情、招聘列表等结构化数据的分析师与运营团队
  • 缺乏专用爬虫基础设施、希望外包反爬对抗的技术团队
  • 需要周期性监控网站变更的合规风控与舆情监测场景

常规安全建议

  • MRSCRAPER_API_TOKEN 存放于服务端环境变量,禁止注入前端或日志输出
  • map Agent 的 includePatterns/excludePatterns 做严格正则测试,避免爬取敏感路径或无限循环
  • 采集个人数据前确认目标站点的 robots.txt 及法律条款,防范合规风险
  • 关键业务数据建议双写本地存储,避免云端结果过期或账号异常导致数据丢失

MrScraper 内容

手动下载zip · 5.7 kB
SKILL.mdtext/markdown
请选择文件