Amazon Scraper

🕷️ Amazon专业爬虫 · 绕过检测 · 选品利器

数据采集榜 #10

Docker化Amazon专业爬虫,基于Playwright Stealth绕过反爬,支持BSR榜单、搜索页、产品详情抓取及通用网页采集

收藏
6.5k
安装
2.3k
版本
3.4.0
CLS 安全性认证2026-07-01
点击查看完整报告 >

使用说明

核心用法

Amazon Scraper 是面向电商数据采集的容器化爬虫方案,基于 playwright-extra + Stealth 插件构建,专为绕过亚马逊反爬检测优化。系统提供两种工作模式:

Amazon模式

自动识别三类页面并提取差异化字段:

  • 畅销榜/新品榜/飙升榜 (/gp/bestsellers/等):获取排名、ASIN、价格、评分等,但不含月销量
  • 搜索结果页 (/s?k=): 包含关键字段 boughtPastMonth(月销量),支持 sponsored 标记识别
  • 产品详情页 (/dp/ASIN): 最全数据覆盖,含BSR、品牌、卖点 bullets、上架时间、类目等

通用模式

支持任意动态网页的纯文本提取,自动等待JS渲染,输出上限10000字符。

显著优点

  • 开箱即用: 一键 setup.sh 构建镜像,Docker隔离无需配置本地浏览器
  • 反爬能力强: Stealth插件深度修改headless指纹,配合代理轮询有效分散请求
  • 数据字段完整: 针对电商场景优化,支持月销量、BSR等亚马逊特有指标
  • 多代理容错: 支持单代理或多代理轮询,自动故障切换

潜在局限

  • 冷启动开销: 容器启动约15秒(含浏览器初始化)
  • 单页容量有限: Amazon单页约30-50产品,大量数据需分页爬取
  • 登录态不支持: 无法采集需要登录的页面(如亚马逊后台)
  • 反爬对抗风险: 亚马逊检测策略持续升级,高频率爬取仍可能触发验证

适合人群

跨境电商运营、亚马逊卖家、选品分析师、市场研究人员、竞品调研团队

常规风险

  • 高频爬取可能导致IP被封,需配合代理池使用
  • 数据采集需遵守目标网站ToS及当地法律法规
  • Docker镜像占用约2GB磁盘空间

安全解读

核心功能

Amazon Scraper 是一款面向电商数据分析师和跨境卖家的专业级爬虫工具,采用 Docker 容器化部署方案,基于 playwright-extra + puppeteer-extra-plugin-stealth 技术栈构建,核心优势在于对 Amazon 反爬机制的深度适配。

三大采集模式:

| 模式 | 适用场景 | 核心数据 |
|:---|:---|:---|
| **Best Sellers 畅销榜** | 类目排名分析、选品趋势 | rank, title, ASIN, price, rating, reviews |
| **搜索页** | 关键词调研、销量估算 | boughtPastMonth(月销量), sponsored, price |
| **产品详情页** | 单品深度分析 | BSR, brand, bullets, details, 完整属性 |

技术亮点:

  • 自动识别 Amazon 页面类型,智能路由处理
  • 支持多代理轮询(AMAZON_PROXIES),每页自动切换 IP 分散风险
  • Stealth 插件深度伪造浏览器指纹(WebGL、Canvas、navigator 等)
  • 通用模式可扩展至任意动态网页(非登录页)

显著优点

1. 反爬能力行业领先:Chrome 123 真实 UA + 完整指纹头 + 1920x1080 视口,自动滚动触发懒加载
2. 数据维度完整:独家获取 boughtPastMonth 月销量字段,这是多数开源爬虫无法拿到的关键指标

3. 部署极简:单条 setup.sh 完成镜像构建,无需复杂 Node.js 环境配置

4. 输出标准化:统一 JSON 格式,含 status/type/category/totalProducts/scrapedAt 元信息

局限与风险

| 限制 | 说明 |
|:---|:---|
| **冷启动延迟** | Docker 容器启动约 15 秒(含 Stealth 插件初始化)|
| **单页容量** | Amazon 单页最多 30-50 个产品,需分页处理 |
| **通用模式截断** | 非 Amazon 网站输出上限 10,000 字符 |
| **登录墙屏障** | 不支持需要 Amazon 账号登录的页面(如订单数据)|
| **合规风险** | 爬取行为可能违反 Amazon ToS,存在 IP 封禁风险 |

适合人群

  • 跨境电商运营:监控竞品价格、销量、评论变化
  • 选品分析师:挖掘 BSR 榜单趋势,验证品类机会
  • 市场研究员:批量采集公开产品数据生成报告
  • 开发者:需要稳定绕过反爬的动态网页采集基础设施

常规风险管控建议

  • 代理必配:生产环境务必配置 AMAZON_PROXIES 轮换池,避免单 IP 高频请求
  • 频率控制:建议单 IP 请求间隔 > 3 秒,日请求量控制在合理范围
  • 数据分离:输出目录 ~/scrapes 独立挂载,避免容器内数据丢失
  • 法律合规:仅限采集公开可见数据,禁止爬取用户隐私或登录后内容

Amazon Scraper 内容

assets文件夹
scripts文件夹
手动下载zip · 12.6 kB
amazon_handler.jstext/javascript
请选择文件