Amazon Scraper

🕷️ 亚马逊数据采集与竞品分析利器

数据采集榜 #11

专业级 Docker 容器化爬虫,基于 Playwright 和 Crawlee 实现亚马逊 BSR、月销量、竞品数据的高效采集,同时支持通用动态网页抓取。

收藏
5.8k
安装
2.3k
版本
3.3.0
CLS 安全性认证2026-06-23
点击查看完整报告 >

使用说明

核心功能

Amazon Scraper 是一个基于 Docker 容器化的高性能爬虫系统,专为亚马逊数据采集优化,同时支持通用动态网页抓取。技术栈采用 Crawlee + Playwright,能够模拟真实浏览器行为,处理 JavaScript 动态渲染页面。

三大模式

1. Amazon 畅销榜模式/zgbs/):抓取品类 Top 排名、评分、评论数,适合选品调研和市场概览。注意:榜单页不包含月销量数据

2. Amazon 搜索/详情模式:通过搜索 URL(/s?k=)或产品详情页(/dp/)获取 boughtPastMonth 月销量数据,是竞品分析和销量验证的核心工具。

3. 通用模式main_handler.js):支持任意动态网页的纯文本提取,输出上限 10,000 字符,适合内容摘要和非 Amazon 网站的数据采集。

显著优势

  • 反爬设计完善:每次请求清除 Cookie、Docker 沙箱隔离、Playwright 模拟真实浏览器行为,配合自动重试机制
  • 字段覆盖全面:产品详情页可获取 BSR、品牌、卖点、类目、上架时间等 15+ 字段
  • 架构轻量:单容器部署,一键构建脚本降低使用门槛
  • 多页支持:可通过 --pages 参数实现分页爬取

局限性与风险

  • Amazon 数据约束:月销量仅存在于搜索页和详情页,榜单页缺失;单页最多 30-50 条产品,大规模采集需分页
  • 技术门槛:依赖 Docker 环境(~2GB 磁盘 + 2GB 内存),容器冷启动约 10 秒
  • 合规边界:不支持登录态页面,需遵守目标网站 robots.txt 和 rate limit
  • 输出限制:通用模式 10,000 字符上限,长文需分段处理

适用人群

  • 电商运营/选品人员:调研品类机会、验证竞品销量、分析价格带
  • 数据分析师:获取结构化 Amazon 数据用于市场研究
  • 产品经理:跟踪新品趋势、监控飙升榜单
  • 开发者:需要轻量级、可部署的爬虫基础设施

常规风险提示

| 风险类型 | 说明 |
|---------|------|
| 法律合规 | 需遵守 Amazon 服务条款,禁止用于大规模商业监控 |
| 数据准确性 | 月销量为区间估算(如 "1K+"),非精确数值 |
| 稳定性 | 目标网站结构变更可能导致字段解析失败 |
| 频率控制 | 建议合理控制请求频率,避免 IP 受限 |

安全解读

核心用法

Amazon Scraper 是一款容器化高性能爬虫工具,专为亚马逊电商数据采集场景设计,同时扩展支持通用动态网页抓取。用户通过Docker环境运行预构建镜像,无需配置复杂依赖即可快速启动。

双模式架构

  • Amazon模式amazon_handler.js):智能识别亚马逊页面类型,自动适配Best Sellers畅销榜、New Releases新品榜、Movers & Shakers飙升榜、搜索结果页及产品详情页五种场景,输出结构化JSON数据
  • 通用模式main_handler.js):针对任意动态网页,使用Playwright等待JS渲染完成后提取正文内容,适合新闻、博客等非结构化数据采集

关键字段覆盖:ASIN、价格、评分、评论数、月销量(boughtPastMonth)、BSR排名、品牌信息、产品卖点、类目层级等电商核心指标。

---

显著优点

1. 开箱即用:一键构建脚本自动完成镜像编译与环境配置,10秒冷启动后即可投入采集
2. 反爬能力强:集成Playwright Stealth插件清除浏览器指纹,Docker沙箱隔离Cookie,每次请求模拟全新用户

3. 数据完整性高:自动滚动加载懒内容,支持多页爬取(--pages参数),单任务可采集数百条产品数据

4. 场景覆盖全:从宏观市场洞察(Top 100榜单)到微观竞品剖析(单个ASIN详情),满足选品全流程需求

5. 输出标准化:统一JSON格式,包含元数据(采集时间、页面类型、总数量)便于后续分析入库

---

潜在缺点与局限性

| 维度 | 具体限制 |
|------|---------|
| **数据边界** | Best Sellers页面不提供月销量字段;需通过搜索页或详情页补全 |
| **规模约束** | 单页上限30-50产品,大规模采集需分页策略;通用模式输出上限10,000字符 |
| **认证壁垒** | 不支持需要登录的页面(如亚马逊买家账户、Seller Central后台) |
| **性能成本** | Playwright启动消耗~2GB内存,高频采集对硬件资源要求较高 |
| **合规风险** | 使用Stealth反检测技术可能违反目标网站服务条款 |

---

适合人群

  • 跨境电商卖家:进行品类调研、竞品监控、定价策略制定
  • 电商数据分析师:构建市场趋势数据库,分析BSR波动与销量关联
  • 产品经理/选品专员:验证产品概念,评估市场饱和度与机会空间
  • 开发者:需要快速原型验证或作为数据管道组件集成到更大的BI系统

---

常规风险提示

1. 法律合规:爬取前务必查阅目标网站robots.txt及用户协议,亚马逊明确禁止未经授权的自动化数据提取
2. IP封禁:高频请求可能导致IP被列入黑名单,建议配合代理池与请求频率控制(当前内置2-3秒延迟)

3. 数据准确性:网页结构变更可能导致字段解析失败,需持续关注维护更新

4. 依赖稳定性:由个人开发者维护(T3级别),长期支持存在不确定性,生产环境建议Fork后自主维护

Amazon Scraper 内容

assets文件夹
scripts文件夹
手动下载zip · 9.0 kB
amazon_handler.jstext/javascript
请选择文件